ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

三步接入你自己的任务:LLM-as-a-Verifier自定义Benchmark适配完全指南

三步接入你自己的任务:LLM-as-a-Verifier自定义Benchmark适配完全指南 三步接入你自己的任务LLM-as-a-Verifier自定义Benchmark适配完全指南【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifierLLM-as-a-Verifier 是一个通用的Agent 轨迹验证框架无需任何额外训练它就能对任意 Agent 任务的候选轨迹给出细粒度评分在编码、机器人、医疗等 Agent 基准上均达到 SOTA 表现。更友好的是官方把接入你自己的任务精简成了3 步—— 放数据、改命名、交给 AI 编码代理跑通。本文将带你从零走通自定义 Benchmark 适配的完整路径。接入前 2 分钟先认识框架的三个角色 LLM-as-a-Verifier 的核心理念很简单与其让大模型当裁判只给一个笼统结论不如让它沿着一组**验证标准Criteria逐条打分取分数分布的期望作为细粒度奖励再用枢轴锦标赛Pivot Tournament**以 O(Nk) 的比较成本对 N 条轨迹排序选出最优的一条。接入你的任务时你只需要提供三样东西角色文件位置说明 轨迹数据data/任务名_trajs/任务提示 各候选轨迹 成功/失败标签 验证标准criteria/任务名.md2-3 条陌生人也能照着打分的标准⚙️ 运行脚本adapt_run.py加载数据并调用llm_verifier.select()输出排名 仓库中已有现成范例可以参考criteria/terminal_bench.md、criteria/swe_bench.md以及 data/terminal_bench_2.0_trajs/ 下的数据布局。三步接入官方推荐的完整流程 官方适配指南写在 add_new_benchmark.md 中整个流程只有三步第一步添加你的数据Add your data把你的 Agent 轨迹复制到data/task_name_trajs/目录。每条轨迹应包含三部分信息任务/问题提示problem prompt各候选轨迹candidate trajectories真实奖励标签success / failure——用于事后核对验证器选得准不准第二步更新命名Update naming打开 add_new_benchmark.md把其中所有的task_name占位符替换成你的任务名。这一步看似简单但它决定了后续生成的标准文件、运行脚本、结果文件名是否一致。第三步启动 AI 编码代理执行Spin up Claude Code在仓库中启动 Claude Code或 Codex 等任何 AI 编码工具建议关闭文件写入权限把add_new_benchmark.md的全部内容粘贴给它。它会按指南自动完成五件事熟悉现状阅读 README检查你的数据目录布局生成标准按 criteria/TEMPLATE.md 的格式写出criteria/task_name.md编写运行器创建adapt_run.py加载轨迹并调用llm_verifier.select()检查凭证确认.env中有 API Key评分是真实 API 调用如VERTEX_API_KEY跑起来执行python adapt_run.py报告被选中的轨迹、各轨迹得分、以及选择是否正确核心调用看起来非常简洁result llm_verifier.select( problem, trajectories, criteriatask_name, n_evaluations8, # 每条标准的重复验证次数 K pivots2, # 枢轴数量 k控制成本与精度 ) print(result.index, result.scores)运行后把选中的索引、逐轨迹得分、是否选对、以及所用配置写入results/task_name.txt就完成了一次完整的自定义 Benchmark 适配 ✅写好验证标准的关键技巧 ✍️criteria/任务名.md是整个框架的灵魂官方模板 criteria/TEMPLATE.md 明确要求保留如下结构## Ground Truth Note一段每次比较都会看到的提示比如不要相信 Agent 的自我评估以工具原始输出为准## Criteria下接若干### 标准名小节每条标准一段可独立执行的打分说明几条来自模板的实战建议2-4 条窄标准胜过 1 条宽标准——每条标准独立评分写清楚去哪里看证据哪些命令、字段、文件、输出写清楚什么该得高分、什么该得低分以及要忽略什么防止标准之间串味避免标签泄漏标准应评估轨迹中可观测的行为而非直接暗示答案标准文件写完后无需任何 API Key 即可预览验证器将看到的内容python -m llm_verifier criteria/your_task.md这个预览功能实现在 llm_verifier/prompts.py 中能帮你快速检查标准是否被正确解析。进阶把你的任务注册进 Benchmark 注册表 如果希望像内置基准一样用命令行一键复现可以在 llm_verifier/benchmarks.py 的BENCHMARKS注册表中加一个条目声明数据路径、标准文件、评分缓存位置等参数。若你的数据格式与内置布局不同再往 llm_verifier/loaders.py 里加一个加载器——每个加载器把数据解析为任务 ID → 多次试验列表的映射即可。注册完成后一条命令即可运行python scripts/run.py your_task python scripts/run.py your_task --pivots 2 --n-evaluations 8 --seed 0运行报告Pass1 vs 验证器 vs Oracle会自动打印并写入results/目录入口脚本见 scripts/run.py。验证是怎么排名的理解枢轴锦标赛 朴素的全员循环赛需要比较 C(N,2) 对轨迹成本是 O(N²)。LLM-as-a-Verifier 的**概率枢轴锦标赛PPT**分四步把成本压到 O(Nk)环形轮随机排序后相邻配对打分每个候选在 A/B 槽位各出现一次抵消位置偏差选枢轴按环轮得分取前 k 名作为枢轴枢轴轮非枢轴只与枢轴比较重复比较时互换 A/B 槽位聚合选择累加各候选的胜场质量返回归一化得分最高者pivots参数即在此处权衡成本与精度枢轴越多比较次数越多排名越准。实现位于 llm_verifier/pivot_tournament.py。接入之后你还能做什么自定义任务跑通只是开始。同一套细粒度奖励还可以驱动进度追踪——逐步给轨迹打分实时观察 Agent 是在推进还是在绕圈甚至在中途放弃毫无希望的运行。官方用 Terminal-Bench 的pytorch-model-cli任务演示过这种对比如上图成功轨迹的验证分数稳步爬升而失败轨迹因错误行为始终分数偏低——这正是细粒度反馈相比0/1 判定的价值所在。常见问题速答 ❓Q需要准备多少条轨迹每任务多条内置基准普遍是 3-5 条Best-of-N 选择才有意义若只有单条轨迹更适合用进度追踪模式。Q需要训练或微调验证器吗不需要。框架的核心卖点就是零训练依赖现成模型的 logprob 分布完成细粒度评分只需在.env中配置对应后端的 API Key。Q评分要花多少 Token每次比较会携带两条完整轨迹大任务可达数万 Token但 0.2.0 版本起内置前缀缓存优化可将未缓存输入 Token 减少约 3.4 倍运行结束后llm_verifier.token_usage()会给出精确账单详见 CHANGELOG.md。总结一张清单带走全文 ✅安装pip install llm-verifier或克隆仓库后pip install -e .轨迹放入data/任务名_trajs/含提示、轨迹、成败标签替换 add_new_benchmark.md 中的task_name交给 AI 编码代理生成标准文件 运行脚本配置.env凭证运行并核对选择结果可选注册进llm_verifier/benchmarks.py用scripts/run.py一键复现三步接入、零训练、细粒度反馈——这就是 LLM-as-a-Verifier 让任意任务可验证的完整路径。现在轮到你自己的任务了 【免费下载链接】llm-as-a-verifierLLM-as-a-Verifier is a general-purpose framework that provides fine-grained feedback for any agent without requiring additional training. It achieves SOTA performance across coding, robotics, and medical agentic benchmarks.项目地址: https://gitcode.com/gh_mirrors/ll/llm-as-a-verifier创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表