ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AI Agent技能质量如何保证:NotFair的LLM-as-Judge评估与E2E路由测试体系全解析

AI Agent技能质量如何保证:NotFair的LLM-as-Judge评估与E2E路由测试体系全解析 AI Agent技能质量如何保证NotFair的LLM-as-Judge评估与E2E路由测试体系全解析【免费下载链接】notfair-pluginOpen-source SEO, GEO, and marketing skills for AI agents.项目地址: https://gitcode.com/gh_mirrors/to/notfair-pluginNotFair Plugin 是一个开源的 SEO、GEO 与营销技能插件包为 Claude Code、Codex 等 AI Agent 提供 48 个可执行技能。它的独特之处在于每个技能SKILL.md都配套了一套可量化、可复现的质量保障体系——用 LLM-as-Judge 给文档质量打分用 E2E 路由测试验证技能会不会被正确触发。本文带你完整了解这套 Agent 技能质量评估机制。一、为什么 AI Agent 技能需要质量评估普通软件测试看功能是否跑通而AI Agent 技能本质是一份给模型阅读的操作手册SKILL.md要回答三个更难的问题文档够不够清楚模型读完指令后是否知道该调哪些脚本、传什么参数、输出长什么样技能会不会被错误触发用户问CSS 布局坏了SEO 审计技能是不是不该跳出来产出物质量如何跑完一整轮 SEO 审计生成的报告有没有Quick Wins、建议是否具体可执行NotFair 针对这三层问题构建了三个测试层级llm-judge文档质量、e2e完整执行、routing路由触发全部放在 test/ 目录中。二、LLM-as-Judge让 AI 给技能文档打分三维评分标准清晰度、完整度、可执行性核心实现在 test/helpers/llm_judge.py。它用便宜的 Gemini Flash 模型gemini-2.0-flash、temperature0.0充当评审对技能文档的每个章节按 1-5 分打分维度考察点及格线clarity 清晰度Agent 能否仅凭描述理解每一步在做什么≥ 4completeness 完整度命令、参数、预期行为是否都有文档记录≥ 4actionability 可执行性Agent 能否不追问就直接正确执行≥ 4评审提示词定义在 judge() 函数强制模型只返回 JSON并附一句reasoning解释扣分原因——失败时一眼就能看出问题在哪。报告质量也有专属评审除了评文档NotFair 还评产出。seo_report_judge()会检查 Agent 生成的 SEO 报告是否满足四项硬指标llm_judge.py✅ 包含带具体 URL 和查询词的Quick Wins区块✅ 建议具体可执行而非提升你的 SEO这类空话✅ 含 30 天行动计划✅ 至少一条建议量化了预期影响如预计点击增长一次完整跑 LLM-judge 套件成本仅约$0.05门槛低到可以在每次修改文档后随手运行。三、E2E 路由测试技能会不会被叫错名这是整套体系中最巧妙的部分。路由测试test/test_skill_routing_e2e.py验证的不是技能能不能干活而是技能的 description 写得够不够精准——因为它决定了 Agent 何时加载这个技能。正反两组提示词对照测试定义了 SHOULD_TRIGGER 与 SHOULD_NOT_TRIGGER 两组真实用户话术应触发 ✅不应触发 ❌网站流量上月掉了 40%帮我查原因CSS Grid 在移动端布局错位帮我做一次 SEO 审计优化一个 200 万行表的 SQL 查询我想看 Google 里排名靠前的关键词帮我写一篇远程团队项目管理博客判定方式不靠模型自我报告如何判断技能真的被调用了NotFair 使用特征标记法检查输出中是否出现phase 1、quick wins、analyze_gsc等 SEO 流程专属词汇或 Agent 是否真的调用了analyze_gsc脚本。此外还有一个防御性设计——超时/崩溃等 harness 故障绝不允许静默通过不应触发用例test_skill_routing_e2e.py避免测试没跑起来 通过的假阳性。四、E2E 执行测试用 Mock 数据跑完整工作流真正的端到端测试在 test/test_skill_e2e.py。它通过 session_runner.py 以子进程方式启动claude -p解析stream-json输出完整记录工具调用链、轮次、耗时与费用。关键设计是零真实凭证测试夹具 test/fixtures/ 提供了mock-gcloud.sh和sample_gsc_data.json把真实的 Google 数据拉取替换为确定性的模拟数据Agent 就能走完整 6 个阶段的 SEO 审计且每次结果可复现。五、省钱的巧思基于 Git Diff 的测试选择LLM 测试不是免费的NotFair 用 test/helpers/touchfiles.py 实现了差异触发每个测试声明自己依赖哪些文件如路由测试只依赖skills/seo-analysis/SKILL.md运行时对比基线分支的 diff只有相关文件被改过才执行该测试。修改了 Ads 技能SEO 的评估就自动跳过——测试成本与实际改动精准挂钩。六、结果持久化每次评估都留下体检报告所有层级共用 test/helpers/eval_store.py 的结果收集器在进程退出时把本次评估写入~/.toprank-evals/文件名包含版本号、分支、git SHA 和时间戳JSON 内容记录每个用例的通过状态、耗时、花费、评审分数与推理过程并在终端打印一张汇总表格。这让技能质量像性能指标一样可以随版本演进被追踪和对比。此外还有一层免费的静态守卫test/unit/test_skill_descriptions.py 无需任何 API Key直接检查全部技能的 description 是否超过 1024 字符上限、以及各模型封装层与源文档是否保持同步——描述超长的技能会挤占 Agent 的上下文这是最便宜的质量防线。七、这套体系给开源 Agent 项目的启示NotFair 的做法可以总结为一句话把技能质量从玄学变成工程。文档质量可打分LLM-as-Judge 用三维 1-5 分制让SKILL.md的每次改动都有回归信号触发行为可验证正/反提示词对照 特征标记检测杜绝技能误触发与漏触发测试成本可控Mock 数据零凭证、diff 选择按需执行、廉价模型当评审结果可追溯JSON 持久化 git SHA 绑定质量随版本可比。如果你正在为 AI Agent 编写技能这套 test/ 下的方案评审器、会话运行器、diff 选择器、结果收集器是非常值得借鉴的起点。更多技能文档见 skills/ 与 seo/seo-analysis/SKILL.md项目概览参考 README.md。【免费下载链接】notfair-pluginOpen-source SEO, GEO, and marketing skills for AI agents.项目地址: https://gitcode.com/gh_mirrors/to/notfair-plugin创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表