
如何复现并验证SimpleEnglish的基准数据面向开发者的诚实Benchmark完全教程【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglishSimpleEnglish 是一个 Agent skill让大语言模型按 ASD-STE100 简化技术英语STE规范写文档。它的核心卖点是一组可复现的 Benchmark 数据开启 skill 后每百词 STE 违规数平均下降 74.6%7 个 Claude 模型 × 8 个写作任务共 112 次生成。本教程带你从零复现这些数据无需 API Key只需登录的 Claude Code CLI即使只想验证数据一条命令 30 秒搞定。动手前先看懂112 次生成在测什么复现之前先理解这套 benchmark 的设计才能判断结果是否可信组成内容文件模型7 个 Claude 模型opus-5 到 sonnet-4-6定义在 evals/run_bench.py 的MODELS任务8 个写作场景README 简介、快速上手、故障排查、错误消息、事故报告、发布说明、runbook 压缩、架构说明evals/scenarios.json条件每个任务跑两遍baseline无 skill和skill把 SKILL.md 全文注入 prompt同上评分器确定性正则 linter数句子超长、缩写词、禁用情态动词、slop 词汇等 12 类违规evals/ste_lint.py全部 8 个场景都围绕同一个虚构工具 sqlpipePostgres 同步到 S3 的 CLI保证 baseline 与 skill 两组输出面对完全相同的输入。环境准备3 项检查清单✅需要Python 3评分器纯标准库无第三方依赖Claude Code CLI 并已登录claude --version能输出即可仓库代码git clone https://gitcode.com/gh_mirrors/si/SimpleEnglish cd SimpleEnglish✅不需要API Key、付费额度之外的额外配置。先花 5 秒确认 linter 自检通过后面所有数字才有意义python3 evals/ste_lint.py --self-test三步命令复现 74.6% 的完整流程第 1 步冒烟测试1 个模型 × 2 个场景python3 evals/run_bench.py --smoke这条命令只跑claude-sonnet-4-6的前两个场景几十秒出结果用来确认 CLI 登录态和参数没问题。第 2 步完整矩阵7 模型 × 8 任务 × 2 条件 112 次生成python3 evals/run_bench.py几个值得注意的工程细节都写在 evals/run_bench.py 头部注释里可断点续跑evals/results/raw/下已存在的结果文件会自动跳过中断后重跑即可推理力度锁定low避免继承你本地配置的effortLevel每个 raw 文件都会记录实际用的力度每次调用禁用所有工具Bash、Read、WebFetch 等保证输出只来自语言模型本身。第 3 步只从原始数据重建报告不调用任何模型python3 evals/run_bench.py --report-only它扫描evals/results/raw/全部 JSON重新聚合出 evals/results/RESULTS.md 和 evals/results/results.json。这正是验证而非重跑的关键README 里的每一个数字都能从提交的 raw 文件复算出来。零成本验证直接给已提交的 raw 文件打分仓库里已提交 168 个 raw 文件112 个生成 56 个裁判打分你甚至不必调用任何模型就能验证公开数字# 重算主 benchmark 表格 python3 evals/run_bench.py --report-only # 重算其他 harness 的表格如 OpenAI API 的 gpt-4.1-mini降幅 95.8% python3 evals/score_text_dir.py evals/results/openai-2026-09-01/raw打分工具 evals/score_text_dir.py 会自动按文件名解析模型/条件/场景输出与 evals/results/openai-2026-09-01/RESULTS.md、evals/results/pi-2026-07-31/RESULTS.md 一致的表格。盲测裁判45/56 胜局是怎么来的除了硬性违规计数项目还跑了一轮盲测 pairwise 裁判evals/run_bench.py 的judge()函数python3 evals/run_bench.py --judge方法裁判模型claude-opus-4-8对每组 baseline/skill 文本按 0–10 分细则打分两种文本顺序各打一次再取平均消除位置偏差裁判看不到任何标签。最终 skill 输出在 56 组中胜出 45 组、平 5 组、输 6 组平均 8.12 分对 6.04 分。想复现时用自定义力度或输出目录python3 evals/run_bench.py --effort high # 覆盖锁定的 low 力度 python3 evals/run_bench.py --results-dir /tmp/r2 # 结果写到别处避免污染 raw/怎么读这些数字4 个诚实的 caveat结果报告 evals/results/RESULTS.md 专门有一节 Honest number warnings值得原样读一遍linter 是正则不是语法分析器查不出被动语态和词性问题绝对值偏低但两组用同一把尺子相对降幅依然公平skill 条件输入 token 更多因为 SKILL.md 全文进了 prompt所以报告的是输出 token7 个模型全部下降每格只生成一次想看方差就整矩阵重跑runner 可续跑删掉results/raw即可重来力度敏感同一批场景claude-opus-5 在low力度下是 85.0%xhigh下是 90.2%——比较结果前先确认effort一致。核心结论一句话74.6% 是用确定性 linter 在同一任务集上测得的均值最低的是 claude-opus-4-841%最高的 gpt-4.1-mini95.8%OpenAI API 通道。完整模型表见 evals/results/RESULTS.md。复现常见问题 FAQQ数字和我跑的不完全一样正常。每格一次生成语言模型有随机性项目文档也明确建议重跑矩阵看方差。对比的是量级与方向。Q我只想手工体验 skill 效果安装 skill 后新开会话粘贴 evals/scenarios.json 里任意一条 prompt再用 evals/pressure-tests.md 里的清单人工打分即可。Qskill 本体在哪里看53 条编号规则、Pragmatic/Strict 两种模式都在 skills/simple-english/SKILL.md配套词表在 skills/simple-english/references/word-swaps.md。按以上流程走完你就完整复现并独立验证了 SimpleEnglish 公开的全部 benchmark 数据——从 112 次生成到盲测裁判每一步都可从提交文件重算这正是诚实 benchmark的含义。【免费下载链接】SimpleEnglishAgent skill: make LLMs write docs in ASD-STE100 Simplified Technical项目地址: https://gitcode.com/gh_mirrors/si/SimpleEnglish创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考