ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Codex Autoresearch 的 7 个确认值一次讲清:目标、范围、度量与护栏完全指南

Codex Autoresearch 的 7 个确认值一次讲清:目标、范围、度量与护栏完全指南 Codex Autoresearch 的 7 个确认值一次讲清目标、范围、度量与护栏完全指南【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearchCodex Autoresearch是面向 OpenAI Codex 的开源 Skill把修好测试、消除类型错误、降低延迟这类仓库级目标变成一个可度量的自主迭代循环Codex 每次只改一处用数字指标验证改进就保留、失败就回滚反复循环直到达标。在写下第一行代码之前它会把7 个确认值列出来请你逐项确认——本文一次讲清它们分别是什么、为什么必须确认。 为什么要先确认再动手自主迭代意味着 Codex 可能在无人值守下跑几十轮。如果目标含糊或边界不清跑偏的成本会成倍放大。所以 Autoresearch 规定写任何文件、初始化、启动控制器之前必须先展示一份简洁的确认清单等你明确批准比如回复 Go才动手确认后这 7 个值被锁定为不可变配置autoresearch-results/run.json运行中不会悄悄改变每个试验都是一次 Git 提交失败的试验用git revert回滚全程留痕可追溯。简单说确认清单就是给自主实验划好的跑道。 7 个确认值一次讲清#确认值它决定什么例子1Goal 目标要达成什么结果消除类型错误2Scope 范围允许修改哪些文件src、tests/types3Metric 度量盯哪一个数字类型错误数量4Direction 方向哪个方向算更好lower越小越好5Verify 验证命令怎么测出这个数字python3 scripts/score.py6Target 目标值数字到多少算完成07Guard 护栏除指标外还要守住什么npm test1️⃣ Goal目标描述结果而不是方案用一句大白话说清想要什么结果例如把src下的错误数降到 0。官方指南特别强调给结果不给实现方案——实现策略是 Codex 在循环里自己迭代出来的你只需要定义终点。2️⃣ Scope范围它能动哪里仓库相对路径的文件或目录前缀例如src而不是src/**/*.ts不支持通配符。范围就是硬边界一旦检测到越界修改运行会立刻停止报错而不是悄悄放行。3️⃣ Metric度量实验的温度计整个运行只用一个数字指标来判断好坏。它必须可重复测量——适合做度量的包括失败用例数、类型错误数、分支覆盖率、p95 延迟、二进制体积、可复现的安全问题数等。4️⃣ Direction方向哪个方向算进步只有两个取值lower越小越好或higher越大越好。错误数选 lower覆盖率选 higher。方向错了改进和变差就会完全颠倒。5️⃣ Verify验证命令怎么测出这个数字度量必须靠一条命令输出且有两条硬性契约测量成功时退出码必须为 0——哪怕当前数字很难看测到了 30 个错误本身也算测量成功stdout 最后一行非空内容必须是一个有限数字或一个 JSON 对象此时需显式指定取哪个数值键如error_count。如果测试命令失败就非零退出它更适合作为 Guard而不是度量命令。6️⃣ Target目标值到多少才算完成一个数字代表可以收工了。例如错误数降到0、覆盖率提到90。只有当保留下来的指标值真正到达目标值运行才会报告complete——中途的数字波动不算数。7️⃣ Guard护栏指标之外还要守住什么可选但强烈推荐。Guard 是通过/失败二值检查看退出码用来保护指标覆盖不到的行为。经典搭配Verify: python3 scripts/score.py - 只看 error_count 是否下降 Guard: python3 -m pytest -q - 保证现有测试不被改坏两个关键规则Guard必须在基线上就通过指标下降但 Guard 失败该次试验照样回滚。护栏宁可拦掉一次疑似改进也不允许悄悄破坏已有行为。⚙️ 顺带确认两件事怎么跑、跑多久确认清单里还有两个可选设置运行模式前台foreground留在当前 Codex 任务里可实时观察和引导后台background启动独立控制器适合长时间或过夜运行默认 Full Access 权限因为每轮迭代都要提交和回滚 Git迭代上限可选给循环兜底防止无限试错。 确认之后自主循环如何运转你批准后循环就按固定节拍转起来观察证据 - 只改一个假设 - finish自动提交试验 跑度量和护栏 - 改进且护栏通过保留该提交 - 否则git revert 回滚 - 追加审计事件 - 重复直到达到目标状态全部落在autoresearch-results/目录run.json是不可变配置events.jsonl是只追加的历史。任何缺失、矛盾或格式错误的状态都直接报错停止——系统从不靠猜恢复结果这正是长时间自主运行可以信任的原因。跑完后用一句 generate an HTML report 就能生成带指标曲线、保留/丢弃时间线和提交记录的可视化报告 快速参考完整配置、生命周期与排错docs/GUIDE.md现成的提示词与度量模式覆盖率、延迟、体积等docs/EXAMPLES.mdSkill 主契约与实验循环规则SKILL.md实验契约测量规则、Git 边界、失败语义references/experiment.md控制脚本入口scripts/autoresearch.py安装与验证步骤docs/INSTALL.md【免费下载链接】codex-autoresearchCodex Autoresearch Skill — A self-directed iterative system for Codex that continuously cycles through: modify, verify, retain or discard, and repeat indefinitely. Inspired by Karpathy’s autoresearch concept.项目地址: https://gitcode.com/gh_mirrors/co/codex-autoresearch创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表