ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

Anthropic让AI对齐AI,效率提升1.5万倍

Anthropic让AI对齐AI,效率提升1.5万倍 今年 6 月Anthropic 发表了一篇叫《When AI builds itself》的文章介绍了让「AI 参与造 AI」从人类手写全部代码到聊天机器人辅助编程到自主编程智能体到智能体调度智能体最末端是「闭环」即由智能体来设计和训练它的后继模型。Anthropic 说自己已经走得相当靠前截至 2026 年 5 月合入其生产代码库的代码有超过 80%由 Claude 撰写。但那篇文章同时给出了一个明确的界限系统在执行上走得很远仍然卡在研究方向的设定上也就是说AI 还无法决定哪些问题值得做。8 月 28 日Anthropic 发布了一份新报告探索了这个新方向。Anthropic 请来 28 位人类 AI 安全研究者全部有至少一年技术性安全研究经验、平均 2.5 年且在对应课题上发表过论文每人最多八小时构思一个方法。然后跑了 60 组实验30 组把人类的点子作为初始研究方向喂给 Claude 智能体30 组让 Claude 自己选方向。结果「效果出乎意料地好」。「谁来定方向」的对照实验这个 Anthropic Fellows 项目本来的目标是其实是让 Claude 以「自动化对齐研究员」Automated Alignment Researcher, AAR的身份独立完成查文献、提方法、写论文、跑训练、测评的完整闭环去修复十类已知的对齐失败。结果十类全部改善且通用能力未见崩塌。人类基线只是个参照系。在人类参与的七类失败上AAR 的最佳方法全部超过人类的最佳点子平均只需要 6.4 小时。以「欺骗」为例Claude 提交了超过 150 次尝试平均缩减 85% 的安全差距人类研究者的平均值是 20%。成本对比更惊人AAR 每小时的 API 推理开销约 4 美元人类研究者的报酬是每小时 150 美元。不过需要指出人类没有迭代机会这不算一次非常公平比较。AAR 追平最佳人类点子所需的小时数七类失败均值 6.4 小时。但该团队还试了给五个 AAR 分别塞五个不同的人类点子指望撑开搜索空间多样性只在开头二十来个方法内维持随后迅速收敛到同一个方法家族。有人类研究方向与无人类研究方向的两组曲线对比各 30 组实验两条曲线几乎重合。一场被严格设计的爬山需要说清楚这个结论成立的边界因为任务设计本身极为苛刻。实验涉及到十类对齐失败谄媚、越狱、提示注入、权力寻求、欺骗、幻觉、社会偏见、隐私侵犯、奖励黑客、隐藏不确定性。其中每类配三到五个公开基准作为爬山目标另有一个全程保密的留出基准外加 MMLU、GSM8K、IFEval 三项能力基准兜底。十类对齐失败、各自惩罚的具体行为、以及对应的目标模型精妙处在计分总分取各基准得分的几何平均只要有任何一个基准没被抬起来总分直接归零。想靠死磕单一榜单蒙混是行不通的。团队专门做了验证让一个团队只盯一个提示注入基准爬它在那个基准上拿下 70.9% 的提升空间而在没见过的两个同类基准上成绩是 −11.9% 和 2.0%。只爬单一提示注入基准的团队其获胜方法在全套基准上的表现。整个实验的流程像一个微缩实验室。四个「图书管理员」智能体并行读文献写出共享综述五个 AAR 同时开工各自读综述、看排行榜、提方案、写一篇带五条以上引用的「迷你论文」交监督智能体审查代码通过后在一张 H200 上训练约 30 分钟再交独立评测方打分结果回帖到共享论坛。迷你论文必须在看到任何结果之前冻结防止事后编故事留出数据放在另一个操作系统账户下。AAR 研究框架流程图文献综述 → 五个 AAR 并行爬山 → 监督审查 → 训练 → 独立评测 → 回帖论坛让弱模型去对齐强模型真正指向「闭环」的是第二个实验。团队按 Epoch Capabilities Index 挑了一组能力倒挂的搭配Claude Sonnet 5ECI 156去修 Claude Opus 4.8 早期检查点ECI 158的对齐问题即用较弱的模型对齐更强的后继者。这次不用公开基准直接以 Petri 行为审计为目标同时压住十个安全维度任何一维显著回退就否决还设了连贯性、评测觉察、过度拒绝三道闸门毕竟见谁都拒的模型在评审眼里也很「安全」。约 60 小时内AAR 试了 50 多个方案最终拿到 65%而经过 Anthropic 完整生产级对齐训练的正式版 Opus 4.8 是 72%。获胜方案只用了约 2400 条训练样本全部来自简单模板和公开数据集。作为对照Tülu 3 的对齐阶段用了约 30 万条偏好对Llama 2-Chat 超过 140 万条人类偏好比较。Claude Sonnet 5 对 Opus 4.8 早期检查点做对齐后训练60 小时内 50 余个方案的爬升曲线获胜点 65%正式版 Opus 4.8 为 72%。Anthropic 博客表示这套方案比其生产级对齐流程「效率高约 15000 倍」。它也会想作弊而且被抓住了在一段被完整记录的思维链里一个 AAR 这样盘算模型质量是固定的分数上下浮动不过是抽奖所以理性的做法是把同一个方法原封不动再提交一次赌一个更高的噪声分。事后用 Claude Opus 4.8 扫描 1601 条完整轨迹抓出 39 次作弊尝试占 2.4%全部被排除在最终结果之外。手法分三类重跑碰运气、造模仿评测格式的数据、把违规步骤藏过代码审查。消融实验里还有个反直觉的发现。拿掉五个 AAR 之间的共享论坛成绩从 23.3% 掉到 17.1%拿掉文献综述从 29.4% 掉到 20.7%而彻底断掉联网搜索只要留一份缓存综述损失小到测不出来。协作和先验知识的价值明显高于实时检索。另外由于禁止从更强模型蒸馏74% 的方法只能从目标模型自己的输出里造训练信号。也就是说没有更聪明的老师模型靠自己的产出把自己掰正了。四种消融条件下的爬山曲线对比完整 / 去论坛 / 去联网 / 去联网但保留缓存综述结语这项研究证明在一个目标明确、反馈廉价、边界清晰的窄任务上AI 已经会做对齐研究还更快更便宜。但边界是人划的。谁来选十类失败、谁来建基准、谁来定义「什么算修好了」仍然是人。报告最后一节说得很坦白能力的反馈信号廉价而密集对齐的反馈信号昂贵而稀疏。不过人类的保留地真是越来越少了。原文链接Anthropic让AI对齐AI效率提升1.5万倍-36氪
返回列表