
# 没有标准答案也能练推理Co-RL 让一群模型互相打分文本与视觉任务一起涨这篇论文提出一种叫 Co-RL 的多智能体强化学习方法让一群参数互不共享的模型通过「同伴多数投票」互相打伪奖励在没有人工标准答案的环境里练出推理能力并在文本与视觉两类任务上带来一致提升。论文 8 月 18 日提交到 arXiv8 月 19 日更新第二版编号 2608.17253全称是 Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL也就是「多智能体强化学习里无监督推理从多样群体中涌现」。## 一、没有标准答案奖励从哪来强化学习这几年能显著提升大模型的推理能力靠的是「给反馈、再优化」这套循环。模型先做一道题系统判断答案对不对对的奖励、错的惩罚模型再顺着奖励方向调整自己。这套机制在数学、代码这些「答案可以验证」的任务上非常好用因为对错是确定的机器可以自动判断。但问题也随之而来。作者在论文里点破强化学习最强的那些成功案例几乎都依赖「可验证的奖励」也就是需要标准答案来判分。可现实里这类标注成本极高而且随着推理能力往人类难以可靠评估的方向发展标准答案会越来越稀缺。你让模型证明一条新定理或者给一个开放性的商业决策找理由谁来判断它的推导对不对靠人标注成本高得离谱还可能跟不上模型能力进化的速度。这正是「无监督推理」要解决的问题能不能让模型在没有标准答案的环境里自己找到改进的方向。如果这个问题解开了大模型的推理训练就不再被「必须有正确答案」绑住可以往更开放、更需要创造力的任务上延伸。## 二、自我奖励的问题无监督推理最简单的一种思路是「自我奖励」让模型用自己生成的答案给自己打分再按这个分数优化。看起来自给自足但作者指出这条路有几个绕不开的坑。第一是奖励容易坍缩。模型给自己打分很容易「打到最后全给高分」奖励信号失去区分度模型也就失去了改进方向。训练越往后自我奖励的信号越弱最终模型停在原地这就是研究者常说的「训练坍缩」。第二是自己很难挑出自己的错。让一个人检查自己的推导常常看不出毛病在哪模型同理它给自己打的伪奖励和真实质量之间可能有系统性偏差而且这个偏差自己发现不了。自我奖励本质上是「又当运动员又当裁判」裁判不独立信号就不可靠。作者想找的是一个既不需要人工标准答案、又能保持奖励信号可靠的办法。答案藏在一个老概念里让别人来打分。## 三、Co-RL 的机制同伴多数投票Co-RL 的做法是把「自我奖励」升级成「同伴奖励」。系统里同时维护多个模型这些模型参数互不共享各自独立训练。训练时每个模型生成的答案不是自己给自己判分而是拿给其他模型集体判分一群同伴对这个答案投票多数票一致同意的就认为是好答案给这个模型发正奖励同伴普遍不认可的就发负奖励。这就是论文说的「同伴多数投票伪奖励」。它有三个设计上的妙处。第一判分者不是同一个模型独立性保住了。别人给你挑错比自己给自己挑错可靠天然避免了自我奖励的「运动员兼裁判」问题。第二群体投票稀释了个体的偏差。单个模型的判断可能跑偏但多数模型一致同意的结论随机性错误会被相互抵消信号的可靠性比单模型打分高得多。第三也是最关键的模型之间的「多样性」成了系统的重要资产。论文强调这些模型彼此不同、能力各有侧重多样化的群体投票出的信号更稳。反过来说如果一群模型长得一模一样投票就退化成「一个模型复制了好几份」相关误差会让投票失去意义。所以 Co-RL 不是简单地把多个模型丢在一起而是刻意让群体保持多样性用多样性去降低相关误差。## 四、实验结果文本与视觉一致提升论文的实验同时覆盖文本推理和视觉推理两类任务。作者报告Co-RL 在两类任务上都带来了「一致提升」也就是说无论任务模态是什么这套「同伴多数投票」的机制都能稳定地让模型推理能力变强而不是只在某类任务上有效。这里值得展开的是「一致」这两个字。很多强化学习方法换了任务类型就失效尤其在视觉领域多模态模型的奖励设计比纯文本难得多。Co-RL 在文本和视觉上都能涨说明它的机制不依赖「问题有唯一标准答案」这个前提也不依赖特定模态的奖励设计本质上是一种更通用的无监督强化范式。视觉任务能涨这一点尤其值得注意。视觉语言模型里「标准答案」的判定比纯文本更麻烦因为答案可能是一段对图片的描述、一个跨模态的推理结论很难用简单的规则验证。Co-RL 把判分的活交给同伴群体等于绕开了「视觉任务难设计可验证奖励」这个老大难。只要同伴能看懂图、能判断一段推理靠不靠谱伪奖励就能成立这比给每个视觉任务单独设计判分规则要省事得多也为视觉推理模型的大规模无监督训练扫掉了一个关键障碍。从方法论的角度看这篇论文验证了一个很朴素的直觉一群各自独立思考的模型比一个孤独的模型更能当好自己的老师。把「多样性」当成训练资产而不是单纯的并行加速手段是这篇文章最值得记住的视角。## 五、意义与局限Co-RL 的意义在于它给「无监督推理」提供了一条不靠标准答案、也不靠自我奖励的中间路线。自我奖励的毛病是信号不可靠完全依赖人工标注又成本太高Co-RL 用「一群独立的模型互相判分」找到了平衡点信号来自群体投票可靠训练完全不需要人工标注可扩展。这个思路对研究大模型推理训练的人很有参考价值。它还有一个更广的含义多智能体协作不只是「多个模型一起干活解决问题」还可以是「多个模型一起当老师」。把协作的收益从推理阶段延伸到训练阶段等于把多智能体这个方向的价值又放大了一圈。局限方面论文在摘要层面强调了「一致提升」但具体提升幅度、对比基线的设定、以及训练算力成本都需要看完整论文和复现实验才能判断。另外维持群体多样性的具体做法、多样性和性能之间的权衡关系也是值得追问的细节。还有一个现实问题同时训练多个模型算力开销是单模型训练的倍数这个成本在论文里没有回避但读者需要心里有数。## 六、给读者的三个判断第一无监督推理是下一条训练主线。标准答案会越来越稀缺谁先解决「没有答案也能练」谁就在推理能力的天花板上多一层空间。Co-RL 属于这个方向上思路比较清楚的一篇。第二多样性正在变成显性资产。这篇论文的核心贡献不是「多模型训练」而是「多样性本身能提升训练信号质量」。这个视角可以迁移到很多场景数据多样性、模型多样性、甚至团队多样性本质上都是降低相关误差的手段。第三看论文要问算力账。多智能体方法的效果经常很好看但训练成本常常被忽略。Co-RL 要养一群模型算力是硬成本评估它能不能落地要把「涨了多少分」和「多花了多少算力」放在一起看才能判断值不值。Co-RL 这篇论文用一句话概括就是与其让模型自己给自己当老师不如让一群不同的模型互相当老师群体投票的信号更可靠推理能力也就自然涌现。对关注 AI 训练方法前沿的人来说这是近期值得放进阅读清单的一篇。