AI用两天想出科学家十年的结论!谷歌DeepMind看到最大瓶颈

AI用两天想出科学家十年的结论!谷歌DeepMind看到最大瓶颈
Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对AI 让科学猜想变得廉价但验证依然昂贵这个差距正在撕裂整个科研体系。Google DeepMind 发布报告《Conjecture Machines: AI agents and the new validation bottleneck in science》10位研究员和工程师坐下来聊了一个问题AI Agent 涌入科学界之后接下来会发生什么在过去一年里Agent 已经改变了编程的意义。而科学研究可能就是下一步要被改变的领域。Agent 正在把科学变成一台高速运转的猜想机器但物理世界的验证速度跟不上同行评审跟不上数据基础设施也跟不上。新的瓶颈正在产生我们应该如何应对一夜赶超十年功故事从伦敦帝国理工学院的微生物学家 José Penadés 讲起。他的团队花了将近10年研究一类超级细菌如何传播抗生素耐药性。结论有了但一直没发表只有实验室内部知道。2024年他把问题描述给了 Google DeepMind 的 Co-Scientist一个 AI Agent。两天后Co-Scientist 返回5个可能的解释按优先级排序。排第1的跟 Penadés 团队花10年证明的假设一模一样某些超级细菌从病毒那里获取尾巴用这些尾巴当钥匙在不同宿主物种之间跳跃。Penadés 愣住了。他第一反应是电脑被人入侵了赶紧发邮件给 Google 确认。对方回复没人偷看。一个基于 LLM 的系统被赋予目标和工具能自己规划步骤、并行调度多个子任务、发现并纠正错误还能调用外部数据库、写代码操作机器人。跟聊天机器人不同Agent 不是问一句答一句它拿到目标后会自己拆解、执行、迭代。为什么现在突然好用了报告归结为三股力量。前沿模型更强了。顶级模型在 Humanitys Last Exam、FrontierMath 这类高难度科学基准上已经超过人类专家。更关键的是推理时计算inference-time reasoning带来的深度思考能力模型会一步步推演、探索、修正再给出答案。脚手架scaffolding成熟了。这是一套包裹在模型外面的代码框架给 Agent 提供结构、记忆和工具调用能力。早期脚手架是定制的换个模型就不灵了。现在有了 Agent 间通信协议等新标准通用性好了很多。可定制性来了。Agent 技能skills让科学家把自己的方法论、流程偏好写成简单的文本指令Agent 就能按你的方式干活。计算生物学家 Natasha Latysheva 说她已经把自己的研究流程提炼成了技能。她的预判是科研工作会从亲手执行转向高层编排。每天上班先看看 Agent 昨晚跑了哪些实验和分析调整方向引导注意力。猜想廉价验证昂贵Agent 对科学最直接的改变你多了一个永不知疲倦的数字助手。文献梳理、数据库查询、数据分析、写基金申请以前花几小时几天的事现在几分钟搞定。但真正结构性的变化在别处。斯坦福大学的 Gary Peltz 研究肝纤维化每年140万人死于肝硬化。他凭自己的文献积累和几十年经验挑了2个候选药物做实验。同时他让 Co-Scientist 也挑。AI 挑了3个。结果 Peltz 自己选的2个在活体人类肝细胞实验中毫无效果。Co-Scientist 选的3个里2个不仅阻断了纤维化还促进了肝细胞再生。Co-Scientist 的工作方式是调度一群子 Agent生成多样假设、互相批评、排序、迭代模拟一个人类研究小组的运作方式但速度快得多。报告也坦承 Agent 的软肋。Co-Scientist 负责人 Vivek Natarajan 说输出第10页里一个编造的事实就能毁掉整份报告。漏掉这种错误浪费时间和资源抓住它需要一个领域专家。他提出一个关键概念叫认知谦逊epistemic humility模型得知道自己不知道什么并且说出来。AlphaFold 之所以受信赖部分原因是它会报告每个预测的置信度。但在更开放的科学推理中校准这种置信度仍是未解难题。科学家同时想要两样东西基于文献、没有错误的假设以及真正新颖的想法。Agent 调得谨慎就趋向安全和已知调得大胆就容易跑偏。在搜索最优解方面AlphaEvolve 是另一个代表。给它一个用代码表达的问题和一个评分函数它调度一组 Agent 生成大量候选方案留下得分最高的用幸存者繁殖下一代。无人值守地跑规模远超人类团队。它帮 Google 设计了下一代 TPU 芯片帮数学家 Terence Tao 解决了开放的 Erdős 问题改进了基因组数据分析。在材料科学等领域AlphaEvolve 的 top 选手只是线索不是最终结果。一个有前途的催化剂还是得在实验台上造出来、测一测。这就引出了报告最核心的判断。Karl Popper 说科学通过猜想与反驳前进。AI Agent 正在改变这对关系的经济学。猜想变得丰富且廉价反驳依然是物理的、制度性的所以昂贵且缓慢。数学和计算机科学是例外验证可以在硅基世界里完成。Agent 生成证明用 Lean 这类形式语言表示计算机就能无歧义地验证对错。今年2月数学家们办了首届 First Proof 挑战10个研究问题刻意不发表确保不在任何训练数据里。给一周时间。Aletheia一个把证明生成器和自然语言验证器配对的系统解决了6个是最好成绩。但数学家们已经开始抱怨 AI 生成的证明太长、难以消化。领导 Aletheia 项目的 Thang Luong 说我们正在走向一个严重的证明消化不良的未来AI 产出突破的速度超过人类审阅的速度。而在大多数学科验证鸿沟正在扩大。Agent 可以提出一个逆转细胞衰老的基因线索但没法确定它到底管不管用。细胞系需要时间生长化学反应需要时间完成。对大部分科学来说实验室设定了节奏。基础设施该升级了报告给政策制定者和科研资助机构提了4个紧迫优先级。确保科学家能用上 Agent。报告把这比作历史上提供超级计算机访问权的挑战。地缘政治讨论总聚焦于一个国家能不能训练自己的前沿模型但更少有人关注一个可能更重要的问题一个国家能不能把 Agent 部署到整个科学生态中。资助机构得决定实验室怎么选 Agent、怎么付费。计算开销大Agent 能力边界不断扩展总花费大概率会涨。需要新的公私合作模式美国的 Genesis Mission 是一个有希望的样板。让国家数据资产对 Agent 友好。开放或低风险数据应该通过文档完善的 API 暴露给 Agent。敏感数据集比如基因组学、病毒学领域有双重用途风险的数据需要开发类似 OpenSAFELY 那样的隐私保护方案让 Agent 也能安全访问。解决验证瓶颈。Agent 让假设越来越多实验设施的时间却就那么多。报告建议投资现有实验验证设施并开放共享同时加速自动化实验室建设。给同行评审配上 Agent。科学家已经在用 AI 写越来越多的基金申请和论文写作质量不再是可靠的区分标准。Agent 越深度参与规划和优化申请申请书就越少反映科学家的原创思考。报告建议分层应对使用者更清晰地记录 AI 参与情况推进水印技术和 Human-AI Interaction Cards人机交互卡片记录产生关键科学洞见的提示和输出。审稿人也应该能用 Agent先在检测错误这类客观领域试点。AI Agent 不能成为少花钱搞科学的理由那将是一个悲剧性的虚假节约。把这一刻当作真正结构性变化的国家才能释放最大的公共价值。这个窗口期的选择可能很难逆转。科学家用上 Agent 之后不会再回头了。技术会继续进步。但管理科学的那些制度实验室、团队、机构、同行评审、资助体系是为一个正在被加速的科研企业建造的它们自己还没跟上。