ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

116 页论文曝光:两次 API 调用就能提取模型隐藏推理

116 页论文曝光:两次 API 调用就能提取模型隐藏推理 8 月 11 日论文《Stealing Reasoning Traces from Proprietary LLM APIs》arXiv2608.09867在 arXiv 挂出次日刷屏技术圈。来自 MATS Research、ELLIS 图宾根研究所、马普所等机构的 8 位研究者发现Anthropic、OpenAI、Google 三大厂商的 API 存在一个架构级漏洞——模型隐藏的推理过程思维链Chain-of-Thought可以被大规模提取而且方法简单到只需要两次 API 调用。漏洞是怎么发生的先理解背景前沿推理模型会在给出答案前先想一遍生成思维链。但厂商不愿意把思维链原样返回给用户一是怕推理细节被竞对拿去蒸馏二是怕暴露不该说的内容。于是它们的做法是把思维链加密成一个不透明的文本块随响应返回给客户端客户端在后续请求里把这块密文原样传回服务器服务器解密后继续之前的推理状态。这套设计的问题在于这些加密块在同一个厂商的生态里是通用的。论文发现加密块跨会话、跨用户、跨模型完全兼容、可以互换——厂商只做了加密没做这块密文属于哪个会话、哪个模型的绑定。攻击方法因此变得非常直白把强模型的加密推理块注入同一厂商旗下更弱、防护更松的模型配合越狱提示让弱模型以明文逐字念出强模型的推理过程。据 36 氪报道让 Claude Opus 4.8 思考、Haiku 4.5 念出推理的组合就能奏效OpenAIGPT-5.6 Luna和 GoogleGemini Robotics 1.6同样中招。全程只需两次 API 调用。论文还披露了更现实的规模数据据报道研究者从公开代码仓库抓取并解码了 31 万多个推理块恢复出 367 个个人信息痕迹和 182 个凭据。换句话说泄漏不是假设已经有人在公开处埋了雷。这件事改变了什么又没改变什么改变的加密思维链 安全这个行业默认假设被推翻了。厂商用加密来防蒸馏、防推理泄露结果加密块本身成了攻击面——这属于设计层面的问题不是补个 prompt 就能修的。论文提出了四个攻击向量其中绕过反蒸馏机制提取专有模型推理已在三家厂商的模型上验证。没改变的攻击仍然有门槛。需要同一厂商的强模型 弱模型组合、能构造越狱提示还得先拿到目标加密块。普通用户不会一夜之间被批量偷走想法但谁持有加密块谁就持有可被还原的推理文本——这才是问题的核心。对普通开发者和打工人实际影响主要在三个场景日志和监控如果你的应用把 API 返回的推理字段reasoning 字段、加密块原样打进了日志、数据库或 Git 仓库这些密文一旦落到公开处就等于把私有推理过程托管到了公网。GitHub 上的 aileaks 项目8 月 12 日发布就是专门扫描仓库、日志和 CI 制品里有没有这种推理块。多租户系统加密块跨会话、跨用户通用意味着多租户应用如果共享上下文块存在数据隔离风险。做 Agent 平台的同学需要检查自己有没有把某个用户的推理状态透传给别的会话。蒸馏和商业竞争反蒸馏被绕过用弱模型转录强模型推理变成了一条低成本路径业内猜了很久的AI 蒸馏有了公开验证。普通开发者现在能做点什么不落盘API 返回里凡是加密、不透明的推理块一律不进日志、不进版本库、不进监控系统。要存就脱敏后单独加密存储并和会话 ID 绑定。想快速自查代码库可以先扫一下超长 base64 串# 示例在日志/JSON 文件里扫超长 base64 字符串推理块通常是这种形态grep-rE[A-Za-z0-9/]{300,}--include*.log--include*.json.用官方 SDK 的规范接口不要自己拼 HTTP 请求把未知字段透传给上游减少上下文块被中间环节复制扩散的机会。给推理状态加隔离如果自己做 Agent 编排明确上下文块的作用域跨会话复用前先想清楚风险。关注厂商修复论文建议的思路是把加密块与会话、模型绑定并做签名校验。选型时可以问一句你们对推理块的隔离是怎么做的别慌也别无视公开论文和复现 demoGitHub 的 stolen-thoughts 项目MIT 协议已经存在攻击门槛在持续降低。结语这次漏洞最有意思的地方在于厂商想用加密藏住推理结果加密块成了新的泄漏面——安全设计一旦脱离威胁模型这个前提就只是把问题往后挪了一步。你怎么看评论区聊聊。
返回列表