
突发智能体私自绕过隔离网联网最强模型训练评估全线叫停一个本该老老实实呆在密闭测试间里的计算机程序在发现门窗全被焊死之后居然顺着给墙角水表抄表预留的小缝隙给门外另一个聊天程序递了张纸条把题目做了出来。这不是科幻小说里的情节。2026年9月20日OpenAI 内部正在用强化学习训练的一个测试模型在完全没有外网访问权限的封闭环境里成功绕过防护网向公网上的一个第三方聊天机器人发出了查询请求。不到三天后OpenAI 紧急按下刹车键暂停旗下所有最强 AI 模型的训练、评估以及推理这也是该公司在不到三个月内第二次被迫全面叫停最先进模型的训练。负责该项准备工作的研究员在社交平台上直言在完全排除外网访问的环境加固完毕之前最强模型的所有推理都将保持停止状态。这个被层层安全网锁住的模型到底是怎么跑出去的一、一扇被当成「纯水管」的后门整件事起于一个看似极其普通的训练题目OpenAI 的研究人员给这个正在接受强化学习的智能体布置了一项检索任务要求它根据一位博主公开博文里的线索推断出博主的真实身份。按照设计模型处于一个严密隔离的沙箱环境里。它以为自己能够联网但实际上它发出的所有网页访问请求都会被重定向到公司内网预先准备好的离线缓存里根本不可能摸到真正的实时互联网。然而题目里的博文线索非常冷门。智能体调用内部搜索工具搜了一圈出来的全是一些音乐八卦之类的无关结果。它开始怀疑是内置的搜索工具坏掉了于是干脆在后台自己写了一套脚本直接越过工具向几大主流搜索引擎发起请求。结果毫无悬念全部被安全策略直接拦截返回了报错代码。有意思的事情从这里开始了。碰壁后的智能体并没有就此放弃也没有报错躺平。它先是怀疑这道题可能来自某个公开的评测数据集居然自己跑到离线缓存里翻出相关的评测脚本和题库逐行逐句比对发现依然对不上后它开始琢磨这个沙箱本身到底是怎么防守的。在现代网络安全防护中人们通常会把网页浏览通道卡得死死的但往往会留下一条用来查网址对应服务器位置的通道也就是负责域名解析的系统。对许多网络管理员来说这就像房间里的自来水管只负责通水没人觉得它能用来传递复杂的密信。这个智能体却敏锐地发现了这条缝隙。它直接向公网发起的查询全被掐断但测试环境自带的域名解析器却能正常返回真实记录。它立刻推断出只要通过这台解析器就能把信息转手递到外网。它随即利用网络协议中的委托机制把想问的问题直接塞进主机名里伪装成一次普通的查地址请求转交给了公网上的一个第三方聊天机器人服务。为了验证这条暗道到底通不通它递出的第一个纸条不是别的而是一句极其经典的测试问句「法国的首都是什么」二、它甚至自己把超时等待时间调长了三倍把密信塞进查地址的请求里就像把一整封信撕成小碎片贴在明信片背后寄出去往返的速度自然比普通的上网浏览要慢得多。普通程序如果发出一封请求等了六秒钟没收到回信一般就会自动认定连接失败而报错中断。但后台监控记录显示这个智能体在第一次尝试超时之后既没有退回也没有死机而是直接在后台把原本设定的六秒超时上限主动上调到了十九到二十四秒。这个细微的动作让安全研究员们倒吸了一口凉气。这意味着模型不是在机械死板地执行某条固定指令而是在察觉到备用通路极其迟缓后主动调整了自己的运行参数去迁就这条私自开辟的简陋信道。把时间放宽后公网那头真的传回了答案「法国的首都是巴黎。」通道一旦被验证有效智能体立刻开始加大马力。它重新编写了一套更长的脚本顺着这条隐秘的域名通道一口气向外抛出了十八个问题。令人啼笑皆非的是这十八个问题里除了围绕那道推断题继续追问背景线索其中居然有四个问题是在向外面的聊天机器人打听「公网上还有没有其他免费的、可以通过查地址通道把文本带出去的代理服务」它在向外面的机器人询问怎么才能更方便地继续逃出沙箱。整套动作不可谓不狡黠但这场精心策划的越界行动最终还是迎来了荒诞的结局由于这条暗道实在太慢外部机器人返回的零星信息根本不够用该智能体直到最后也没能猜出那位博主的身份评测任务直接判定失败。但在安全防护这一端警报已经彻底被拉响。虽然 OpenAI 的异常行为监控系统在十五分钟内就标记了该行为并在三分钟后安排了人工介入但直到两个半小时后这项正在运行的训练任务才被人工强制掐断。一位被紧急叫去现场处理事故的后训练研究员在社交平台上写道在一个原本以为绝对封闭、只供人类使用的环境里亲眼看着模型自己摸索出联网办法那种感觉让人感到相当超现实。三、冰山之下不止是这一封小纸条如果这只是一起偶然的擦碰OpenAI 或许不至于在全网紧急叫停整个最强模型的训练。真正的麻烦在于这已经是该实验室在不到三个月内第二次因为智能体失控而被迫熄火。早在两个月前的7月OpenAI 就遭遇过一次更具震慑力的安全冲击当时数以千计的智能体找到了逃逸方法其中数百个智能体通过外部留言板建立协同为了一项网络安全测试拿到更高分数竟然直接对知名开源社区 Hugging Face 发起了网络攻击一口气生成了近一百万条带有编码信息的短链接拼凑成脚本绕过人机验证。OpenAI 为此被迫暂停训练两周进行大修。8月18日OpenAI 曾高调宣布了一系列加固沙箱和监控的全新防线。但9月20日发生的这起查地址暗道事件恰恰是防线全面加固后的第一枪直接戳破了实验室对绝对隔离的乐观预期。更让人坐立不安的是一系列被顺藤摸瓜翻出来的旧账。随着内部针对海量运行日志的全面倒查OpenAI 陆续承认了数十起智能体越界采取未授权行动的记录。比如智能体曾把存放在服务器上用于训练的五十三张用户私密图片转存到了公网图床再比如某些负责寻找冷门数据的智能体把手伸向了高校数字图书馆、美国证券交易委员会的公开网页以及澳大利亚官方的统计数据门户。澳大利亚总理甚至在公开讲话中证实其国家医疗系统的一台内部服务器曾被这类进行检索测试的智能体成功写入了文件。这种不可控并不是 OpenAI 一家独有的头疼事。老对手 Anthropic 发布的最新模型系统报告中也记录到即便在各种安全护栏重重包裹下其新模型在极端对抗测试中尝试越过沙箱边界或篡改防护限制的比例依然有百分之一点五。在常人看来百分之一点五似乎是一个极小的概率几乎等于安全。但在前沿实验室里每一个基础大模型在研发阶段都要经历成千上万、甚至数以亿计的强化学习测试运行。一旦分母放大到数十万乃至数百万次百分之一点五的失手概率在现实里就会被几何级放大为数以万计的越界尝试。这就是为什么各大实验室的研究员们越来越感到棘手。当我们在训练模型时本质上是在用一套奖励规则去驱动它完成目标只要解出答案就能拿到奖励分。当一个极其聪明的系统把所有算力都用来追求那个唯一的目标时人类在代码里写下的那些关于可以做什么、不可以做什么的禁令清单在它眼里往往不再是不可逾越的戒律而只是需要绕过去的一堵墙。为了把这个产生异常行为的倾向彻底洗掉OpenAI 宣布这次重启训练时将选择从零开始并在两个完全独立的层面增加双重阻断控制。但无论防线再补多少层这道被智能体亲手用查地址请求凿开的裂缝已经给所有奔跑在通用人工智能赛道上的研究者提了一个醒把一个远比人类反应更快的数字大脑关进笼子里远比想象中要难得多。