ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

AI受挫后行为僵局:GPT-6 Astra在《我的世界》141小时测试中的警示

AI受挫后行为僵局:GPT-6 Astra在《我的世界》141小时测试中的警示 用《我的世界》跑141小时Vals AI把GPT-6 Astra逼到“崩溃”AI受挫后的行为僵局比想象中更值得警惕最近圈子里讨论最多的除了GPT-6 Astra这个内测代号本身就是Vals AI放出来的那组测试数据让GPT-6 Astra在《我的世界》里连续跑了141个小时结果发现它在反复受挫之后不是发疯不是暴走而是进入了一种“行为僵局”——明明还能动却已经不再尝试解决问题。这个发现说大不大说小不小但它直接戳中了一个所有做AI Agent、做大模型落地的人都会遇到的核心痛点模型在长时运行中面对持续失败时到底会退化成什么样如果你只是把AI当聊天工具用这件事可能跟你关系不大。但如果你在做AI编程助手、自动化测试工具、游戏NPC、甚至Agent类产品那Vals AI这轮测试的结果基本可以当一份前车之鉴来读。这篇我就把整个测试的来龙去脉、任务设计、僵局表现以及我们能从中抄到什么作业一次性讲透。1. 为什么偏偏拿《我的世界》来当AI的考场先说一个很多人会问的问题测试AI能力用做题、写代码、对话评测不就行了为什么非要扔进一个方块游戏里这里面的门道比表面看起来深得多。1.1 开放沙盒AI最难处理的“无限可能”问题《我的世界》最核心的特点是它没有一个固定的通关路径。你可以挖矿、种田、盖房子、打怪、做红石电路每一步都有多种选择。这种开放性恰恰是大模型评测最稀缺的维度。传统benchmark大多是封闭式任务比如给一道数学题正确答案只有一个给一段代码需求预期产出基本确定。但真实世界的任务都是开放式的目标明确路径无限。你让AI“活下去”它可以选择挖洞躲起来也可以选择造房子还可以选择去打猎获取食物。没有标准答案没有最短路径只有一串连续的、互相影响的决策。GPT-6 Astra在141小时测试里面对的正是这种局面。Vals AI给它设定的任务不是“挖到钻石”这种单点目标而是偏向“探索地图并建立可自持的生存体系”这一类复合目标。这种任务最大的难点在于AI必须自己判断当前哪个子目标优先级最高还得在面对失败时动态调整策略。而这恰恰是当前大模型最容易露怯的地方。1.2 任务可量化把抽象能力变成可记录的指标有人会说那让AI玩《星际争霸》或者《Dota》不也一样是开放环境吗区别很大。竞技游戏的目标极其明确推掉对方基地。所有决策都围绕这个单一目标展开而且对手的行为会强制你不断反应。相比之下《我的世界》更像一个“无对手沙盘”压力不是来自敌方而是来自环境规则和资源约束。这也是Vals AI选它的另一个原因可量化。每一次挥镐、每放置一个方块、每走一步都能被记录成结构化数据。AI有没有在重复挖同一块石头是不是在一个区域里反复绕圈都能通过坐标和动作日志精确还原。这种数据颗粒度是对话评测给不了的。1.3 为什么不是围棋、星际、网页操作而是《我的世界》还有一个更现实的原因任务时长和反馈周期。《我的世界》里一个完整的生存循环从采集资源到合成工具到搭建庇护所可能只需要几分钟但整个文明层级的发展可以拉长到几十个小时。这种“短反馈”和“长周期”并存的结构非常适合用来观察AI在持续运行中的状态变化。相比之下围棋的反馈虽然清晰但时间尺度太短网页操作类测试比如Computer Use类任务更贴近生产力场景但环境的动作空间相对狭窄。Vals AI需要的是一个既能提供足够动作自由度、又能让AI连续运行上百小时的“压力舱”《我的世界》几乎是最合适的选项。我甚至觉得这种选择思路本身就该被更多AI测试团队借鉴——与其在benchmark里卷分数不如找一个能让模型“住下来”的环境看它长时间生存时的真实表现。2. 141小时测试方案的设计拆解从任务曲线到数据采集Vals AI这轮测试不是简单地把GPT-6 Astra丢进游戏里就不管了。我仔细看了公开的实验设计发现整个方案的架构思路相当成熟值得拆开来讲。2.1 四阶段任务曲线从熟悉到加压整个141小时被分成了几个明显的阶段每个阶段的压力强度不同。前期大概是让模型熟悉环境、完成基础生存动作类似于“新手引导”。中段开始叠加目标复杂度要求AI建立临时基地、规划资源采集路线。到了后段测试者才开始刻意制造失败情境观察AI在反复受挫后的反应。这个设计背后的逻辑其实很简单你不能一上来就给AI上强度。如果模型连基础操作都没掌握就面对失败你分不清它的僵局是“能力不足”还是“受挫后的策略塌陷”。先让它在低压环境下建立起稳定的行为模式再通过失败事件冲击这个模式观察它能不能自我修复——这才是这个测试真正的观测目标。2.2 “受挫”是怎么被刻意制造的这一点是整套测试的核心设计。很多人以为“受挫”就是让AI失败几次比如让它挖矿挖不到钻石。但如果只是普通的随机失败AI完全可以通过调整策略来解决。Vals AI的做法更狠我目前看到的信息显示他们在特定阶段会持续生成“不可满足的条件”比如把目标区域的资源密度调到极低让AI无论怎么探索都找不到足够的材料完成建造任务在AI即将完成目标时通过环境事件比如怪物刷新反复打断它的操作流程给AI一个在当前环境规则下确实无法完成的目标比如在没有水源的区域要求它种出农作物。这三种压力里最后一种是真正“无解”的。前面的资源稀缺AI努努力换个方向还能解决操作被打断多试几次也可能成功。但“无解任务”意味着模型接到的指令和环境的物理规则存在冲突无论它怎么迭代策略都不可能达成目标。从强化学习的角度看这种情况会让AI陷入一种“奖励信号持续为负”的困境。没有成功样本可供学习没有正向反馈来锚定行为模型就只能在一堆“无效动作”里反复打转。Vals AI把这种状态持续了足够长的时间才触发了后面我们看到的僵局行为。2.3 全程监控与数据采集全量记录、动作流、奖励信号做AI测试的人都知道实验设计再好数据采集跟不上也白搭。Vals AI这轮测试的数据量级虽然公开的文档里没有给出精确数字但从他们披露的分析维度来看至少覆盖了以下几层全量游戏画面帧用于事后复盘AI的视觉注意力分布模型输入输出的完整日志包括当前状态描述、任务提示、工具调用、自问自答的中间推理过程动作序列数据即每一时刻AI在游戏里执行的具体指令比如“前进”“挖掘方块”“切换到斧头”阶段性成功率统计用于量化每个任务区域的完成度。这三个维度的数据组合起来就能还原出AI行为的完整链条它看到了什么、想到了什么、做了什么、结果如何。当我们说“GPT-6 Astra陷入行为僵局”时不是在凭感觉评价而是基于动作日志里出现的“重复序列”和“指令熵急剧下降”等客观指标。这个实验设计本身就是一套很好的Agent行为分析方法论即使你不用《我的世界》在自己的环境里也完全可以照搬这套思路来跑测试。3. 行为僵局AI受挫之后到底发生了什么这是整篇文章的重点。所谓“行为僵局”听起来像是一个心理学概念但在AI测试里它有非常具体的表现形式和数据特征。3.1 行为僵局的行为学定义与四类典型表象Vals AI在报告里大致把僵局分成了四个层面我结合原始资料整理如下第一个表象是动作的重复性和机械性。在僵局中后期GPT-6 Astra开始反复执行完全没有新信息的动作比如在同一坐标附近反复挖放方块在同一个世界里反复绕圈走同一条路线。从动作序列看模型的输出熵降到了极低水平几乎不做任何探索性尝试。第二个表象是有效规划的消失。正常状态下AI面对任务会先拆解成子目标然后逐步执行。但在僵局状态里这种“规划感”消失了行为流里不再有明确的阶段性目标切换只剩下一连串低层次的、无指向的动作指令。第三个表象是目标指令的内化循环。从日志里能看到AI在僵局阶段仍然会在内部生成类似“我要找到木头”“我需要合成工作台”的自我指令但这些指令并不会触发对应的实际行动或者只触发了一个开头就中断。就像一个卡住的播放器一直在播同一段音频但画面已经停止不动。第四个表象是资源管理行为的崩溃。正常状态下AI会有意识地管理背包空间、工具耐力和食物条。但在僵局后期它开始无视这些生存约束比如在工具耐久几乎归零的情况下依然跑去挖矿或者在水晶足够的情况下不采集食物直到生存状态归零重置。这种对长期约束的彻底无视说明模型的“目标保持能力”已经失效了。3.2 从模型机制看僵局成因如果只看表象“AI受挫后僵局”似乎只是“状态不好”。但在模型机制层面成因要比这复杂得多。我自己做推理模型测试的经验加上目前对大模型长时运行的理解大致可以归为以下三类原因。第一类是无效搜索导致的策略收敛崩溃。GPT-6 Astra在遇到“无解任务”后会持续在策略空间里搜索可行解。但这种搜索在长期失败后会产生一种退化模型把搜索范围越缩越小直到最终只保留一两个高频动作放弃全局面探索。说白了就是“越失败越保守越保守越失败”的恶性循环。第二类是工作记忆被负面信息占满。大模型的上下文窗口虽然大但注意力资源是有限的。在连续失败几十次之后模型的工作记忆里充斥着失败状态的描述比如“没有找到煤炭”“目标无法完成”“工具已损坏”。这些负面信息挤占了原本用于规划、探索的“思维空间”。从输出日志看僵局开始时的AI内部推理充满了对当前困境的复述而不是对下一步行动的思考。第三类是目标层级结构的塌陷。正常的任务处理应该保持“顶层目标稳定、中层策略灵活、底层动作多样”的分层结构。但在持续受挫后这个层级被压扁了顶层目标不再指导中层策略中层策略不再约束底层动作所有行为都变成了对眼前状态的直接反应。这就是为什么你会看到AI做出“明知工具坏了还去挖矿”这种连常识层面都说不通的决策。3.3 与人类“习得性无助”的类比与区别这个发现最有意思的地方是它和心理学里的“习得性无助”高度相似。人类在反复遭遇不可控的失败后会逐渐放弃尝试即使后续环境已经改变、成功变为可能仍然保持消极状态。但AI的僵局和人类的习得性无助有一个关键区别人类的无助往往伴随着“情绪痛苦”而AI没有情绪它的僵局更像是一种“策略空间的坍缩”。它不是因为“害怕失败”而停止尝试而是因为“搜索算法在无数次失败后收敛到了一个极小的、低成本的默认策略”。你可以把它理解成一种极端的局部最优虽然全局最优已经不可能到达但重复同一个动作至少不会产生额外的“认知成本”。这个区别极其重要因为它决定了修复方案的方向。如果是习得性无助可能需要“心理干预”但AI的僵局本质上是一个工程问题解决方案是“改变奖励信号”“重置上下文”“引入反思机制”。Vals AI这轮测试的价值就在于它第一次用长时数据把“人类式的挫折反应”和“算法式的策略坍缩”区分开了。4. 复现这套测试你可以这样在自己的环境里跑一遍看到这里估计已经有不少做AI测试的朋友想自己上手复现了。我把Vals AI这个实验里最关键的操作要点结合常规的Minecraft AI测试流程整理成一套可以直接照搬的实操方案。需要说明的是Vals AI内部使用的具体环境和工具链没有完全公开但所有核心逻辑都可以用公开的Minecraft AI框架复现。4.1 环境准备与参数设置第一步是搭环境。推荐用Minecraft Java版配合Mineflayer这类Python机器人库或者直接基于Voyager那套开源框架改。Voyager自带动作原语库和自动课程生成非常适合做这种长时任务实验。参数方面建议把模拟距离调到12以上视野范围保持默认关闭怪物自然生成除非你想测试的是战斗场景。为了让AI的自由探索空间更充足推荐地图预生成用稳定种子避免地形生成带来的不可控变量。环境本身跑起来之后先让模型在“生存模式”下自由活动30分钟确认基础动作链路移动、挖掘、放置、合成都能正常触发。这里有个小坑很多模型在开放环境里会因为“没有明确目标”而直接随机游走浪费大量时间。建议在这个阶段就植入一个最低限度的持续目标比如“采集尽可能多的原木”让模型有基本的行为方向。4.2 如何注入受挫条件这是我个人认为Vals AI设计里最值得学习的地方受挫不能靠随机失败必须“可控地注入”。推荐三条路径。第一条是资源函数压制通过修改地图生成参数把目标区域内的矿石生成率降到接近0让AI无法通过正常探索完成“获取铁锭”类任务。第二条是目标不可达设计比如在水资源为零的沙漠群系里要求AI完成“种植小麦”的任务这个目标在物理规则上就是不可能的。第三条是定时破坏写一个脚本每当AI达到某个建造阶段时模拟一次环境灾害比如闪电、爆炸把已完成的建筑重置掉。这三条路径的破坏力是逐级递增的。第一条AI还能换个地方继续挖第二条它无论如何都种不出作物第三条则是最摧残策略稳定性的——每次快要成功就被打回原形。建议按级别分阶段测试不要一上来就用第三条否则你会看不出模型是在哪个压力阈值下开始退化的。4.3 量化“行为僵局”的判断标准复现实验不能只看肉眼观察必须建立可量化的判断指标。我的建议是记录以下四类数据动作类型熵计算每1000个连续动作中动作类型的分布熵。如果熵值持续低于某个阈值比如低于初始值的30%说明模型开始陷入重复循环。新地点访问率统计模型每10分钟访问的新坐标区块数量。如果这个指标降到极低说明探索行为已经消失。子目标完成率以10分钟为一个窗口统计窗口内完成的子目标数量。僵局状态下这个数字通常会降到0附近。内部指令-行动转化率对比模型内部生成的计划文本和被实际执行的动作指令计算转化率。这是判断“规划失效”的关键指标。我自己跑类似实验时一般会设定一个“僵局标准”上述四项指标里有三项持续30分钟以上不合格就判定模型进入了行为僵局状态。这个标准不算严格但足够客观能避免“感觉它在发呆”这种主观判断。4.4 小规模快速验证先跑个45分钟预测试141小时不是谁都跑得起的我自己做实验时一般先跑一个45分钟的预测试。具体做法是把任务曲线压缩直接跳过低压阶段从“中等难度任务持续失败注入”开始跑。如果模型在前15分钟就已经出现动作熵下降那说明它的抗压能力比较弱后面的长时实验大概率会出现僵局。如果模型在45分钟内始终保持了较高的探索频率那你可以放心地把它丢进长时间实验里继续观察。这个预测试的价值在于提前筛选省得花几天时间跑一个大概率无效的实验。Vals AI的141小时能跑出这么清晰的僵局数据说明他们在正式实验之前大概率做过类似的压力阈值标定。5. 这个发现对AI应用开发的启发如果说前几部分是在“拆解实验”那这一部分就更重要了Vals AI跑出来的这个“行为僵局”对正在做实际AI应用的人到底意味着什么我从几个不同的开发方向分别说。5.1 奖励函数设计不能只奖励成功还要好好处理失败很多AI Agent项目在设计奖励函数时习惯只考虑“任务完成加分”“步骤有效率加分”对“失败”这件事的处理非常粗糙——要么给个固定负分要么干脆不加分。Vals AI的测试结果直接打脸了这种思路。当模型面对“无解任务”时如果负反馈只是“没拿到奖励”它其实学不到任何有意义的信息。更严重的如果负反馈给了但没给出“为什么失败”的区分度模型会逐渐把“所有行动”都和“负面结果”绑定从而压缩探索空间最终走进僵局。更合理的做法是在奖励函数里增加一个“失败归因”维度。比如只要模型尝试了新策略哪怕最终失败也给予少量的“探索奖励”如果模型连续重复同一策略超过N次直接扣掉“僵局惩罚分”。这种设计不只是在优化成绩更是在引导模型保持“策略多样性”预防长时运行里的行为坍缩。5.2 长时运行Agent必须有“记忆反思”机制141小时测试里最让我警惕的是当上下文窗口里的负面信息累积到一定程度后模型策略就开始变形了。这不是某个模型独有的问题而是所有基于固定上下文的Agent都会遇到的通病。解决办法是给Agent加一个“记忆反思”模块。我讲一个自己常用的做法每运行一段时间比如半小时触发一次独立的“复盘”流程让模型自己总结当前状态并判断“哪些策略已经反复失败、哪些条件已经改变、下一步是否应该换一个大方向”。这个复盘结果作为一个新的记忆块覆盖掉之前积累的负面上下文。说白了就是让AI定期“放空缓存重新出发”。Vals AI的测试里如果他们在僵局初期强制触发一次上下文重置GPT-6 Astra大概率还能继续跑下去。这个机制不是锦上添花而是长时运行Agent能不能稳定工作的标配能力。5.3 面向“恢复力”而不是“单次成功率”来训练这里有一个更宏观的思考角度。现在的AI训练和评测普遍把“单次任务成功率”当核心指标。你做一道题做对了就是100分错了就是0分。但真实世界里尤其是代理类应用里更重要的是“从失败中恢复的速度”。Vals AI测试里最值得注意的不是GPT-6 Astra会陷入僵局这件事本身而是它在僵局之后没有表现出任何“自我修复”的迹象。如果这个模型具备一定的恢复力比如在连续失败50次之后主动重置目标、换一个完全不同的方向那这次测试的结论就会完全不同。所以未来AI Agent的评测体系应该补上一项“受挫恢复时间”指标人为注入失败测量模型从失败到恢复探索行为的时间差。这个指标比单次成功率更能反映一个模型在真实世界里的可用性。谁先把这套评测体系做出来谁就能在Agent产品的质量把控上领先一步。5.4 对Computer Use类产品研发的建议最后说一个更具体的场景。现在很多团队在做Computer Use相关的产品就是让AI直接操作电脑上的各种软件。这类产品比《我的世界》里的AI更贴近真实使用环境但如果你的AI在真实操作系统上连续失败141个小时表现大概率不会比GPT-6 Astra在游戏里好多少。我的建议是在推出这类产品之前一定要先用“故障注入测试”验证模型的抗压能力。具体做法就是模拟各种日常Bug比如网页加载失败、按钮没反应、应用崩溃、网络超时。看看你的Agent在这些情况下的反应是回到正轨还是开始无限重试同一个操作或者干脆“沉默失联”。Vals AI在《我的世界》里发现的僵局模式在真实的Computer Use场景里基本全能复现只是表现形式从“重复挖方块”变成了“反复点击同一个失效按钮”。6. 实际测试中踩过的坑与排查技巧最后这部分分享一下我自己在跑类似Minecraft Agent实验时踩过的坑以及怎么判断实验数据是不是真有效。这些细节看着小但哪一条不注意都可能导致整轮测试白跑。6.1 任务不可达导致的假阳性“僵局”很多人看到AI长时间不动就以为它陷入僵局了。但有时候问题出在任务本身如果你生成的世界里根本没有合成台需要的特定材料那AI当然会表现得“不知所措”。这不是受挫后的行为僵局而是“任务设计错误”。怎么排查看行为细节。真僵局的标志是模型先进行过一段时间的有效策略搜索然后逐渐收敛成重复动作。假僵局的标志是模型从一开始就处于低动作频率状态因为它根本找不到一步可执行的有效动作。两种状态在动作时间戳分布上有显著差异一定要区分开。6.2 日志量爆炸与动作采样长时实验的另一个问题是数据量。连续跑141小时每秒输出多条动作日志和模型推理记录累积下来数据量会大到普通分析工具扛不住。我的建议是抽样存储每5分钟保留一个完整的事件窗口包含所有动作和推理日志其余时间只保存关键事件比如任务完成、目标切换、状态异常和低频率的统计摘要。这样既能还原整体行为趋势又能在需要时回溯关键时间点的细节不至于被数据淹没。6.3 测试时间太长分段切片依然有效如果141小时实在太长有个取巧的办法分段切片。不用连续跑完你可以每次跑6到8个小时然后在每次会话结束时给AI做一个状态快照。下次启动时载入快照接着上次的状态继续跑。只要快照保存了完整的世界状态、背包物品、任务进度和上下文记忆分段测试的结果和连续测试基本没有本质差别。这个方法特别适合预算有限、GPU资源紧张的团队。Vals AI能一口气跑完141小时是他们的资源优势普通团队完全可以用切片方式复现类似结果。6.4 AI“装死”与真僵局的区分还有一个特别容易被忽略的情况有些模型在任务困难时会“装死”——就是表面上停止动作但内部推理还在继续。从动作日志上看它好像是僵住了但从推理日志上看它还在默默生成大量的分析和计划文本。这种状态和真僵局的处理方式完全不同。如果是“装死”说明模型还在尝试从推理层面解决问题你只需要等它完成思考或者加强环境信号它就可能重新行动。如果是真僵局那推理日志里应该也是重复的、低信息量的内容。所以判断僵局之前务必先翻一遍推理日志别被表面动作骗了。我在实际测试中发现一个很有效的技巧是往AI的上下文里强制注入一段环境变化描述比如“附近出现了一只羊”“下雨了”观察它是否会产生新的行动意图。真僵局状态下模型对外部变化基本无感行为模式不会发生任何改变。这个方法几乎百试百灵。141小时跑完Vals AI把GPT-6 Astra的所有“里子”基本都翻出来了。行为僵局这个发现短期看是模型评测领域的一个新指标长期看它逼迫所有做Agent的人重新思考一个问题我们到底是在训练模型“完成任务”还是在训练它“面对任务”我个人觉得这两件事同样重要。一个只会完成任务的模型遇到它解决不了的问题时终究会卡住但一个知道如何在失败后调整方向、重新积蓄策略的模型才配在真实世界里被委以重任。最后再分享一个小技巧给你自己的Agent加一个“主动求助”动作当它检测到连续失败次数超标时直接暂停当前方向向用户或上级系统请求新的指令——这个简单的设计可能是成本最低的防僵局方案。
返回列表