腾讯、马里兰大学等联合发布全球最难AI终端任务基准
这项由腾讯混元LLM前沿团队、马里兰大学、乔治亚大学、明尼苏达大学双城分校、印第安纳大学、里海大学、新加坡国立大学、香港理工大学等多家机构联合开展的研究以预印本形式发布于2026年7月9日论文编号为arXiv:2607.08964。有兴趣深入了解的读者可以通过该编号查询完整论文。**一个关于AI耐力的大考**现在市面上的AI助手越来越聪明能写代码、能改文件、能在电脑终端里执行各种命令。很多人觉得AI已经很厉害了——毕竟它们能在几分钟内修好一个代码错误或者帮你完成一道编程题。然而研究团队提出了一个更难的问题如果任务不是几分钟能完成的而是需要几十分钟甚至几小时中间还要不断调整思路、反复调试AI还能胜任吗这就好像考验一个厨师不只是问他能不能煎一个荷包蛋而是让他独立完成一整桌十二道菜的国宴——从采购食材、规划流程、掌控火候到发现某道菜的食材坏了之后临时调整方案最终端出每一道都合格的成品。这种长线作战的能力就是研究团队最想测试的东西。为此他们建立了一个名为Long-Horizon-Terminal-Bench简称LHTB可理解为长线终端任务基准的全新测试框架用46道精心设计的超难任务向当前世界上最顶尖的15个AI模型发起挑战。结果令人大跌眼镜即便是表现最好的模型在这套考卷上的通过率也只有15.2%而所有模型的平均通过率更是只有可怜的4.3%。---**一、为什么现有的AI测试不够用**在理解这项研究的价值之前有必要先搞清楚一件事现有的AI评测到底在测什么目前学术界最主流的AI能力测试大多类似于帮我修这个代码bug或者完成这道编程题。这些任务通常在几分钟之内就能完成而且只有两种评分方式要么成功要么失败。这种非黑即白的评分方式在简单任务上还算合理但一旦任务变得复杂、漫长它就暴露出严重的问题。打个比方假设有两个学生在做一道100分的作文题。第一个学生写到第99分的程度只差最后一句话收尾没写完第二个学生交了白卷。如果按照交了完整作文得分没交就零分的规则这两个学生会得到完全相同的分数——零分。这显然是荒唐的但目前大多数AI基准测试就是在用这种方式评分。研究团队将这个问题称为稀疏奖励信号——也就是说整个测试过程中AI只能在最终环节知道自己成功还是失败中间过程得不到任何反馈。对于短任务来说这还能接受但对于需要几百步操作、持续几十分钟的长任务来说这就如同让一个人在黑暗中走迷宫——走了大半程、只差几步就能出口却和一开始就迷路的人得到同样的评价。更深层的问题在于真实世界里的专业工作几乎从来不是简单短任务的堆叠。重现一篇科学论文的实验结果、修复一个复杂的机器人导航系统、分析一个多源数据集的异常、优化一个大型数据库的查询速度……这些任务少则几十分钟多则数小时中间充满了意外、错误和需要反复调整的环节。现有的测试体系完全无法衡量AI在这类任务上的真实水平。LHTB正是为了填补这个空白而诞生的。---**二、这套考卷究竟有多难**LHTB包含46道任务横跨九个大类领域。这些任务不是凭空捏造的题目而是从真实的专业工作场景中提炼出来的。其中有些任务属于实验重现类要求AI从头重现一篇已发表学术论文中的实验结果包括浮点数压缩算法的校准实验、蛋白质结构搜索实验、计算机网络仿真实验等。有些属于软件工程类要求AI修复一个故意损坏的代码仓库比如逆向破解一个没有文档说明的配置格式、将一个老旧的AI框架代码迁移到新版本、修复一个开源数据库的查询优化器。还有些任务属于地球与气候科学类比如审计一个用于分析极端气候事件的数据处理管道、重现电力系统潮流计算的回归测试、审计地下水流动模拟的输出结果。更具挑战性的是交互式游戏类任务——AI需要在终端环境里实时操控游戏。比如在2048游戏中尽可能合并数字块在超级马里奥游戏里尽量通关更多关卡或者在国际象棋中对抗一个顶级引擎Stockfish看能撑多少步不被将死。还有逻辑约束谜题类包括解决一系列越来越难的数独变体或者通关一个四阶段的华容道Rush Hour谜题。每道任务都被放置在一个隔离的容器化环境中——可以理解为一个独立的虚拟电脑。AI能做的只有通过命令行输入指令、查看文件、运行脚本、分析输出结果然后根据发现的问题修改代码或策略再次运行循环往复。没有图形界面没有鼠标操作只有纯粹的文字命令——这正是真实服务器上的工作方式。任务的难度还体现在另一个维度隐藏的验证机制。每道任务的评分不只依赖公开的测试用例更重要的是一套隐藏的压力测试——这些测试会动态生成更难的输入包括嵌套格式的数据、经过压缩加密的文件、字段名称被改过的数据表、含有噪声的传感器数据、旋转过的图像、被裁剪的帧以及各种非标准的坐标系或时间格式。这样设计的目的是确保AI不能通过死记硬背或者只修复表面问题来蒙混过关——必须真正理解问题并实现稳健的解决方案。---**三、全新的评分方式给每一步都打分**LHTB最核心的创新之一是它的评分方式。传统的测试只看最终结果——任务完成就得1分没完成就得0分。LHTB则把每道任务拆解成若干个子任务每个子任务都有独立的得分最终将这些分数按权重加总得到一个介于0到1之间的综合得分。举个具体的例子。假设一道任务要求修复一个气候数据分析管道。这个任务可能被拆解成第一步能否正确读取NetCDF格式的气候数据文件第二步能否正确计算热浪事件的频率第三步能否处理降水量的异常值第四步能否生成符合格式要求的输出报告第五步能否通过所有隐藏的压力测试。如果AI完成了前四步但在第五步失败了它不会得零分而是会得到一个反映实际完成进度的分数比如0.80。这种评分方式还有三种具体形态。对于有明确对错的检查比如程序是否能正常运行而不报错采用0或1的二值评分。对于有量化目标的任务比如重现的实验结果与参考值的误差是否在允许范围内则采用连续评分——误差越小分数越高。对于那些需要反复执行多轮的任务比如游戏类任务采用聚合评分——统计在所有尝试回合中成功完成目标的比例。这种分级评分体系就像给一场马拉松比赛的选手评分时不只看有没有跑到终点还记录他们跑到了第几公里、用了多少时间——这样才能真正区分出差一点就到了和刚起跑就放弃了的选手之间的差距。---**四、实验结果顶尖AI的集体翻车**测试结果出来的时候相信不少人会被这个数字震惊在通过率最宽松的设定下得分达到0.95分才算通过表现最好的模型GPT-5.5的通过率是15.2%也就是说46道题里只答对了7道。而所有15个模型的平均通过率只有4.3%。如果把通过标准提高到满分1.0分GPT-5.5的通过率下降到10.9%而有10个模型的通过率直接变成0%。在这15个被测试的模型中GPT-5.5表现最好其次是MiniMax M3和Kimi K2.7 Code各自通过了3道题通过率6.5%。DeepSeek V4 Pro同样也是6.5%的通过率。Qwen3.7 Max、Doubao Seed 2.1 Pro、Gemini 3.1 Pro、GLM 5.1、GPT-5.3 Codex各自通过了2道题通过率4.3%。而GLM 5.2、Qwen3.6 Plus、GPT-5.4、Hy3各自只通过了1道题。Kimi K2.6和Grok 4.20一道也没通过其中Grok 4.20的平均得分只有0.08是所有模型中最低的。从所有任务、所有模型加在一起的690次测试来看只有30次通过了0.95的门槛占比4.4%。另有224次测试的得分低于0.05也就是说连5%的进展都没达到占比32.6%。而剩下的433次测试分布在0.05到0.95之间——这些是有进展但没完成的情况占比高达62.8%。其中有180次测试的得分超过了0.5说明模型完成了超过一半的工作却功败垂成。每道任务平均需要AI运行231轮操作消耗990万个词元可以理解为AI处理的文字量花费85.3分钟的实际运行时间产生约10.2美元的API调用费用。这些数字远远超过了之前所有类似的测试基准——以Terminal-Bench 2为对照大多数任务在20分钟以内就会结束而LHTB几乎每道任务都跑满了90分钟的限时上限。---**五、成本与性价比贵的不一定好**在看完通过率数据之后一个自然的问题是花钱多的模型是不是表现更好答案是不一定。研究团队统计了每道任务的平均API费用。GPT-5.5的每题平均费用约为21.46美元是通过率最高的模型但不是最贵的。最贵的是GPT-5.4每题平均费用高达27.57美元——这个模型每道任务平均需要302轮操作而GPT-5.5只需要208轮尽管两者的单位费率相近但GPT-5.4效率更低、绕路更多导致总花费更高通过率却更低。Grok 4.20每题费用约20.63美元但通过率为0是性价比最差的模型之一。相比之下Hy3每题费用只有2.47美元虽然通过率也很低但它占据了低成本端的帕累托前沿——也就是说在相同花费水平下没有其他模型比它表现更好。Doubao Seed 2.1 Pro每题约5.16美元MiniMax M3每题约6.13美元两者在成本和通过率的综合表现上也处于帕累托前沿。这个结论揭示了一个重要现象在长线任务上更高的推理费用并不等于更强的解决能力。决定成功与否的更多是模型能否有效规划、避免重复探索、准确判断任务是否完成而不仅仅是更聪明的大脑。---**六、为什么会失败三种不同的死法**研究团队深入分析了那些没有通过的测试发现失败原因可以分为三大类。最主要的失败方式是超时——在90分钟的时间限制到来之前任务还没完成系统强制中断。这种情况占所有失败测试的79%也就是518次。更令人无奈的是这些超时的测试并不是因为AI毫无进展很多情况下模型已经完成了大半工作只是速度太慢、效率太低在有限时间里无法全部搞定。这些超时测试的平均得分在0.10到0.35之间——不是白费功夫但就是差那么一口气。第二种失败方式是提前放弃——AI自己认为任务已经完成主动停下来但实际上并没有通过隐藏的验证测试。这种情况占所有失败的19%也就是124次。研究团队将那些在得分超过0.75的情况下仍然提前停止的案例称为假完成——模型误以为自己已经做完了带着一种莫名其妙的自信交卷却不知道自己最后几步还差得远。研究团队在分析中发现了14个典型的假完成案例得分都在0.75以上。比如Kimi K2.7 Code在完成一道数据库优化任务时在得分达到0.92时停止了还剩大约20分钟没用完。GLM 5.2在一道金融咨询任务上得分0.90时停下。而有七个不同的模型都在同一道法律咨询任务上在得分介于0.80到0.87之间时停止每个都还有大约20分钟可以继续工作。这说明这些模型在自我评估能力上存在系统性的偏差——它们倾向于高估自己的完成程度不愿意再花时间去做最后的深度检验。第三种失败方式是系统错误——评估框架本身出了问题占所有失败的3%是最不重要的一类。这三种失败模式共同指向一个结论当前AI模型的瓶颈不在于每一步是否做对了而在于能否在有限时间内把所有步骤都连贯地做完。在短任务上AI已经表现相当不错但在真正需要持续几十分钟、保持清醒规划的长线任务上它们还差得很远。---**七、分级评分揭示了什么隐藏真相**LHTB的分级评分体系不只是技术上的改进它还揭示了一些用传统评分方式永远看不到的信息。以Kimi K2.6为例。这个模型在0.95门槛下通过率为0——传统二值评分会告诉你这个模型一道题都没做出来。但分级评分告诉你它有5次测试的得分非常接近通过线平均得分0.25最高的一次达到0.94。它在一道语法模糊测试任务上得了0.94分在调度策略任务上得了0.90分在漏洞利用任务和N体仿真任务上分别得了0.89分。如果用传统评分Kimi K2.6看起来和一个完全不会做题的模型没有区别但实际上它几乎每次都差一点点就成功了。反过来分级评分也能区分出那些虽然分数差不多但原因截然不同的模型。两个模型都得了0.30的平均分但一个是因为每道题都做了三成就放弃另一个是有些题做了八成、有些题几乎没动。这两种情况说明的是完全不同的能力特征但在传统评分下完全无法区分。从整体分布来看所有690次测试的最终得分呈现出一种独特的形态最多的一堆集中在0.05以下无实质进展然后是0.05到0.15之间有一个较大的群体接下来随着分数升高数量逐渐减少但在0.85到0.95之间又出现了一个不小的接近完成的群体大小几乎是完全通过群体的两倍。这说明很多模型都能做到快要完成但就是差在最后一关。---**八、这项研究对未来意味着什么**LHTB的研究结论清楚地指出了当前AI系统在哪些方面需要重点改进。首先是时间预算管理能力。现在的AI在长线任务中经常在前半段做了很多低效的重复探索等到时间快到了才开始着急但已经来不及了。未来需要让AI学会在有限时间内更合理地分配精力——哪些步骤重要、哪些可以跳过、什么时候该加速、什么时候该仔细验证。其次是自我验证能力。假完成的问题说明当前模型在判断任务是否真的做完了这件事上远没有达到令人满意的水平。AI需要学会更严格地自我检查特别是在已经通过了明显的公开测试之后还要主动去思考是否还有我没考虑到的边界情况。第三是长线记忆与状态管理能力。做了几百步操作之后AI需要能清楚地记得之前做了什么、发现了什么、还有什么没做而不是在每一步都从头思考导致重复劳动或者遗忘关键信息。第四是迭代调试能力。很多任务在真实工作中都需要发现问题——修复——再测试——发现新问题的多轮循环。AI需要能在这种循环中保持方向感不因为一次失败而乱了阵脚也不因为表面上看起来修好了就提前收工。说到底LHTB的发布既是一面镜子也是一个靶子。它照出了当前最顶尖AI系统在真实长线工作中的真实水平也明确地标出了下一阶段需要攻克的方向。在这套考卷面前没有一个模型能说自己已经毕业了——这本身就是这项研究最有价值的地方。归根结底研究团队的发现给了我们一个清醒的认识AI在回答这个问题怎么解决上已经颇为出色但在把整件事从头到尾做完这件事上还有很长的路要走。就像一个能背出所有菜谱的厨师并不等于能独立掌厨一场国宴——知道怎么做和真正能做成是两件完全不同的事。对未来的AI研究者和开发者来说这套基准提供了一个明确的挑战目标。对于普通用户来说这个研究提醒我们在把需要长时间、多步骤、反复调整的重要工作完全交给AI之前还是要多留一份心仔细检查它是否真的完成了而不只是看起来完成了。有兴趣深入探索这项研究的读者可以通过论文编号arXiv:2607.08964查阅完整论文项目主页提供了数据集和评测框架的开源资源。---QAQ1Long-Horizon-Terminal-Bench和普通AI编程测试有什么区别A普通AI编程测试通常几分钟内完成只看最终结果对不对评分是成功或失败二选一。Long-Horizon-Terminal-Bench的任务平均需要85分钟、231轮操作而且会对每个中间步骤打分能看出AI走了多远而不只是有没有到终点。这样能发现那些差一点就成功的情况这在传统评测里是完全看不到的。Q2为什么顶尖AI模型在Long-Horizon-Terminal-Bench上通过率这么低A根据研究分析主要原因不是每一步做错了而是无法在有限时间内把几百步全部连贯地完成。79%的失败是因为90分钟时间用完了任务还没做完还有19%是模型误以为自己做完了提前停下但实际上没通过隐藏验证测试。核心瓶颈是长线规划、时间管理和自我验证能力不足。Q3LHTB测试里哪类任务最难A根据各任务的平均得分绝大多数任务40道以上被标注为Hard只有少数几道被标注为Easy。难度较高的包括气候数据分析、科学实验重现、卫星图像处理等需要专业知识的任务以及需要对抗顶级引擎的国际象棋任务。相对容易的有N体仿真优化、代码覆盖率模糊测试、策略游戏机器人开发等。