ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

装上顶级大模型的人形机器人去换灯泡,实测得分居然和躺平没区别

装上顶级大模型的人形机器人去换灯泡,实测得分居然和躺平没区别 装上顶级大模型的人形机器人去换灯泡实测得分居然和躺平没区别如果给一台装了英伟达最新大脑的人形机器人布置一项家务把梯子搬过来爬上去拧下坏灯泡换个新的再安全爬下来。你猜它会拿多少分答案是零分。不是比分偏低而是在所有测试里它一次都没搞定。更让人哭笑不得的是科研人员拿「什么指令都不发、四肢保持原样呆立着」的偷懒策略跟它对比结果发现英伟达这个最强模型跑出来的成绩在统计上跟「什么都不做」没有任何区别。一、耗时24分钟的家务活为什么让顶级大模型直接交了白卷这件事发生在2026年9月30日公布的一项名为 Fiatlux 的全新评测基准里。夏威夷大学马诺阿分校 HawAII 实验室与普渡大学的研究团队把一台身高大约1.3米、体重约35公斤的宇树 Unitree G1 人形机器人放进仿真世界里干这件苦差事。这台机器人不是实验室里的概念产物而是以16,000美元起售、普通人今天就能下单的量产硬件。考题听起来特别接地气推着一架 A 字梯走到灯具底下爬梯子把旧灯泡拧下来换上新灯泡最后把旧灯泡完好扔进回收箱。整套流程长达72,000步、跑完要花整整1,440秒也就是24分钟。任务被细拆成12个子任务包含移动梯子、向上爬、空中精细操作、拿着灯泡下梯子等环节。为了防作弊评分标准定得极严必须是「干净的成功」新旧两个灯泡一个都不能掉旧的得入箱而且手部握力一旦超过50牛顿系统就会判定灯泡被直接捏碎。登场应考的是英伟达在2026年7月正式开源的旗舰大模型 GR00T N1.7。这是目前公开发布的最高水准视言行大模型吞下了约20,000小时第一视角人类视频和大量机器人双臂数据。结果出来后所有人都愣住了。在满分加权评测中GR00T N1.7 拿到了0.0876分把机器人各关节锁死在默认位置、不下达任何命令的「零动作」策略拿到了0.0861分哪怕在系统里随便乱采指令的「随机动作」也拿到了0.0569分。大模型的得分只比「躺平」高了千分之一点五两者的差距甚至还没跨过统计学上的误差线。更扎心的是在全部12个子任务、4个不同随机环境里它的真实通关成功率全都是零。它拿到的零点零几分仅仅是因为身体偶然朝目标挪近了一点点蹭到了些许过程分并不代表哪怕一步的真正达成。二、人类戴着VR头显亲自上阵怎么也卡死在半空中很多人的第一反应大概是大模型没调好要是换成经验丰富的老工程师手动遥控肯定轻松通关吧研究人员也是这么想的。他们找来人类操作员戴上 PICO 4 头显亲自遥控这台 G1 机器人。为了给人类放水测试时甚至关掉了失败终止与超时惩罚就算中途失手也能接着试只要最终动作达标就给算分。在平地上人类的表现堪称完美。8个不涉及垂直攀爬的子任务比如平地推梯子、拿灯泡、放箱子操作员几乎每次都能干净利落地完成加权分一路冲到0.84。然而一旦脚底离开平地、双手抓向梯级画风瞬间崩塌。剩下的4个涉及垂直攀爬和带重物平衡的子任务人类操作员试了一次又一次最终合格的录像数量是零。所有尝试都在下梯子或者起步阶段卡死。机器人要么是一只脚踏空身体在多关节受力不均下失去平衡摔落要么是右手紧紧抓着梯子、单手拿着灯泡时手掌用力过猛当场捏碎了脆弱的玻璃外壳。这项测试的起点甚至都还没要求机器人从地面完整往梯子上爬而是直接把它「作弊式」地摆在梯级站稳的位置开局。即便如此人类带着清醒的意图亲自控场也没法让这台机器带着易碎品完好爬下梯子。这道出了一个残酷的现实问题根本不在于语言大脑听不听得懂指令而在于现有的全身运动控制体系根本驾驭不了多肢接触来回切换时的重心转移与微小力量拿捏。过去行业里的通用测试比如厨房操作场景 RoboCasa覆盖了150多个物体类别和100个任务但那全是在平地台面上干活至于测全身动作的 HumanoidBench也是把几十个关节自由度割裂开来单独考。从来没有哪个基准把「垂直攀爬」和「手拿易碎品」绑在一起。一旦身体处于半空中多条肢体在梯级和横梁之间不断倒换支撑点整个力学平衡的复杂度就呈指数级飙升。三、围栏里的酷炫表演和工厂车间的真实作业差了有多远如果连仿真环境里换个灯泡都能让人形机器人全面卡壳那我们在网络视频里看到的那些叠衣服、走梅花桩、端茶倒水的酷炫动作到底是怎么来的长期为自动化系统做安全与数据验证的 TaskUs 公司副总裁 Rick Balzano在一场访谈里直接撕开了这层滤镜。他挑明说今天的人形机器人绝大多数仍然只是「包装成人形的高度专用机器」。那些在网上疯传的精彩视频几乎全是精心挑选的产物地面平整光滑光线恒定周边没有任何突发干扰甚至在镜头照不到的死角还站着随时准备接管的遥控人员。Balzano 指出许多看起来在工厂里随意溜达的机器人实际被严格限制在比如40乘40英尺或米的固定安全区域内。仿真世界虽然成本低、能快速试错但他提出了一个「九成比一成法则」就算仿真系统能把机器人的能力推到90%为了解决剩下那10%涉及真实地面坑洼、硬件磨损、突发障碍的泥潭可能会把90%的实际预算消耗殆尽。更深层的麻烦是数据的极度不对称。在数字世界里训练大模型只要给机器喂海量的网页和文字就行可物理世界的安全规则不能靠文字讲道理。加州理工学院自主系统与技术中心主任 Aaron Ames 教授就给行业泼了一盆冷水。作为机器人安全领域的权威学者他在2014年提出了控制屏障函数。Ames 态度非常坚决「你不能用学习来保证安全到此为止。」他的理由很简单机器学习再强大本质上是在用海量数据做统计优化与动作模仿只要遇到没见过的混乱场景概率模型就有可能输出致命错误它无法给出一道「系统在任何情况下绝不违规」的数学证明。他主张必须用数学方程在底层加上死死咬合的安全滤波护栏规定机器人无论如何都不能突破临界受力与平衡限制。然而环顾今天的行业大量公司为了追赶吸睛的演示画面极少有人愿意静下心来把底层的数学规范做扎实这极易重演早期自动驾驶因安全隐患而接连叫停的覆辙。四、走出安全牢笼的最后一步得靠什么来兜底既然把机器人放出去干活这么难大家为什么还要急着拿掉安全防护栏原因很直白只要那道冰冷的铁围栏立在那里人形机器人就和几十年前的传统工业机械臂没有任何区别根本谈不上真正的大规模商用。《福布斯》的行业观察直言挡在机器人走向真实工作之间的最大障碍从来不是手不够灵巧、大脑算力不够充沛而是这道围栏。今天全球工厂里试点的人形机器人几乎全被圈养在隔离区里。不过这种局面正在发生剧烈变化。像 Agility Robotics 这样已经把产品送到丰田加拿大、舍弗勒等客户现场累计运行超过65,000小时的人形机器人企业就在2026年9月15日推出了新一代 Digit 5。这家公司把「彻底拿掉安全围栏、直接跟人类肩并肩干活」作为核心卖点宣称自己是在美国职业安全与健康管理局监管的标准下首台通过独立现场评估的人形机器人甚至已经手握超过3亿美元的多年期订单并深度参与到国际标准化组织 ISO 25785-1 等首批人形机器人安全准则的制定中。但这并不意味着安全难题已经被纯算法攻克了。恰恰相反各家正在想方设法从外部给机器人打补丁。就在2026年10月1日Agility 还与专门做工业安全控制的 FORT Robotics 签下了合作备忘录研发一套包含安全手柄、本体通信以及外部接口的三段式安全架构。他们准备在机器人身体之外建一座「车外安全桥」并配上带有实体急停按钮的平板底座。在设备突发故障或者环境失控的瞬间人类工人可以随时介入强行勒住机器人的动作。这表明即便强如 Digit 5也需要在自己的「安全人体检测」之外引入外部硬核硬件来托底。这也从侧面印证了 iMerit 专家 Erikk Cass 的判断机器人在关键安全数据的积累上至少比自动驾驶行业落后了大约十年。一个满地杂物、有孩子乱跑、光影不断变化的真实物理环境对任何机器大脑来说都是绝对的噩梦。换灯泡得零分表面上看是英伟达最强机器人模型的一次公开出丑但它实际上帮整个科技圈扯下了皇帝的新衣。机器人要真正走进现实世界为人分忧靠在屏幕里生成两句聪明漂亮的推理、或者在受控展台上迈出几步平稳的步子根本远远不够。物理世界是一张没有容错率的考卷。当多肢接触的平衡、毫厘之间的握力感知、以及绝不妥协的数学安全屏障这些底层硬骨头没有被彻底啃下来之前不管 AI 大脑在云端进化得多么庞大一旦身体双脚悬空它依然只能在真实的梯子面前束手无策。
返回列表