揭秘具身智能的榜单生意链:刷榜狂欢背后的繁荣与泡沫
文/王慧莹编辑/子夜2026年上半年具身智能赛道超935亿元融资322起融资事件将行业推上风口。和融资热潮一起到来的是另一个同样高频出现的词汇——“全球第一”。据不完全统计目前活跃于行业的各类榜单已超过20个几乎每周都有新的“第一”诞生。星动纪元、智元、跨维、千寻智能、极佳视界、鹿明……各家企业的战报里动辄便是登顶某国际榜单的捷报。RoboChallenge Table30的榜首半年内换了四次World Arena在同一时期冒出了两个“第一”。更耐人寻味的是“第一” 的生产速度甚至跑赢了机器人技术的迭代速度。一款模型从发布到登顶榜单往往只需要一周榜单更新的频率甚至比企业产品迭代周期还快。当“第一”的数量越来越多时行业正在经历一场关于排名通胀的集体困惑。这种现象并不令人意外。资本在追逐标的标的在争夺注意力而注意力需要一个简单粗暴的锚点“第一名”恰好满足了这种需求。但问题是当前具身智能行业尚缺乏一套公认的技术评价体系具身智能又是个技术路线分散的赛道一个好的具身智能究竟是什么样的行业还在探索中。在一片混沌中大量评测榜单粉墨登场。公众和资本不禁要问这些第一究竟有多少含金量又是谁在批量制造这些第一当榜单狂欢盖过技术本身具身智能这条被寄予厚望的前沿赛道正在经历一场从泡沫到务实的成人礼。1、具身智能刷榜利益链谁需要第一谁帮忙制造第一时间倒回一个月前。6月3日具身智能企业千寻智能的一篇推文将行业的榜单乱象推到了台前。文章中千寻智能自研的具身基座模型Spirit v1.6在RoboArena榜单上综合得分全球第一力压英伟达Cosmos3和Physical Intelligence的Pi0.5“打破硅谷霸榜魔咒”而RoboArena更是千寻智能口中“具身智能奥林匹克”“世界级权威主榜单”。图源千寻智能微信公众号同日千寻宣布完成15亿元A轮融资三个月累计融资总额接近50亿元。技术登顶与融资落地的时间点重合一切看起来都是具身智能赛道的标准叙事一家创业公司凭借技术突破获得资本认可。殊不知仅仅几天后这场“胜利”被戳破。有业内人士梳理RoboArena公开的310条评测记录后发现其中72%的分数仅来自两个注册账号ECUST Robot Lab与Robotics Lab前者对Spirit v1.6评测了179次给出的胜率高达 97%后者评测45次胜率86.7%。形成鲜明对比的是英伟达官方用同款模型测试21次胜率为0%。更蹊跷的是这两个高频评测账号均在5月底集中注册此后Spirit v1.6的评测记录便爆发式增长其中ECUST Robot Lab累计276次评测里超过六成的评测对象都是千寻智能的模型。事件最终以RoboArena官方回溯调查、移除可疑数据、Spirit v1.6从主榜消失收场。但这起事件更像一扇窗口照出了具身智能榜单的水分。过去半年具身智能模型评测堪称“铁打的榜单流水的第一”几乎每隔几天就有一家企业宣布“登顶全球榜首”“力压国际巨头”“斩获赛道第一”。今年2月原力灵机DM0宣称在RoboChallenge真机评测中获得单任务与多任务双项第一3月极佳视界GigaWorld-1在WorldArena Track1阶段性评测中位列第一5月星动纪元Era0拿下RoboChallenge Table30综合排名第一同月智元GE-Sim 2.0登顶World Arena Track16月跨维智能DSCFuncWorld登顶World Arena Track2。这期间World Arena榜单上还出现了星动纪元Ctrl-World拿“具身任务能力全球第一”、北京人形Pelican-Unify成双冠王的局面。每个“第一”都有榜单背书每个榜单都有自己的赛道划分。当“第一”成为流水线上的标准件我们需要追问的是谁在拼命要这个第一又是谁在帮他们制造要理解这场榜单狂欢得先看清一条完整的利益链。对创业公司而言榜单第一从来不是荣誉勋章而是商业工具。本质上具身智能仍是典型的故事驱动型赛道技术路线未定型、商业化未跑通投资人判断企业价值缺乏硬指标榜单排名便成了最直观的估值锚点。一个“第一”的头衔往往能直接拉动估值上浮数亿元更是下一轮融资的敲门砖。千寻智能和星动纪元都是在登顶榜单后同步宣布的融资消息。榜单发布与融资官宣的高度同步早已是行业公开的操作惯例先拿榜单造势再用热度抬估值最后完成融资交割榜单甚至成为资本叙事里的标准配置。除了融资榜单也是企业市场宣传的核心卖点。面向政府、产业客户与公众“全球第一”是成本最低、穿透力最强的营销话术。当行业里每家公司都在讲模型能力、讲泛化能力但又缺乏一把公认的尺子时榜单第一就成了最容易被外界理解、最方便传播的信号。需求旺盛的地方自然会催生供给。如今的具身智能赛道榜单早已不是第三方中立评测而是一门成熟的生意。目前市面上的具身智能榜单大致可分为三类考察机器人真干活的能力的VLA操作综合榜、考察对物理世界的推演能力的世界模型榜、考察极端场景下的单点能力的专项基准榜。问题在于部分榜单本身就是商业产品。标准不透明、规则可干预与商务合作深度绑定。在6月举办的智源大会上智源研究院院长王仲远直言现阶段“榜单并不完全可信各种各样的榜单令人眼花缭乱。”即便是看似中立的技术评测榜单也存在大量可操作空间。RoboArena事件暴露的就是分布式评测机制的漏洞。根据官网介绍RoboArena是一个分布式评测框架发起者来自加州大学伯克利分校、斯坦福大学、华盛顿大学、英伟达等高校和科技巨头兼具顶尖学术机构、头部科技公司背书。在RoboArena上任何机构都可以成为评测者相当于考生自己可以注册账号当考官给自己打分。而更多封闭式评测榜单则存在“针对榜单专项优化”的情况。2026年自变量算法举办的具身智能黑客松赛事南京邮电大学的参赛队伍在公开A榜的 “按指令分类水果”任务中针对固定的水果品类、标准摆放位置反复微调模型将单任务成功率拉至赛事上游。但在进入完全未知的盲测B榜后赛事方新增了未训练过的水果种类、加入干扰物体并调整了桌面布局这套专为A榜打磨的模型效果大不如前。这显然是一场具身智能赛道的“应试教育”。把固定考题练到娴熟自然能交出亮眼答卷可一旦脱离预设环境性能便会立刻现形而这种定向优化换来的高分与具身智能追求的、适配真实复杂物理世界的泛化能力完全背道而驰。当需求与供给就位刷榜就成了一场心照不宣的集体狂欢。企业需要第一来融资资本需要第一来讲故事唯一被忽略的是具身智能本该扎根的技术与真实场景。2、具身智能狂奔行业需要一把价值标尺如果说刷榜乱象是表象那其根源则在于一个更深层次的困境整个具身智能行业正处于一场没有统一参照系的蒙眼狂奔之中。拆解完整条利益链条就会发现无论是企业的榜单执念还是主办方的商业操作能够成立的核心前提都是行业没有一套公认的价值标尺。实际上这种无标尺的竞争并非具身智能行业独有。回望科技产业史几乎每一个新兴赛道在概念爆发期都经历过类似的野蛮生长阶段。汽车行业有百公里加速、续航里程、自动驾驶分级这些指标统一、可量化、可复现企业很难在核心参数上长期造假消费者与投资人也能清晰判断产品优劣。手机行业有芯片制程、跑分、影像评测即便早期也曾出现过跑分作弊、针对评测软件定向优化的乱象但最终行业形成了相对统一的评价坐标系毕竟企业的真实实力很难靠榜单永久掩盖。即便是同样新的大模型赛道也形成了MMLU、GSM8K、HumanEval等公认的基准测试集覆盖知识推理、数学计算、代码生成等多个维度测试方法公开透明结果可复现。但具身智能至今没有这样一把公认的尺子。或者说具身智能尚未建立起这样的产业共识。需要明确的是具身智能是一个横跨感知、决策、运动控制、人机交互等多个领域的交叉赛道技术路线高度分散不同企业的技术路径天差地别。举例来说宇树科技深耕四足与人形机器人的底层步态算法主打硬件与运动控制千寻智能、星动纪元主打VLA具身大模型与世界模型强调语义理解与任务规划能力擎朗智能专注商用服务机器人优势在于场景适配与商业化闭环还有智元创新这类全栈自研企业从硬件本体到算法模型再到场景应用全覆盖。原则上不同路线的企业很难放在同一张榜单上比较。运动控制强的企业模型能力可能一般模型跑分高的企业真机落地可能还没开始场景落地深的企业通用能力未必突出。技术路线分散之外具身智能赛道迭代速度堪称你追我赶。这两年无论是WAIC等展会的比拼还是玩家们产品的路线都发生了变化。2024年行业比拼机器人自由度、静态行走稳定性2025年竞争焦点转向VLA视觉语言动作模型的基础操作成功率迈入2026年赛道重心转移至世界模型预测能力、无遥操连续作业、异常场景自主恢复等指标。宇树科技一年之内接连迭代G1人形机器人硬件版本先后开源UnifoLM-WMA-0、UnifoLM-VLA-0两代UnifoLM系列具身模型云深处科技机器人产品线迭代节奏迅速人形产品从DR01原型机升级至面向工业场景的DR02全天候人形机器人同时持续更新绝影系列四足机器人智元机器人持续更新AGIBOT人形本体与GE-Sim仿真世界模型迭代仿真数据集与真机作业策略星动纪元在不到一年时间内连续迭代多代具身智能算法持续演进ERA系列VLA基础模型并推出Ctrl-World可控生成式世界模型搭建策略模型与世界模型协同训练体系。图源宇树科技官方微博更深层的矛盾在于具身智能的终极考场是真实物理世界而物理世界的复杂性从根本上就难以被完全标准化。实验室里固定光照、固定物体、固定位置的测试环境到了真实的工厂、家庭、商超场景里变量会指数级增加。仿真环境里成功率100%的模型放到真机上可能连杯子都抓不稳固定场景里表现完美的机器人遇到物体偏移、光线变化、突发障碍物就可能直接宕机。这种从实验室到物理世界的天然落差让标准化评测的参考价值大打折扣也进一步加剧了行业评价体系的混乱。本质上刷榜乱象是行业从泡沫走向成熟的必然产物。当一个赛道处于概念爆发期资本大量涌入技术尚未定型商业化还没跑通市场迫切需要一套简单的符号来区分好坏、判断价值。但各行各业也反复证明当行业进入深水区泡沫会逐渐退去真实的价值标尺会最终建立。这个转折点往往发生在资本从听故事转向要业绩、行业从拼概念转向拼落地的时刻。3、参数和融资盛宴背后具身智能也将进入去泡沫期回望2026年上半年的具身智能赛道依然是资本的盛宴。IT桔子数据显示上半年国内具身智能赛道融资总金额达935亿元较 2025 年同期提升5倍融资事件322笔同比增长137%。此外百亿估值独角兽企业至少已有22家而2025年时仅有3家。参数路线分化态势愈发明显。智元GE 2.0用20亿参数登顶World Arena银河通用发布通用小脑模型AstraBrain-WBC 0.5参数规模达8040万原力灵机发布DM0.5参数量4B训练数据达15万小时……纸面参数越来越亮眼榜单排名越来越高但一个尖锐的问题始终悬在行业头顶。这些能力有多少能落到真实场景里一些变化正在悄然发生。WAIC 2026无疑是个可参考的风向标。相比于过去展会比拼“谁会倒水”“谁的手指更灵活”今年的具身智能展区展台变成了微型工位。一些玩家把酒店洗衣房、咖啡馆、便利店完整搬进展馆人形机器人全场零遥操、纯自主运行完成洗衣、叠衣、制作咖啡、商品拣选等全流程作业所有场景均来自真实合作品牌的运营需求。“零遥操、纯自主”成了本届WAIC上具身智能展示的隐形标准。企业不再靠人工后台遥控完成表演式演示而是要求机器人自主应对环境变化、处理异常情况。评价维度也从单动作成功率转向连续作业时长、异常恢复率、场景适配成本等更贴近物理世界的指标。图源WAIC微信公众号标准体系的建设也在同步推进。WAIC 2026期间《全球工业具身智能导则》编制正式启动聚焦工业场景下的环境感知、自主决策、多机协同、功能安全等核心维度试图为工业具身智能建立统一的技术与评价标准中国标准化。尽管统一的行业标准尚未完全建立但共识逐渐清晰——具身智能的能力不能靠榜单定义而要在真实场景里验证。随着宇树科技冲刺A股、智元创新启动赴港上市具身智能赛道的头部企业开始进入资本化兑现期。IPO的硬要求正在倒逼行业褪去泡沫。资本市场要的不是全球第一的头衔而是真实的出货量、营收、利润与可持续的商业模式。参考宇树、云深处等冲击资本市场的玩家靠的不是榜单排名也不是模型故事而是具身智能机器人打下的商业化基本盘。当头部企业带着真实业绩走向二级市场整个赛道的估值体系都会随之重构。过去靠一个榜单就能抬升估值的时代正在过去未来的资本会更挑剔。细数科技产业的发展规律每一条前沿赛道都会经历概念炒作、泡沫膨胀、榜单泛滥的阶段这是技术从实验室走向产业化的必经之路。具身智能作为大模型与机器人的交叉赛道承载着下一代通用智能的想象出现阶段性的概念泡沫与榜单乱象并不意外。所有的泡沫终会退去所有的虚名终会落地具身智能的终极考场永远是真实的物理世界。机器人会不会走路、模型跑分高不高最终都要回答一个问题它能不能在工厂里替代人工、能不能在家庭里提供服务、能不能在真实场景里创造价值。眼下具身智能正从概念走向产业的成人礼。未来能留在牌桌上的企业从来不是榜单上短暂的第一名而是能在真实场景里站稳脚跟、为客户创造真实价值的那一个。当刷榜的喧嚣散去真正的技术长跑才刚刚开始。