ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

105亿入场券:具身智能的终局之争与技术逻辑

105亿入场券:具身智能的终局之争与技术逻辑 1. 105亿入场券具身智能赛道为什么突然进入终局叙事最近圈子里讨论最多的是魔法原子那轮105亿元级别的融资消息。说实话这个数字放在两年前整个具身智能赛道都凑不出这么一笔钱放在今年它却只代表一家公司的单轮融资规模。很多人在问同一个问题为什么是现在为什么是具身智能要理解这个终局叙事得先跳出机器人公司融资这个惯性思维。过去几十年机器人行业的融资逻辑一直是卖产品、做项目——我造一台机械臂卖给你或者承包一条产线的自动化改造收入来自订单和交付。这种模式的商业天花板很明显硬件毛利有限、定制成本高、复制速度慢资本市场给的估值自然也保守。具身智能走的是另一条路。它的核心变化在于机器人不再是执行固定程序的设备而是能理解语言、感知环境、规划动作、自主学习的智能体。这意味着机器人的商业模式从卖硬件产品变成了卖通用智能——就像手机行业的转折点不是手机本身而是它变成了一个承载应用生态的智能终端。资本市场愿意为这个转变给出天价估值因为他们赌的不是今天能卖多少台机器人而是下一个十年里通用机器人能不能像PC和智能手机一样成为物理世界里的通用计算平台。终局这个词也因此有了明确含义不是某款人形机器人产品的终局而是技术路线的终局、生态格局的终局。谁能在模型能力、数据规模、硬件量产和标准制定这四个维度同时卡住位置谁就有机会把具身智能定义成自己的主场。105亿不是用来造一台更漂亮的机器人而是用来买进入终局之争的入场券。这场竞赛的起点恰好卡在技术拐点上。大模型在文本和图像领域的突破已经验证了规模法则的有效性研究者开始严肃地追问如果把同样的思路搬到物理世界让模型直接从视觉、语言和动作数据里学习操作技能会发生什么答案正在被逐步验证——于是资本不再观望开始大额下注。2. 从大脑到小脑再到本体105亿到底在买什么2.1 大脑视觉-语言-动作统一模型具身智能系统里最受关注也最烧钱的部分是大脑也就是VLA模型Vision-Language-Action视觉-语言-动作模型。它的职责是接收摄像头画面和人类指令推理出下一步动作。跟传统机器人的感知-规划-控制流水线不同VLA模型把整个决策过程压缩进一个端到端的神经网络里。这套路线的吸引力在于泛化能力。传统流水线里感知模块识别物体、规划模块算路径、控制模块执行轨迹每一环都要单独调参一旦换环境、换物体、换光照整套系统就得重新标定。VLA模型见过足够多的数据之后碰到没见过的场景能靠语义理解猜出合理动作——比如你说把桌上的杯子放到托盘里它不需要事先见过这个杯子只需要理解杯子托盘放这三个概念之间的关系。但训练这种模型的成本极其惊人。高质量的操作数据不比语言数据互联网上有无穷无尽的文字和图片机器人操作数据只能从真实或仿真环境中采集。圈内比较一致的口径是一张高质量动作数据的价格贵的时候能到几十块钱一个像样的操作技能数据集动辄需要十万到百万条数据。光这一项就把没有资金储备的团队挡在了门外。2.2 小脑运动控制那层被低估的技术大脑决定做什么小脑决定怎么做。机器人光知道要把杯子拿起来没用它得在保持平衡、避开关节限位、控制输出力矩的前提下把动作稳定执行出来。这一层在业内的名字叫运动控制技术栈包括模型预测控制MPC、强化学习策略、全身动力学控制以及各类力/位混合控制方法。这层之所以容易被低估是因为很多人觉得有了大模型机器人自然就会动了。实测下来完全是另一回事。走路姿态奇怪、手臂抖动、拿东西时用力过猛把物体捏碎这些问题全出在小脑上。人形机器人尤其难双足系统天然不稳定全身有几十个自由度每一帧都要在几十毫秒内算出一组协调的关节力矩指令。最近一两年强化学习和仿真训练在双足运动上进步明显但离像人一样稳健地运动还有距离。105亿这个级别的资金进场对这一层最直接的影响是不用再为实验室里能走两步满足可以配置大规模仿真训练集群把运动策略做上千上万次迭代直到它能在真实场地里稳定跑起来。2.3 本体硬件量产卡住了太多团队最后一个烧钱大头是本体也就是机器人硬件本身。电机、减速器、编码器、灵巧手、力传感器、IMU、电池管理、散热设计——每一个零部件都在考验工程整合能力。魔法原子的资金体量意味着一件事它可以同时支持多轮硬件迭代、建设自己的产线产能而不是像很多创业团队那样每次改一版硬件都要等几个月开模。硬件领域有个被反复验证的规律机器人不是造出来就能用而是要在真实场景里跑废几十万台机器才能知道哪里设计不合理。关节磨损、线缆断裂、传感器漂移这些问题只能靠大量部署去暴露。所以真正有终局野心的公司第一目标往往不是省成本而是快速把足够多的机器人撒到场景里让数据回流、让问题暴露、让迭代闭环。没有大体量资金根本玩不起这个循环。从这份账能看出来具身智能的竞争是典型的多线程竞争单点技术再强都会在工程系统里被短板拖死。105亿不是买一个明星模型也不是买一条产线而是买大脑、小脑、本体三条线同时推进的能力以及与之配套的数据工厂和测试场。3. 决定终局归属的胜负手数据飞轮与场景选择3.1 数据成本是沉默的生死线在具身智能领域待久了会发现谁的数据多、数据好、数据便宜谁就掌握了最核心的竞争壁垒。算法模型可以开源、论文可以抄袭、硬件方案可以拆解唯独数据不能。而好的操作数据恰恰是最难获取的资源它不像互联网文本那样天然存在必须通过遥操作设备由人手动演示或者通过仿真引擎人为构造每一步都在花钱。我曾经粗略算过一笔账一支中等规模的团队假设有30个数据采集工位每日工作8小时扣除清洗和筛选一天大概能产出几千条有效动作数据。就这个产量一年也只能积累百万级的数据对应的采集成本、标注成本、存储成本加起来至少是大几千万的量级。这还是在数据质量可控的前提下——如果采集的演示动作不符合规范、场景单一、传感器不同步数据量再多也是垃圾。所以资本在这个时间点集中入场逻辑很直接现在还是模型能力和数据规模都偏早期的阶段谁先用钱把数据飞轮转起来谁的模型就会越用越强然后靠更强的模型吸引更多合作场景再带回更多数据。这个正向循环一旦转起来后来者很难追赶。3.2 仿真到现实的迁移是一条必经的近路真实数据贵那就去仿真环境里造数据。这是个听起来合理、做起来费劲的思路。现在主流的仿真工具链已经能把物理规律模拟得很像样比如在Isaac Lab、MuJoCo这些环境里批量生成任务、自动做强化学习训练。但仿真和真实世界之间存在必然的现实差距摩擦系数不对、电机延迟没建模、视觉渲染太干净导致在仿真里学得完美无缺的策略一上真实机器人就失灵。业内应对这个问题的思路是域随机化Domain Randomization简单说就是故意让仿真环境乱一点——随机光照、随机纹理、随机物理参数逼着模型学到那些不随环境变化而改变的本质规律。这套方法传授出来很玄学但实测确实是目前最靠谱的路线之一。另一个思路是仿真预训练真机微调先在仿真里让模型学会大概的动作模式再到真实机器人上跑几百条真实数据做精调两边配合效果比单靠任何一边都稳。3.3 场景选择决定数据质量所有团队都在抢场景但优质场景是稀缺资源。最理想的是标准化程度高、操作任务密集、出错的容忍度相对可控的场合——比如工厂里的上下料、分拣、质检辅助或者商业环境里的配送、整理。在这些场景里攒出来的操作数据任务密度是家庭场景的好几倍模型进步的速度自然更快。家庭场景看起来市场更大但技术成熟度要求也更高。开放环境里没有固定流程物品千奇百怪人和宠物到处走动机器人的推理能力、避障能力、交互能力都得达到相当高的水平才能应付。我的判断是真正意义上的通用家庭机器人还有好几年的路要走但这不妨碍资本先为终局下注——因为数据积累和模型进化是需要时间的现在开始跑才能在终局到来前储备足够的优势。4. 标准体系浮出水面2026版标准如何改变竞争规则4.1 标准从来都不是技术文件而是生态权力最近行业内讨论热度很高的《人形机器人与具身智能标准体系(2026版)》表面上看是技术规范实际上是在为整个赛道的终局竞争立裁判规则。智能手机时代如果没有统一的应用分发体系和接口规范开发者不可能为每个机型单独适配具身智能要成为通用平台同样需要一套从数据格式、通信接口到安全评估的标准化方案。这个变化对头部玩家是巨大利好。已经积累了大规模数据、建立了完善测试流程的公司很容易满足标准要求甚至可以直接参与标准编写标准反过来又会抬高后来者的合规成本——数据要符合格式、评测要通过认证、安全指标要达标。对小团队来说这相当于凭空多了一道门槛。4.2 标准落地的几个关键方向从公开信息能看出这份标准体系文件覆盖的范围相当广。最值得关注的几个方向包括一是数据集与标注规范统一传感器接口、动作数据格式、标注语义让不同团队的数据可以互相验证和复用二是评测基准建立统一的场景库和指标口径避免各家自说自话用不同的任务设置得出不同的成功结论三是安全与可靠性包括机器人与人交互时的力度上限、紧急停止机制、隐私数据处理规则。这几个方向直击了当前行业的痛点。拿评测来说现在很多团队汇报的成功率根本没法横向比较——有人测试场景固定不变有人只测简单抓取有人甚至把人工干预算成自主完成。标准一旦落地这些数字游戏就玩不下去了。到时候资本看项目也更容易硬指标摆在那里谁在裸泳一目了然。4.3 标准、资本与终局的三角关系把标准、融资和终局放到一起看逻辑很清晰。这是一个正反馈过程资本向头部集中头部玩家用资金推动标准落地标准反过来巩固头部玩家的生态位生态位又吸引更多资本。魔法原子上百亿级的融资在这个框架里不只是钱的问题更是话语权的问题——它意味着这家公司有能力联合产业上下游去参与制定这个赛道未来五年的游戏规则。对创业者来说这是个需要正视的信号。想在具身智能领域立足光有技术热情不够了还要理解标准化的节奏、资金的使用效率、生态卡位的时机。技术终局从来不是单点突破而是系统、生态和规则的综合较量。5. 具身智能学习路线从门外到门内的三条路径聊了这么多产业层面的东西最后说点实在的——如果你想进入这个领域或者正带着团队转型应该从哪条路入手。我根据这几年的观察和实操经验整理出三条比较稳的路径分别对应不同的背景和兴趣方向。5.1 算法方向从大模型到机器人动作背景是机器学习或计算机视觉的适合直接切入VLA模型、扩散策略、强化学习这些方向。入门的关键动作是把工具链跑熟建议从Python、PyTorch起步然后尽快搭一套完整的机器人仿真环境比如MuJoCo或Isaac Lab跑通一个最简单的视觉抓取任务。仿真环境的好处是成本低、迭代快、不用纠结硬件故障是学习阶段最理想的试验场。在这个阶段建议多读几篇近年有代表性的论文和开源项目把别人的代码跑起来拆着看重点关注三个问题数据是怎么组织的、模型怎么把视觉和语言信息融合进动作空间、训练和部署之间有哪些差异。VLA模型目前还在快速迭代期代码版本变化很快就要靠读代码来保持对细节的理解。5.2 工程方向把硬件和系统调稳的本事背景偏机械、自动化、嵌入式的人可以在传感器标定、关节驱动、整机集成这些环节找到自己的生态位。具身智能系统里最不缺的就是最后一公里问题模型输出一个动作序列怎么转换成电机的电流指令换一个负载怎么保证关节响应不抖这些问题的解决靠的是传统的控制理论和大量的工程打磨。建议从一套开源的小型机械臂或双足平台入手把从电机驱动到运动控制再到上层接口的完整链路走通。走通一次你对机器人为什么这么难的理解会比看十篇综述都深刻。这个方向的稀缺性在行业里其实是长期稳定的因为算法可以迭代、数据可以积累但一套稳定、安全、可控的硬件系统是永远都需要的底座。5.3 数据与落地方向被低估的掘金人最后一个方向最容易被忽视就是数据工程和应用落地。具身智能需要大量的数据采集、遥操作、场景设计、任务拆解和评估测试。这些工作听起来不够酷但恰恰是决定产品能不能用的关键。现在很多公司最缺的不是会写模型的人而是能把数据规范做出来、能把机器人在真实场景里用起来的人。如果你擅长动手、细心、愿意在真实场景里泡着可以从数据采集开始熟悉遥操作设备的使用、数据清洗的流程、评测指标的制定。很快你就会发现你对任务难度的判断、对模型能力边界的理解甚至比很多纯算法工程师更准确——这种以数据为锚的经历是转做算法、产品、项目管理的极佳跳板。三条路径没有绝对的优劣之分关键在于跟自己的背景结合。但有一点是共通的这个行业还处在早期理论与实践之间的鸿沟比大多数领域大得多只有亲自扑到问题里踩过几次坑才能真正理解这个领域的底层逻辑。我个人的体会是具身智能现在的状态很像智能手机刚出现的那个阶段——技术路线还未完全收敛标准和生态还没有定型所有玩家看上去都在同一起跑线。但窗口期往往比想象中短一旦某条路径的飞轮转起来后来者想追就是指数级的代价。这也是我看到大额融资进场时的第一反应该下场的下场该补课的补课别等到终局临近才意识到自己已经被甩出牌桌。
返回列表