【学习笔记】SONIC:像训练大模型一样训练人形机器人
SONIC像训练大模型一样训练人形机器人——NVIDIA用21万GPU小时打造通用全身控制器前言在人形机器人控制领域长期以来存在一个尴尬的局面大语言模型已经用上了万亿参数、上万张GPU而最先进的机器人控制策略往往还只是一个三层MLP多层感知机在几张显卡上训练一个单一任务。为什么会这样是机器人控制本身就不需要规模化的能力还是我们一直没有找到正确的“任务”来规模化NVIDIA GEAR实验室的最新工作SONICSupersizing Motion Tracking for Natural Humanoid Control给出了一个令人信服的答案将“运动追踪”作为基础任务通过规模化Scaling Up我们可以在人形机器人上复现类似大模型的涌现能力和泛化性。论文链接SONIC Project Page一、核心思想为什么是“运动追踪”传统方法的痛点过去的人形机器人控制主流思路有两种方法代表工作痛点任务专用奖励工程各种行走、奔跑控制器每个新任务都要重新设计奖励函数无法泛化对抗式模仿学习AMP、ASE、CALM用判别器区分真实/生成动作数据一多就容易模式崩溃这两种方法的共同问题是它们都不“可扩展”。任务越多需要的人力就越多数据越多训练反而越不稳定。SONIC的洞察SONIC提出了一个关键洞察运动追踪是一个天然“可扩展”的任务。为什么密集监督动作捕捉数据的每一帧都是一个明确的目标姿态不需要任何奖励工程。数据丰富过去几十年积累的动作捕捉数据浩如烟海行走、跑步、舞蹈、体育、物体交互……。信号稳定随着数据量增加监督信号始终明确可用不会像判别器那样变“模糊”。一句话总结运动追踪 机器人领域的“语言建模”每一帧都是一个“token”整个任务就是让模型学会预测“下一个姿态”。二、规模化实验参数、数据、算力三管齐下SONIC在三个维度上进行了系统的规模化实验2.1 数据规模训练集规模帧数对应的运动片段数小4M20k中10M50k大22M110k超大100M310k原始数据约700小时经筛选和重定向后得到611小时有效训练数据50fps。2.2 模型规模从1.2M参数到16M参数再到42M参数。虽然和大语言模型比起来这个规模还很小但在物理仿真的人形机器人控制领域这已经是一个数量级的跃升。2.3 计算规模节点数GPU数训练迭代数GPU耗时2节点16 GPU50k~2K小时4节点32 GPU50k~9K小时16节点128 GPU50k~21K小时2.4 核心结论规模化确实有用实验中SONIC用两种测试集来评估泛化能力test-content完全没见过的运动类型如某种特定的舞蹈风格test-repetition见过类型但没见过的具体表演片段模型规模test-content成功率test-content追踪精度(MPJPE-L)1.2M98.0%27.7mm16M98.9%25.4mm42M99.6%23.8mm结论非常清晰模型越大、数据越多、算力越强性能越好特别是在处理从未见过的新运动时泛化能力的提升尤为明显。三、技术架构三个关键设计让规模化落地拥有了一个强大的追踪策略之后SONIC面临的第二个问题是如何让它真正服务于各种实际应用SONIC用三个核心设计解决了这个问题3.1 通用控制策略一个网络三种输入SONIC的策略网络采用了多编码器 共享隐空间 统一解码器的架构输入类型A机器人关节角度──→ 机器人编码器 ε_r ──┐ 输入类型BSMPL人体姿态 ──→ 人体编码器 ε_h ──→ FSQ量化器 ──→ 通用令牌 ──→ 控制解码器 ──→ 关节指令 输入类型C混合/稀疏输入──→ 混合编码器 ε_m ──┘核心创新FSQ量化Finite Scalar QuantizationSONIC没有用传统的VQ-VAE而是用了FSQ做量化原因VQ-VAE的致命问题码本坍塌Codebook Collapse即大部分的码本向量在训练中从未被使用导致表示能力下降。FSQ的优势从根本上避免了码本坍塌训练更稳定且配合PPO进行端到端训练时梯度回传更干净。3.2 生成式运动规划器把“意图”变成“轨迹”追踪策略本身只是一个“执行器”它需要一个“参考运动”才能工作。SONIC的生成式运动规划器负责把用户的高层意图“往前走”、“蹲下到0.5米高度”、“左勾拳”转化成具体的运动参考轨迹。技术亮点采用掩码令牌预测Masked Token Prediction架构和MagViT等视频生成模型类似生成片段长度灵活0.8-2.4秒每100ms即可重新规划响应极其敏捷仅需一个代表性动作片段就能生成一类技能无需任何额外训练3.3 通用令牌空间连接所有模块的“通用语言”这是SONIC最优雅的设计之一。所有的输入——无论是游戏手柄的方向指令、VR头显捕捉的全身姿态、网络摄像头的视频流还是VLA模型输出的高层决策——最终都会被映射到同一个通用令牌空间中。这个设计有两个关键收益即插即用切换输入源只需要切换对应的编码器无需重新训练策略。对VLA友好离散的、低维的令牌空间远比连续的关节角度更容易被VLA模型学习和预测。四、实验结果全面的能力展示4.1 追踪性能全面超越基线与当前最先进的追踪方法对比方法test-content成功率test-repetition成功率MPJPE-L (mm)Any2Track31.1%38.4%—BeyondMimic81.6%85.8%39.1GMT———SONIC (Ours)98.7%99.6%23.2SONIC的追踪精度比BeyondMimic降低了41%的误差。4.2 碾压专用控制器通用模型战胜专用模型SONIC和专门为行走设计的控制器OpenHomie进行了速度追踪对比指标OpenHomie专用SONIC通用整体存活率43.0%98.5%1.5m/s时存活率20%~100%至4m/s这是一个非常反直觉但又极具说服力的结果一个通用模型在特定的行走任务上击败了一个为此任务专门设计和优化的专家模型。4.3 仿真到真实几乎零差距在真实Unitree G1机器人上测试了123个运动序列场景成功率MPJPE-L仿真100%22.3mm真实世界99.2%25.7mm上半身误差差距极小21.8mm vs 22.2mm脚部的差距较大29.0mm vs 53.7mm反映了真实世界中足部接触动力学的复杂性。4.4 抗干扰能力11公斤重物砸下来也不倒论文中展示了一个令人印象深刻的实验在执行策略的过程中一个约11公斤的重物从头部高度砸到机器人身上。机器人吸收冲击、保持平衡、继续执行运动——没有任何恢复模块或策略自适应。五、最精彩的部分VLA驱动的全身操控这是SONIC最具前瞻性的贡献。SONIC的通用令牌空间被直接作为GR00T N1.5 VLA模型的“动作空间”。为什么令牌空间比关节角度更适合VLA论文做了清晰的消融实验VLA动作空间平均成功率最复杂任务易拉罐回收入桶直接预测SMPL姿态27%0%预测FSQ通用令牌68%60%原因离散令牌空间是低维、结构化的VLA更容易学习连续SMPL姿态空间会放大VLA的微小预测误差导致灾难性失败令牌空间天然对齐了所有输入模态VLA看到的训练数据分布一致五个真实任务展示任务接口类型训练轨迹数成功率苹果放盘子3点接口3-point30090%捡胡萝卜全身接口whole-body3,90075%捡清洁刷全身接口whole-body3,90095%踩踏板开垃圾桶全身whole-body20070%易拉罐回收全身5步复合whole-body1,00060%电钻装箱搬运全身whole-body30070%其中“易拉罐回收”任务涉及走到桌前→单手拿起易拉罐→走到垃圾桶前→用脚踩踏板开盖→单手投掷入桶要求手、脚、全身平衡的实时协调——这在过去是一个极难实现的全身操控场景。六、为什么SONIC能成功一个更深层的解释论文在讨论部分给出了一个关键洞察值得单独拿出来说运动追踪的规模化优势来源于其“密集逐帧监督”的性质。这和其他方法形成了鲜明对比方法类型监督性质规模化结果任务专用奖励稀疏、任务特定能力饱和无法泛化对抗式模仿判别器信号随多样性下降数据越多越容易模式崩溃运动追踪密集、逐帧明确信号随数据增长而丰富持续受益简单说其他方法在规模扩大时会“变傻”而运动追踪是“越学越聪明”。七、局限性与未来展望当前局限安全性与能效目前没有对长时间部署中的安全性和能量效率做正式处理极端运动失败需要长时间、复杂地面接触的极端姿态如僵尸爬行、盘腿坐仍然会导致追踪失败地面接触挑战足部在真实世界中的精度53.7mm显著低于仿真29.0mm反映了接触动力学的复杂性未来方向SONIC的愿景是将自己定位为一个**“基础层”**。在这个基础上未来可以构建更高层次的感知模块理解和理解环境推理模块进行任务规划和决策交互模块与人类进行自然交互这标志着通用人形机器人自主性的重要一步。总结SONIC是近年来人形机器人控制领域最具启发性的工作之一。它证明了“规模化”的范式可以迁移到机器人控制领域——只要选对了“基础任务”运动追踪是一个理想的基础任务——具备密集监督、数据丰富、信号稳定的特点通用模型可以战胜专用模型——用42M参数训练的通用追踪器在行走任务上完胜专用行走控制器统一的令牌空间是关键设计——它连接了底层控制和高层VLA模型是通往通用机器人智能的桥梁对于行业从业者而言SONIC提供了一个清晰的路线图与其为每一个新任务重新设计控制器不如投入资源构建一个大规模的运动追踪模型然后用它作为“通用操作系统”在其上快速开发各种应用。参考资料论文SONIC: Supersizing Motion Tracking for Natural Humanoid Whole-Body Control代码https://github.com/NVlabs/GROOT-WholeBodyControl数据集BONES-SEED on Hugging Face