ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

李飞飞团队全新统一世界模型:15小时数据兼顾正向仿真、逆向动作生成

李飞飞团队全新统一世界模型:15小时数据兼顾正向仿真、逆向动作生成 一站式支撑机器人策略评估、模型规划与动作提取三大具身任务。——统一世界建模目录01 掩码视觉动作完整技术实现逻辑掩码动作把动作直接“画”进视频画面两类互补掩码数据集构建方案轻量化LoRA微调方案无全量重训开销三大下游标准化应用链路02 横向定位四类机器人视频世界路线对比03 实验结果验证掩码接口不可替代性跨本体零样本泛化测试下游任务定量表现04 一套掩码输入自由切换两大核心功能李飞飞课题组联合马里兰、哈佛等机构推出Masked Visual Actions掩码视觉动作只用一套视频模型、仅15小时虚实混合数据微调既能输入机器人轨迹预测环境交互也能输入物体目标运动反推机器人动作。在单臂机械臂、定制夹爪、人形双臂机器人三类从未见过的设备上全部稳定运行解决动作表征与视觉预训练模型不兼容、跨本体泛化差、双向建模需分开训练三大难点为通用机器人仿真、离线策略评测提供轻量化统一底座。01 掩码视觉动作完整技术实现逻辑整套框架基于开源14B Wan视频基座模型微调核心创新是像素级掩码动作接口配套双数据集构建管线、统一双向推理逻辑无需新增大量神经网络模块仅靠LoRA轻量化微调即可落地。整体架构简洁、适配各类桌面与仿真机器人场景。▲Masked Visual Actions完整技术总览图掩码动作把动作直接“画”进视频画面摒弃数值动作向量把任意实体机械臂/待操作物体时序轨迹渲染为画面掩码掩码区域像素完整保留、其余画面填充统一灰色作为模型输入条件。简单理解模型原生任务是视频补全掩码区域作为已知先验灰色区域是需要预测的未知画面天然贴合视频模型预训练的图像修复逻辑不需要额外跨模态转换层。对于研究中的核心条件分布灰色画面|掩码实体轨迹初始帧掩码实体集合自由切换切换实体就能切换模型推理方向。若为机器人正向动力学模型给定机械臂运动预测杯子、抽屉等物体交互变化若为目标物体逆向动力学模型给定物体想要到达的轨迹自动生成配套机器人抓取、搬运动作。▲正向、逆向掩码推理可视化对比图这套设计最大优势是本体无关掩码只记录像素层面运动轮廓不绑定机器人关节维度、夹爪结构从未训练的人形双臂机器人输入掩码后也能生成无穿模、符合物理逻辑交互视频。两类互补掩码数据集构建方案研究提供的分割、渲染两条数据生成路径分别适配真实视频与仿真场景二者互补解决掩码获取难点。分割式数据集依托SAM分割模型直接从DROID真实机器人视频里分割机械臂像素无需机器人URDF模型与相机标定零成本快速生成大量真实掩码样本缺陷是遮挡区域掩码存在信息泄露测试时无法自定义任意新动作轨迹。渲染式数据集读取视频同步记录的机器人关节状态加载URDF三维网格结合相机外参渲染半透明机械臂掩码夹爪高亮红色方便模型识别。优势是推理阶段能手动生成任意全新动作掩码短板必须完整标定相机与机器人参数仅仿真与带状态记录的真实数据集可用。整套训练数据仅合计15小时融合DROID真实人机视频、Robocasa仿真操作片段同时纳入任务失败轨迹保证模型学会异常交互场景预测。▲分割法与渲染法数据集优劣对比表轻量化LoRA微调方案无全量重训开销基座14B视频大模型完整参数冻结仅用秩256 LoRA分支微调掩码补全任务8张H200 GPU训练约10000步4天即可完成收敛。训练损失仅采用视频重建损失无需额外动作对齐损失掩码区域作为条件不参与损失计算仅约束灰色未知区域像素生成精度。训练完成后单权重文件无分支拆分前向、逆向推理共享一套参数不用维护两套模型权重。三大下游标准化应用链路微调完成的模型可直接接入机器人开发全流程落地了三类工业可用场景策略离线评估批量仿真机器人执行轨迹用多模态大模型Gemini 3.1 Pro自动打分不用真机反复试错磨损硬件仿真成功率与真实机器人执行相关系数r0.982参考价值极高▲仿真与真实任务成功率相关性散点图基于模型规划Best-of-N从扩散策略采样多条候选动作掩码输入模型预判每条轨迹交互结果筛选最优动作下发真机RoboCasa全任务平均成功率提升7%~26%▲各类方法动作提取任务成功率柱状图逆向动作提取输入人类演示的物体运动掩码模型生成对应机器人操作视频搭配逆动力学模型输出可执行关节动作无需专门逆向任务训练零样本完成物体轨迹到机器人控制量转换。02 横向定位四类机器人视频世界路线对比当前机器人视觉动作建模分为四条主流技术路线从数据成本、双向建模、跨本体泛化、工程成本四个维度做客观横向对比关节/骨架数值条件基线Ctrl-World、VAP优势动作向量存储空间小训练代码成熟短板只能正向预测跨本体生成机器人严重扭曲更换夹爪、人形机器人性能暴跌BEHAVIOR数据集PSNR仅18.39同条件本文22.90泛化差距明显。▲不同视觉条件消融定量对比表单一机器人掩码方案Mask2IV、BridgeV2W优势像素对齐、单机器人精度高短板掩码只能固定机械臂实体无法切换物体做逆向推理一套模型仅适配单一机型复用性差。文本引导视频世界模型优势通用性强、无需动作输入短板空间指代模糊杂乱桌面环境容易混淆目标物体无法精准控制精细抓取轨迹不适合操作类机器人。03 实验结果实验分为消融对比、跨本体泛化、三大下游任务三块全部采用DROID真实机器人、Robocasa仿真、BEHAVIOR人形机器人三类数据集不单纯罗列指标拆解数值背后实际工程意义。验证掩码接口不可替代性消融变量分为末端可视化、骨架可视化、本文掩码视觉动作三类指标选用LPIPS越小越好、SSIM、PSNR越大越好▲三类条件输入定性效果对比图训练集同机型DROID场景三类方案指标差距不大骨架 PSNR 22.74本文 23.74基线差距微小同款机器人更换非标夹爪骨架LPIPS升至0.169本文仅0.148稀疏条件出现明显精度衰减未见过的人形双臂BEHAVIOR机器人骨架 LPIPS 0.162本文低至 0.123PSNR 高出 3.51泛化优势完全拉开。指标局限PSNR、LPIPS 仅衡量画面像素相似度无法量化物理合理性骨架基线数值尚可但人形机器人生成出现肢体穿插、悬浮等违背物理的画面纸面高分不代表能用于真机规划。跨本体零样本泛化测试核心实验全程未用人形机器人数据训练直接输入双臂掩码做推演。▲未见人形机器人仿真效果图Ctrl-W、骨架基线生成人形机器人肢体错位、单臂膨胀变形本文掩码方案完整还原双臂开门、搬运动作物体接触、推拉交互无失真。本质原因在于骨架、末端条件是机器人专属稀疏特征掩码是通用像素运动表征不绑定机器人结构不受关节数量、外形约束。下游任务定量表现策略评估仿真任务成功率与真机高度线性相关r0.982但模型存在轻微乐观偏差仿真打分普遍略高于真实机器人仅能作为筛选参考不能完全替代真机测试▲真实与仿真任务进度分布小提琴图模型规划随候选动作采样数量提升任务成功率稳步上涨N10样本时平均成功率提升19%证明模型能精准区分有效/无效操作轨迹逆向动作提取仅靠正向训练权重零样本完成物体轨迹转机器人动作RoboCasa咖啡摆放任务成功率90%高于ACT、molVLA等传统模仿学习基线无需单独训练逆向网络。04 一套掩码输入自由切换两大核心功能过去想要同时实现前向预测与逆运动求解只能搭建两套独立网络数据与算力成本翻倍。Masked Visual Actions用像素掩码打通视频大模型与机器人交互的适配壁垒用同一套掩码输入自由切换正向仿真、逆向动作生成两大核心功能。大幅降低机器人数据采集成本仅15小时虚实混合数据完成微调跨机器人通用仿真底座单臂、定制夹爪、人形双臂不用重新训练逆向建模无需额外标注人类动作直接从物体运动推导机器人操作。该工作给通用机器人世界模型提供一条轻量化新思路不用强行改造视频基座只通过视觉掩码对齐动作与像素先验就能低成本实现跨本体双向建模后续若融合深度、激光输入拓展移动底盘时序掩码或将覆盖室内导航、户外巡检更多机器人品类。Ref参考论文Masked Visual Actions for Unified World Modeling论文链接https://arxiv.org/pdf/2607.19343项目主页https://masked-visual-actions.github.io
返回列表