ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

GWM: Towards Scalable Gaussian World Models for Robotic Manipulation (面向可扩展的高斯世界模型用于机器人操作 ICCV 2025)

GWM: Towards Scalable Gaussian World Models for Robotic Manipulation (面向可扩展的高斯世界模型用于机器人操作 ICCV 2025) 一句话概括GWM学习“机器人执行某个动作后三维场景会怎样变化”并把预测出的未来场景用于训练机器人策略。摘要由于真实世界交互的低效性在已学习的世界模型world model内部训练机器人策略正成为一种趋势。已有的基于图像的世界模型和策略已经展现出一定的成功但它们缺乏鲁棒的几何信息而这对三维世界的一致空间和物理理解至关重要——即便这些模型已经在互联网规模的视频源上进行了预训练。Note基于3D的世界模型让机器人从“看图说话”升级为“空间推演”所以就算换环境、换光照它依然能精准地规划动作。为此我们提出了一种用于机器人操作的新型世界模型分支命名为高斯世界模型GWM。它通过推断在机器人动作影响下高斯基元Gaussian primitives的传播来重建未来状态。其核心是一个结合了3D变分自编码器3D VAE的潜在扩散TransformerDiT从而能够利用高斯泼溅Gaussian Splatting实现细粒度的场景级未来状态重建。GWM 不仅能通过自监督的未来预测训练来增强模仿学习Imitation Learning智能体的视觉表示还能作为一个神经模拟器Neural Simulator支持基于模型的强化学习Model-based Reinforcement LearningMBRL。NoteGWM一边给模仿学习提供“看得懂3D空间”的视觉特征一边给强化学习提供“不用物理引擎也能脑补后果”的虚拟沙盘。仿真和真实世界实验均表明GWM 能够精确预测以不同机器人动作为条件的未来场景并可进一步用于训练策略其性能以显著的幅度超越了当前最先进的方法充分展示了其在机器人操作学习中的巨大潜力。引言人类通过有限的感官输入构建预测性的世界模型从而能够预测未来结果并适应新情况 [12, 18]。受此能力启发世界模型学习已成为推动智能体取得重大进展的核心动力在自动驾驶 [14, 26, 27, 81, 99] 和游戏 [1, 18-22, 67, 90] 领域展现出强劲性能。随着智能体越来越多地参与到物理世界中推进用于机器人操作的世界模型学习成为一个至关重要的研究方向因为它理想情况下能使机器人具备推理交互、预测物理动态并适应各种未知环境的能力。这自然引出了以下问题如何有效地表示、构建和利用世界模型来增强机器人操作这样的需求对现有表示和模型构成了重大挑战。3D 表示的必要性高容量架构 [25, 78] 和互联网规模的预训练已将基于视频的生成模型确立为捕捉世界动态信息的强大工具这显著增强了策略学习 [83, 88]。然而它们对图像输入的依赖使其容易受到未见过的视觉变化如光照、相机位姿、纹理等的影响 [40]因为它们缺乏 3D 几何和空间理解。虽然 RGB-D 和多视角 [16, 17] 设置试图弥合这一差距但在连贯的 3D 空间中隐式地对齐图像块特征仍然具有挑战性 [62, 101]导致鲁棒性问题仍未解决。这凸显了需要一种能够将精细视觉细节与 3D 空间信息相集成的表示以增强机器人操作的世界建模。效率和可扩展性为了找到一种既能保留 3D 几何结构又能保留 2D 图像精细视觉细节的 3D 表示多视角 3D 重建方法如神经辐射场NeRF[57] 和 3D 高斯泼溅3D-GS[35] 提供了自然的解决方案。其中3D-GS 因其对 3D 场景的逐高斯显式建模而特别有吸引力将点云等高效的 3D 表示与高保真渲染相结合。然而由于这些方法主要依赖于离线的逐场景重建它们的计算需求对将其应用于机器人操作尤其是基于模型的强化学习 MBRL构成了重大挑战 [49, 92]限制了其可扩展性。为此我们提出了高斯世界模型GWM一种新颖的 3D 世界模型将 3D-GS 与高容量生成模型相结合用于机器人操作。具体来说我们的方法结合了前馈 3D-GS 重建和扩散TransformerDiT的最新进展通过基于当前观测和机器人动作条件的高斯渲染实现细粒度的未来场景重建。为了实现实时训练和推理我们设计了一个3D 高斯变分自编码器VAE从 3D 高斯中提取潜在表示使基于扩散的世界模型能够在紧凑的潜在空间中高效运行。通过这一新颖设计我们证明了 GWM 能够增强视觉表示学习提升其作为模仿学习视觉编码器的能力同时也可作为基于模型的强化学习RL的鲁棒神经模拟器。Note3D高斯VAE就是一个压缩和还原3D Gaussian场景的模型。前馈网络极度依赖大规模训练数据在机器人领域收集带动作标签的3D数据远比收集2D图片难得多。它把“计算瓶颈”转化成了“数据瓶颈”。为了全面评估 GWM我们在动作条件视频预测、模仿学习和基于模型的 RL 设置中进行了广泛实验涵盖 3 个领域的 31 个多样化机器人任务。对于真实世界评估我们引入了一个Franka PnP 任务套件包含 20 种变体涵盖域内和域外设置。在消融研究中我们评估了感知指标和成功率以验证每个构建模块的有效性。GWM 在各项任务中持续优于之前的基线方法包括最先进的基于图像的世界模型展现出显著的优势并凸显了其数据扩展潜力。总之我们的主要贡献有三点我们提出了GWM一种新颖的 3D 世界模型通过高斯扩散Transformer和高斯 VAE 实例化用于高效的动态建模。GWM 以可扩展的端到端方式学习预测准确的未来状态和动态无需人工干预。GWM 可以轻松集成到离线模仿学习和在线强化学习中具有卓越的效率在基于学习的机器人操作中展现出令人瞩目的扩展潜力。我们通过在两个具有挑战性的仿真环境中的大量实验证明了 GWM 的有效性将之前的最先进基线方法大幅提升了16.25%。此外我们在真实世界场景中验证了其实用性在 20 次试验中GWM 将典型的扩散策略提升了30%。相关工作世界模型世界模型通过基于当前观测和动作预测未来状态来捕获场景动态并实现高效学习。它们已在自动驾驶 [14, 26, 27, 81, 99, 103]、游戏智能体 [1, 18-22, 67, 90] 和机器人操作 [23, 68, 84] 中得到了广泛探索。早期工作 [18-23, 56, 66-68, 90, 97] 学习用于未来预测的潜在空间在仿真和真实世界环境中均取得了强劲成果 [84]。然而虽然在建模上有所简化潜在表示难以捕获世界的精细细节。最近扩散模型 [24, 72, 73] 和Transformer [64, 78] 的进展已将世界建模转向直接的像素空间建模 [1, 50, 51, 88]实现了细粒度细节捕获和来自互联网视频的大规模学习。然而基于图像的模型通常缺乏物理常识 [4]从而限制了其在机器人操作中的适用性。高斯泼溅3D-GS [35] 使用 3D 高斯表示场景通过可微分溅射高效地投影到 2D 平面上。与 NeRF [57] 等隐式表示相比它提供了更高的效率惠及侵入式手术 [46]、SLAM [34] 和自动驾驶 [100] 等应用。这一优势扩展到 4D 动态建模 [28, 52, 85]因为 3D 高斯类似于点云具有空间意义。然而这些方法所需的离线逐场景重建对机器人操作等实时应用带来了计算挑战。近期工作 [6, 13, 75, 86, 87, 95, 98, 102] 通过学习从像素到高斯的生成映射使用大规模数据集解决了这一问题但仍然依赖已知的相机位姿限制了可扩展性。另一并行工作 [8, 37, 71, 80] 探索了从无位姿图像进行前馈新视角合成利用预测的点图作为显式多视角对齐的代理。基于这些进展本工作开发了一种从无位姿图像构建的可扩展高斯世界模型确保策略训练的空间感知能力和可扩展性。视觉操作构建具有人类级能力的视觉驱动机器人是一个长期挑战。视觉模仿学习方法 [5, 36, 39, 45, 76] 使用各种视觉表示来模仿专家示教如点云 [7, 15]、体素 [44, 70]、NeRF [11, 32, 41, 43, 69, 92] 和 3D-GS [49]。虽然这些方法在已学任务上有效但在未见过的真实世界场景中表现不佳 [53, 54]。强化学习通过试错来优化策略弥补了这一差距但需要昂贵的真实世界交互。因此许多方法采用仿真到现实sim-to-real迁移即在世界的数字孪生体中学习 RL 策略并部署执行。尽管如此由于依赖预定义资源 [3, 58, 79] 或将真实世界物体转换为仿真所需的劳动密集型转换 [10, 38, 42, 47, 48, 63]可扩展性仍然是一个挑战。为解决这些限制GWM 专注于为模仿学习提供更强的视觉表示并为视觉 RL 提供高效的神经模拟器以实现更有效和可扩展的机器人操作。Note漏掉了“可微分物理引擎”这一整条技术路线本质是用Splat3R前馈解决速度用VAE解决高斯数量不一致用DiT解决生成质量。但前馈Splat3R本身就有重建误差VAE压缩又有信息丢失DiT生成又有幻觉。三级误差串联长时序预测极容易漂移。高斯世界模型我们的 GWM 方法的整体流程如图 2 所示其中我们构建了一个高斯世界模型用于推断以 3D 高斯基元表示的未来场景重建。具体来说我们将现实世界的视觉输入编码为潜在的 3D 高斯表示第 3.1 节并利用基于扩散的条件生成模型在给定机器人状态和动作的条件下学习表示上的动态第 3.2 节。我们证明了 GWM 可以灵活地集成到离线模仿学习和在线基于模型的强化学习中用于多样化的机器人操作任务第 3.3 节。世界状态编码NoteTransformer要求每批输入的特征尺寸基本一致。基于扩散的动力学建模Note简单来说在训练阶段历史状态是你看了前5秒的视频已知信息动作是你按下的手柄按钮。你想让AI猜出第6秒的3D画面未来状态。第一步给真实拍摄的第6秒清晰画面Ground Truth施加高斯噪声。第二步把“第6秒的带噪画面”扔给AI同时给它看“前5秒历史”和“动作命令”。让AI尝试从这团雪花里把原图恢复出来。第三步就是训练好后直接推理但这有一个问题这需要海量的数据进行训练。GWM 用于策略学习实验在我们的实验中我们重点关注以下问题在不同领域中动作条件的视频预测结果的质量如何高斯世界模型是否有利于下游的模仿学习和强化学习与基于图像的世界模型相比它是否展现出更强的鲁棒性高斯世界模型如何帮助典型策略例如扩散策略 [9]在真实世界的机器人操作任务中发挥作用在以下章节中我们将详细描述模型在这些关键主题上的性能表现。具体来说我们在实验中采用了以下三个测试环境和四个任务环境为了全面分析 GWM 的能力我们在两个仿真环境和一个真实世界环境中评估我们的方法(1)MetaWORLD[91]一个用于学习机器人操作 RL 策略的仿真环境(2)ROBOCASA[59]一个大规模的、多尺度的仿真模仿学习基准包含厨房环境中多样化的机器人操作任务以及 (3)FRANKA-PNP一个使用 Franka Emika FR3 机械臂的真实世界抓取-放置环境。任务我们精心设计了四个任务以系统地评估 GWM 在不同测试环境中的表现(1)动作条件场景预测评估 GWM 在世界建模和未来预测方面的有效性(2)基于 GWM 的模仿学习考察表示质量及其对基于模仿学习的机器人操作的益处(3)基于 GWM 的强化学习探索其用于基于模型的强化学习的潜力以及 (4)真实世界任务部署评估 GWM 在真实世界机器人操作中的鲁棒性。动作条件场景预测实验设置世界模型生成高保真且与动作对齐的展开rollouts的能力对于有效的策略优化至关重要。为了评估这一能力我们在所有考虑的仿真和真实环境中使用可用的人类演示数据训练 GWM并通过以验证集中采样的未见动作轨迹为条件评估未来预测的质量。对于定量评估我们采用了生成质量的常用指标包括FVD[77] 用于测量时序一致性以及基于图像的指标PSNR[29] 用于像素级精度SSIM[82] 和LPIPS[96] 用于感知质量。结果与分析我们在表 1 中提供了我们的方法与 iVideoGPT 之间的定量比较。如表 1 所示我们的方法在仿真和真实环境上均持续优于当前最先进的基于图像的世界建模方法 iVideoGPT证明了我们基于扩散的高斯世界模型学习流程的有效性。值得注意的是如图 3 所示像 iVideoGPT 这样的基于图像的模型在捕捉动态细节例如夹爪方面容易失败。尽管这些细节可能不会在视觉指标上造成大的差异但它们会显著影响策略学习正如我们将在第 4.3 节中讨论的那样。我们在图 4 中提供了 GWM 在 ROBOCASA 和 FRANKA-PNP 上预测结果的更多定性可视化。基于 GWM 的模仿学习实验设置如第 3.3 节所述GWM 可用于从图像观测中提取信息丰富的表示这预计将有益于模仿学习。我们通过在 ROBOCASA 上测试 GWM 在模仿学习中的有效性来验证这一特性。ROBOCASA 中的任务套件包含 24 个原子任务带有相关的语言指令用于厨房环境包括抓取-放置、打开和关闭等操作。每个任务提供有限的一组 50 个人类演示和一组 3000 个由 MimicGen [55] 生成的演示。我们在这些演示上训练 GWM并将其作为最先进的BC-Transformer[59] 的状态编码以成功率指标进行定量比较。结果与分析我们在 ROBOCASA 基准上的实验结果见表 2展示了我们的方法在多任务模仿学习场景中的有效性。在 24 个厨房操作任务中我们的方法持续优于 BC-Transformer 基线。在有限的人类演示H-50下我们的方法在成功率上平均提升了10.5%。在使用生成演示G-3000训练时我们的方法保持了可扩展的性能平均增益为7.6%。值得注意的是我们的方法在复杂的操作任务如抓取-放置操作和交互式任务如打开/关闭电器中表现出特别的优势这些任务的性能提升最为显著。这些结果证实了我们的方法从视觉观测中提取信息丰富的表示的能力能有效增强实际机器人操作场景中的模仿学习能力。基于 GWM 的强化学习实验设置我们在 MetaWORLD [91] 的 6 个复杂度递增的机器人操作任务上评估 GWM 用于 RL 策略的能力。我们实现了一种受 MBPO [31] 启发的基于模型的 RL 方法使用 GWM 生成合成展开synthetic rollouts以扩充 DrQ-v2 [89] actor-critic 算法的回放缓冲区。我们纳入了最先进的基于图像的世界模型 iVideoGPT [83] 作为强基线。为了公平比较我们不对两种方法使用预训练初始化。所有比较方法使用相同的上下文长度、预测范围并训练到最大1 × 10^5步。结果与分析图 5 显示GWM 在所有 6 个 MetaWORLD 任务上持续优于 iVideoGPT。平均而言GWM 的收敛速度比 iVideoGPT 快约2 倍并在复杂操作任务上达到了更高的渐近性能。优越的性能源于 GWM 的 3D 高斯表示它允许更准确地预测接触动力学和操作下的物体运动相比于纯粹的基于图像的方法。结果证实显式的 3D 表示为需要精确空间推理的机器人控制任务提供了显著优势。真实世界部署实验设置我们部署了一台 Franka Emika FR3 机械臂和一个 Panda 夹爪进行真实机器人实验。我们专注于拾取一个彩色杯子并将其放到桌子上的盘子中的真实世界任务。我们使用 MuJoCo AR 远程操作接口 [65] 收集了 30 个演示的小规模数据集。我们还设置了一台第三视角的 RealSense D435i 相机仅提供无位姿的 RGB 图像用于观测。我们在图 6 中提供了真实世界任务设置的概览。与第 4.2 节中的实验设置类似我们比较了最先进的基于 RGB 的策略 Diffusion Policy [9] 在使用或不使用我们的 GWM 表示时的任务成功率用于定量分析。结果与分析如表 3 所示在 20 次试验不同的初始起始位置和物体位置即干扰物中GWM 以65%的成功率优于 Diffusion Policy 的35%。对于新的干扰物性能差距进一步扩大证明了 GWM 卓越的泛化能力。我们的方法在不同任务变体中保持了一致的性能这得益于其有效的世界模型该模型捕获了任务相关的动态同时对视觉差异具有鲁棒性。真实世界展开在补充文件中展示优势主要源于更精确的物体定位和准确的放置操作。结果证明了 GWM 在真实世界机器人操作任务中具有鲁棒的时空理解能力。消融分析我们在 ROBOCASA 上进行了额外的实验以进一步验证我们的设计选择。高斯泼溅的选择如表 4 所示与直接在 [1] 的基础上构建基于图像的扩散Transformer世界模型相比引入高斯泼溅将成功率SR从4%显著提升至18%。虽然 PSNR 略有下降但 SSIM 和 LPIPS 指标均有改善表明高斯泼溅在不同时间步长上提供了更好的 3D 一致性。这验证了我们的假设与纯 2D 方法相比显式的 3D 表示增强了机器人学习的空间理解能力。3D 高斯 VAE 的选择进一步引入 3D VAE 组件在所有指标包括 PSNR上带来了一致的改进。成功率从18%进一步提升至24%。结果证实我们的 3D 高斯 VAE 高效地捕获了场景的潜在结构在保持空间理解的同时实现了更紧凑的场景表示。Note5个实验。结论在本文中我们提出了一种新颖的高斯世界模型GWM用于机器人操作通过融入鲁棒的几何信息解决了基于图像的世界模型的局限性。我们的方法通过建模在机器人动作作用下高斯基元的传播来重建未来状态。该方法结合了扩散TransformerDiT和一个3D感知的变分自编码器通过高斯泼溅实现精确的场景级未来状态重建。我们开发了一个可扩展的数据处理流水线以促进在基于模型的强化学习框架中的测试时更新能够从未经标定相机位姿unposed的图像中提取对齐的高斯泼溅表示。仿真和真实世界的实验均证明了 GWM 在预测未来场景和训练更优策略方面的有效性。全文总结一句话概括GWM学习“机器人执行某个动作后三维场景会怎样变化”并把预测出的未来场景用于训练机器人策略。它与ContactGaussian-WM不同ContactGaussian-WM物理模型路线重点辨识摩擦、质量等参数。GWM数据驱动路线使用Diffusion Transformer直接学习动作与三维场景变化的关系。1. 要解决的问题传统视频世界模型在二维图像中预测未来容易受到相机视角、纹理和光照变化影响并且缺少稳定的三维空间信息。另一方面传统3DGS需要针对每个场景单独优化速度慢不适合机器人在线训练。GWM希望做到从普通RGB图像快速建立3D Gaussian场景根据机器人动作预测未来的3D Gaussian场景用预测结果减少机器人真实交互数据的需求。2. 方法流程核心模块包括Splatt3R不需要已知相机位姿从RGB图像快速重建3D Gaussian3D Gaussian VAE把数量不固定的Gaussian压缩成固定长度的潜变量Diffusion Transformer以当前三维状态和机器人动作为条件预测下一状态奖励预测头在强化学习中同时预测动作奖励。单步关系可以表示为连续递推后得到完整的未来三维场景和视频。3. 输入和输出输入当前单视角或双视角RGB图像历史场景状态机器人动作序列。输出下一时刻的3D Gaussian场景从不同视角渲染的未来图像连续预测得到的未来视频强化学习时还可以预测奖励。它不直接输出机器人动作。机器人动作由模仿学习或强化学习策略输出GWM负责预测这些动作的结果。4. 主要贡献这篇论文最重要的意义是它把3DGS从“针对单个场景进行离线重建的表示方法”变成了“能够跨场景、根据机器人动作预测未来的可训练世界模型”。它同时展示了3D Gaussian世界模型的三种用途预测动作条件下的未来三维视频为模仿学习提供空间感更强的视觉特征作为强化学习的神经模拟器生成虚拟交互数据。5. 局限性它是数据驱动模型并不显式估计质量、摩擦和接触力不能保证预测结果严格满足真实物理规律实验中每次只预测下一步长视频依靠递归生成容易累积误差真实实验只有30条演示和20次测试规模仍然较小真实任务仅验证了杯子抓取放置尚未证明复杂接触任务的通用性。因此最准确的评价是GWM不是精确物理模拟器而是一个具有三维空间结构的数据驱动神经模拟器。它的主要价值是利用三维未来预测提升策略特征并为强化学习生成低成本的虚拟交互数据。6. 数据集、算力、开源程度第一层DROID大规模预训练官方仓库要求先下载DROID完整版约1.7TB测试版100个episode约2GB先训练3D Gaussian VAE再训练Diffusion Transformer。DROID完整数据包含大量机器人交互轨迹、外部/腕部RGB图像、机器人状态、动作、语言指令和奖励等官方资料统计约7.6万条演示、350小时交互数据。预训练流程是第二层下游训练和评价预训练后再针对具体任务使用RoboCasa模仿学习Meta-World强化学习Franka-PNP真实机器人抓取放置。因此更完整的训练结构是论文没有公开完整算力配置目前能确认的是官方预训练脚本默认使用单机4张CUDA GPU但没有说明具体是A100、H100还是其他显卡。公开配置如下截至2026年9月GWM的官方代码开源程度大约可以评价为4/10核心模型代码已开源但还不能完整复现论文实验。开源了什么官方仓库已经包含3D Gaussian VAEDiffusion TransformerGaussian预测器和奖励模型DROID数据读取与配置VAE、DiT的多GPU预训练脚本Splatt3R依赖和安装说明MIT许可证。可以用来研究模型结构并尝试训练核心世界模型。
返回列表