ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

具身智能论文学习19:DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning

具身智能论文学习19:DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning 第一部分基本收录情况项目内容论文全名DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning中文译名《DINO-WM基于预训练视觉特征的世界模型实现零样本规划》正式会议The 42nd International Conference on Machine Learning会议简称ICML 2025会议时间2025年7月13日至19日会议地点加拿大温哥华正式出版Proceedings of Machine Learning ResearchPMLR卷号Volume 267正式页码79115–79135作者Gaoyue Zhou、Hengkai Pan、Yann LeCun、Lerrel Pinto主要机构New York UniversityMeta AI论文方向World Model、视觉规划、机器人控制、潜空间动力学核心视觉模型DINOv2动力学模型ViT-based Transition Model训练方式离线轨迹训练测试方式MPC CEM动作序列优化是否需要奖励不需要是否需要专家示范不需要作为任务求解监督是否需要逆动力学模型不需要是否严格VLA不是是否正式发表是ICML 2025官方论文页DINO-WM ICML 2025 / PMLR正式页面第二部分世界模型的两种主要用途世界模型World Model的核心并不是“直接输出机器人应该执行什么动作”而是学习环境的动力学规律即也就是回答“如果在当前状态下执行这个动作接下来世界会变成什么样”学会这种环境变化规律以后World Model 主要有两种典型用途。1生成和模拟数据缓解真实数据与长尾场景不足现实机器人和自动驾驶的数据不可能覆盖物理世界中的所有情况特别是事故、极端天气、异常交互等低概率长尾场景往往既难采集又存在安全风险。World Model 学会环境如何随动作变化之后可以在虚拟环境中模拟大量未来轨迹和不同场景这些模拟经验可以进一步用于Policy 训练、强化学习、模型测试或长尾场景评估。因此这条路线的重点是World Model→生成更多经验→再训练/测试 Policy​也就是说World Model 在这里主要承担的是一个“可学习的虚拟环境/数据生成器”角色。2测试时预测未来并进行规划本文所采用的另一种用法是不再利用 World Model 生成数据去重新训练 Policy而是直接在部署阶段用它辅助决策。给定当前状态和目标Planner 可以提出多组候选 Action Sequence再让 World Model 分别预测“如果执行这组动作未来会到哪里”然后选择预测结果最接近目标的动作Candidate Actions→World Model→Predicted Futures→Choose Best Action因此这条路线是 World ModelTest-time Planning→Action​这里Action 并不是 World Model 直接生成的而是 Planner 根据 World Model 对不同动作后果的预测搜索出来的。3二者汇总DINO-WM 主要属于第二种。它利用离线 State-Action 轨迹学习世界动力学然后在测试阶段给定 Current Image 和 Goal Image通过 MPC/CEM 搜索 Action Sequence而不是主要拿 World Model 去生成更多训练数据。所以世界模型这两个用途可以最后压成用途1模拟世界→生成数据/训练Policy​用途2预测世界→测试时规划Action​第三部分DINO-WM解决什么问题——从Policy Learning转向World Model前面学习的 OpenVLA、π0​、π0.5​、RDT-1B、GR00T、SmolVLA 等方法本质上主要学习的是也就是模型看到当前环境和任务以后直接决定机器人应该执行什么动作​当前 Observation / 图像语言指令Robot State机器人应该执行的动作。所以VLA 的输出就是 Action。这类Policy训练完成后部署阶段主要依靠前向推理输出动作因此面对训练阶段没有覆盖的新目标或新场景时模型很大程度上依赖此前已经学到的行为想覆盖更多任务就需要在训练阶段获得更广泛的数据。论文认为提前学习所有潜在任务的解决方案既困难也低效。DINO-WM换了一个思路不直接学习“现在应该做什么”而是学习“如果执行某个动作世界接下来会发生什么”。因此它不是VLA而是一个Task-Agnostic Visual World Model Model-Based Planning任务无关的视觉世界模型 基于模型的规划方法其核心动力学关系可以写成当前时刻​当前时刻的视觉世界状态不是原始 RGB而是当前图像经过冻结的 DINOv2 后得到的 Patch Features / latent representation​机器人在当前时刻执行的动作比如机械臂位置变化、旋转、夹爪开合等​执行以后下一时刻的视觉世界状态。DINO-WM真正预测的是这个未来视觉世界状态而不是直接预测下一张 RGB 图片。它的输入里反而已经有一个假设动作然后问如果执行这个动作未来会怎么样所以DINO-WM 的核心模型输出不是 Action而是 Future State。输入模型学习什么输出VLA图像 语言 Robot State现在应该怎么做ActionDINO-WM当前视觉状态 假设 Action这样做以后世界会怎样Future Visual State第四部分执行流程举例在DINO-WM中World Model本身相当于一个未来状态预测器给定当前状态和候选Action Sequence它预测执行这些动作后的未来状态。①Planner生成多组候选动作并②根据World Model预测结果与Goal State之间的距离进行评分③最终选择最接近目标的动作④再通过MPC不断重新观测和规划。举一个机械臂推方块的例子。假设当前状态是“红色方块在桌子左边”目标图像是“红色方块在桌子右边”。首先当前图像和目标图像分别经过 DINOv2这里​ 是当前世界状态​ 是目标状态然后Planner论文主要使用 MPC CEM会提出很多候选Action Sequence注意不是只提出一个动作而通常是一整段接下来把每组候选动作交给 DINO-WM。它分别预测也就是回答“如果执行第1组动作最后世界大概会变成什么状态”“如果执行第2组动作呢”然后把每个预测结果和目标状态​ 比较距离越小说明这组动作预测出来的未来越接近目标。比如于是选择​。论文正是把规划目标定义为让预测的最终 latent 尽量接近目标 latent并使用 CEM 搜索动作序列。不过还有最后一个关键点MPC 一般不会把整段 A2​ 一口气全部执行完。更典型的是规划一段动作→执行第一个/前几个动作→重新观察真实环境→再次规划第五部分DINO-WM核心内容1Figure 1DINO-WM 的整体思路Figure 1 展示了 DINO-WM 从世界模型训练到测试时规划的完整流程。Figure 1 的核心就是训练时学习“Action 会怎样改变世界”测试时再利用这个预测能力反推出“为了到达 Goal 应该执行什么 Action”。(a) Training DINO-WM学习世界如何随动作变化连续观测和首先经过冻结的 DINOv2被编码成视觉 Patch Features和。DINO-WM结合实际执行的动作学习也就是说它不直接预测下一帧 RGB 图像而是在 DINOv2 latent space 中预测执行动作后的未来视觉状态。(b) Test-time Inference利用世界模型反过来规划 Action测试时给定当前观测和目标图像分别编码得到当前状态和目标状态。Planner生成多组候选 Action SequenceDINO-WM预测每组动作可能产生的未来轨迹然后比较最终预测状态与目标状态的距离选择能够让两者最接近的动作序列。因此DINO-WM负责预测动作后果Planner负责根据预测结果选择Action。(c) Planning Performance验证这种表示真的能用于规划右图以 Granular 任务的 Chamfer Distance 两个点集之间的几何距离为例数值越低越好。DINO-WM达到 0.26优于 IRIS 的 0.37、DreamerV3 的 1.04 和 TD-MPC2 的 1.21说明利用预训练 DINOv2 特征建立 latent world model可以得到更有效的测试时规划结果。2为什么选择 DINOv2 Patch Features图像块特征DINO-WM 的关键并不只是使用了一个预训练视觉模型而是选择DINOv2 的 Patch Features作为世界状态表示。对于当前图像冻结的 DINOv2 将其编码为一组具有空间对应关系的 Patch Features与把整张图压缩成单个 CLS / Global Feature 不同Patch Features 保留了不同局部区域的视觉与空间信息因此更适合机器人控制中对物体位置、机械臂位置以及物体间空间关系的建模。论文实验也验证了这一点在简单 Maze 任务中不同视觉表示差异较小但在需要精确空间理解的 Wall、PushT 等任务中R3M、ResNet 和 DINO CLS 等全局表示性能明显下降而 DINO Patch 表现最好说明Patch-level spatial representation 是 DINO-WM 能够进行精细动态预测和规划的重要基础。DINO-WM选择DINOv2不只是因为它是一个强视觉预训练模型更重要的是其Patch Features能够保留局部空间结构使World Model在latent space中仍能判断“什么物体在哪里、执行动作后它会移动到哪里”。举例来说假设输入图像中同时包含机械臂和一个杯子DINOv2 会将图像划分为多个 Patch并为不同局部区域分别生成特征向量因此得到的不仅能够表示“图像中有什么”还保留了“杯子在哪里、机械臂在哪里、两者之间具有怎样的空间关系”等局部信息。相比之下CLS / Global Feature 更像是把整张图像压缩并总结成一个全局向量虽然能够较好描述图像整体内容但会损失部分细粒度的空间位置信息。对于机器人控制而言仅知道“图中存在一个杯子”是不够的还需要知道杯子与机械臂的相对位置因此 DINO-WM 选择使用DINOv2 Patch Features作为世界状态表示而不是只使用单一的全局特征。论文实验也表明在需要精确空间理解的复杂控制任务中DINO Patch 明显优于 DINO CLS、R3M 和 ResNet 等全局表示。3DINO-WM 整体结构看懂现在 → 预测未来 → 选择动作整个系统可以归纳为三部分①DINOv2看懂现在当前及历史 RGB 观测首先经过冻结的 DINOv2得到 Patch-level latent representation。DINOv2 在这里负责把原始图像转换成保留空间结构的视觉状态本身不负责预测未来也不负责生成 Action。论文训练和测试阶段都保持 DINOv2 冻结。它回答的是DINOv2现在的世界是什么样​②Transition Model预测未来真正负责学习世界动力学的是 Transition Model。它采用修改后的 ViT根据历史 latent state 和 Action 预测下一时刻的 latent然后可以继续向前滚动它回答的是“如果执行这些动作未来世界会变成什么样”​整个预测过程都发生在DINOv2 latent space中而不需要生成未来 RGB 图像③Planner选择动作测试时再给定一个 Goal Image同样经过 DINOv2 得到目标 latentPlanner 使用MPC CEM生成多组候选 Action Sequence并反复调用 Transition Model 预测每组动作对应的未来状态然后计算哪组动作使预测终点最接近 GoalPlanner 就优先选择哪组动作它回答的是Planner为了到达目标现在应该怎么做​4DINO-WM到底学习什么——Latent Dynamics潜在动力学论文把视觉控制环境写成意思就是未来的环境状态由过去的观测和动作共同决定。 但 DINO-WM 并不直接在 RGB 图像空间预测而是先利用冻结的 DINOv2 将观测编码为 latent state再由 Transition Model 学习也就是根据过去若干帧的视觉状态和对应动作预测下一时刻的视觉 latent state。因此 DINO-WM 真正学习的并不是“下一张图片长什么样”而是世界的视觉状态会如何随着Action发生变化​这就是它所学习的 Latent Dynamics。论文也是以视觉控制的 POMDP 形式定义环境并进一步将动力学建模转移到 latent space 中。5DINO-WM 如何训练——预测下一时刻的 LatentDINO-WM 使用预先采集的离线轨迹进行训练轨迹中包含连续的视觉观测和实际执行动作。训练时RGB 观测首先经过冻结的 DINOv2编码为 Patch-level latent随后 Transition Model 根据过去若干时刻的视觉状态和对应动作预测下一时刻的 latent而真实下一帧同样经过 DINOv2 得到目标表示,训练目标就是让预测的未来状态尽可能接近真实未来状态因此DINO-WM 不是学习“正确 Action 是什么”也不是学习生成下一张 RGB 图像而是在 latent space 中学习“执行这些 Action 后世界的视觉状态会如何变化”。训练采用 Teacher Forcing即利用真实离线轨迹中的历史观测和动作作为条件进行下一状态预测核心 World Model 的训练全过程都不需要像素重建。6为什么不直接预测 RGBDINO-WM 不直接生成未来 RGB 图像而是在DINOv2 latent space中预测未来状态相比直接预测像素RGB 重建需要同时建模纹理、光照、背景等大量视觉细节计算负担更大而机器人规划更关心的是物体位置、空间结构以及动作造成的状态变化。因此 DINO-WM 直接利用具有空间信息的 DINOv2 Patch Features 表示世界并在 latent space 中学习动力学不要求即通过 Decoder 再还原成一张预测的未来 RGB 图像。论文中的 Decoder 仅用于把 latent 重建成图像以方便可视化和解释并不是 World Model 训练或规划的必要组成部分作者还发现将重建 Loss 反向传播到 Dynamics Predictor 反而会降低性能。8推理/测试训练完成后DINO-WM如何得到动作DINO-WM本身不会直接输出Action。测试时给定当前图像​ 和目标图像 o先通过冻结的 DINOv2 得到当前 latent和目标 latent​。PlannerMPC CEM生成多组候选 Action Sequence然后利用已经训练好的 Transition Model 逐步预测这组动作可能产生的未来状态最后比较预测终点与目标状态距离越小说明该 Action Sequence 预测出的未来越接近目标Planner 就保留并继续优化这类动作最终选择更合适的 Action 执行。论文使用 MPC 进行规划并主要采用 CEM 搜索动作序列。9CEM 与 MPC如何搜索并执行 Action①CEM搜索最优 Action SequenceCEMCross-Entropy Method负责在动作空间中搜索候选 Action Sequence。它反复执行采样候选Action Sequence→DINO-WM预测未来→计算与Goal的距离→保留较优候选→重新采样因此 CEM 解决的是“应该选择哪一组Action”在大量候选Action Sequence里面搜索哪一条最好。​也就是说World Model负责预测动作后果CEM负责根据这些预测结果搜索更好的动作序列。②MPC执行一部分再重新规划如果找到一条动作序列后直接全部执行World Model 前面产生的一点预测误差可能会随着执行逐渐累积。MPCModel Predictive Control因此采用Receding Horizon 滚动时域先规划一段 Action Sequence只执行前个动作然后重新获取真实 Observation再基于新的状态重新运行 CEM 规划。论文附录明确写到MPC 表示允许重新规划并使用 CEM 作为内部动作优化方法。整体关系就是CEM找动作MPC执行后重新观察并再找动作​③实验效果附录 Table 10比较了不同规划方式仅使用 CEM 优化后进行 open-loop 执行时PointMaze、Push-T 和 Wall 的成功率分别为0.80、0.86、0.74采用 MPC即执行过程中允许重新观测和 Replanning 后提高到0.98、0.90、0.96说明闭环重规划能够有效减轻长期预测误差。GD 则只有 0.22 和 0.28。10“Zero-Shot Planning”到底是什么意思这里的 Zero-Shot Planning 并不是指 DINO-WM 没有使用训练数据而是指 World Model 已经利用离线轨迹学好环境动力学后面对新的 Goal 时无需再针对该任务重新训练或微调 Policy而可以直接在测试阶段进行 Action Planning。World Model训练完成以后面对新的Goal或者某些新的Environment Configuration不需要再针对这个新任务训练Policy。因此训练World Model一次①比如传统 PolicyGoal A→训练Policy A换 Goal B可能还要Goal B→再训练/再适配②而 DINO-WM 是先学世界在Action作用下怎么变化​训练一次以后Goal A → Planning AGoal B → Planning BGoal C → Planning C只要这些 Goal 仍然处在它学到的动力学范围附近就不用重新训练 Policy。论文的核心主张也是用离线轨迹训练 任务无关的世界模型再在测试时为目标做规划。你可以把它类比成学物理规律如果你学过“推一个物体它会怎样运动”那么即使目标位置换了你也可以现场规划怎么推。所以DINO-WM解决的是“任务泛化”​第六部分实验效果1实验设置①六类控制环境Figure 3 展示了 DINO-WM 的六类评估环境从左到右、从上到下依次为Maze、Reach、Wall、Push-T、Rope Manipulation 和 Granular Manipulation覆盖从导航、机械臂到达、刚体推动到柔性绳索和多粒子操控等不同动力学复杂度的任务。这样可以同时检验 World Model 对简单空间运动、接触动力学以及复杂非刚体动力学的建模与规划能力。②对比方法主规划实验主要与IRIS、DreamerV3 和 TD-MPC2等 World Model 方法比较论文还与生成式视频模型AVDC做定性及扩展比较。③训练数据Offline State-Action TrajectoriesDINO-WM 不使用带语言指令的 VLA 数据集而是在不同环境中分别采集离线的RGB Observation–Action 轨迹用于训练世界动力学模型即通过连续的​ 学习“执行某个 Action 后世界如何变化”。具体而言PointMaze 使用 2000 条随机轨迹Wall 使用 1920 条随机轨迹Reach 使用 3000 条轨迹PushT 的主训练集规模为 18500基于已有 expert trajectories 加入不同程度噪声进行 replayRope 和 Granular 则各使用 1000 条随机轨迹。论文还为泛化实验构造了 WallRandom 和 PushObj 等扩展数据。整体上这些数据只需要提供环境观测和真实执行动作不依赖语言指令、reward 或针对测试目标的任务标签。2最重要的Planning实验结果Table 1 是论文最核心的 Planning 主实验比较 DINO-WM 与 IRIS、DreamerV3 和 TD-MPC2 在六类控制环境中的表现。其中 Maze、Wall、Reach 和 PushT 使用成功率 SR越高越好Rope 和 Granular 使用 Chamfer Distance越低越好。在较简单的 Maze 和 Wall 中DreamerV3 分别达到 1.00 和 1.00略高于 DINO-WM 的 0.98 和 0.96但在需要更精确空间理解和复杂动力学建模的任务上DINO-WM优势明显Reach 和 PushT 成功率分别达到0.92 和 0.90Rope 和 Granular 的 Chamfer Distance 分别降至0.41 和 0.26均为表中最佳。说明 DINO-WM 不仅能够处理简单导航在接触、柔性物体和多粒子等更复杂动力学场景中仍能保持较强的世界预测与测试时规划能力。3消融实验DINO Patch到底有多重要1. Table 2Patch Features 直接提升 Planning 性能Table 2 通过替换 Observation Encoder 比较不同视觉表示。简单 Maze 中各种表示差距较小但随着任务对空间结构和物体动力学要求提高差距迅速扩大。例如 PushT 中R3M、ResNet、DINO CLS 的成功率分别只有0.42、0.20、0.44而 DINO Patch 达到0.90Granular 中 DINO Patch 的 Chamfer Distance 也降至0.26。尤其值得注意的是DINO CLS 和 DINO Patch 来自同类 DINO 视觉预训练但后者明显更强说明关键不仅是使用 DINO而是保留了Patch-level spatial representation。2. Table 3Patch Features 确实保留了更多真实状态信息Table 3 使用Linear Probe检查不同视觉特征中能否直接读出环境真实 State。方法很简单冻结视觉 Encoder只训练一个线性映射把视觉 Feature 预测为环境状态Validation Loss 越低说明原始视觉特征中已经包含越丰富的状态信息。结果中 DINO-S Patch 和 DINO-B Patch 整体明显优于 DINO CLS、R3M 和预训练 MAE。例如 PointMaze 中 DINO-B Patch 的 Loss 仅为0.014而 DINO-S CLS 为0.475Wall 中 DINO-B Patch 为0.163DINO-S CLS 为0.519。因此 Table 3 从表征层面进一步说明Patch Features 更容易保留位置、姿态和空间结构等控制相关状态信息。4Generalization未见环境配置还能不能规划Figure 5 给出了 WallRandom、PushObj 和 GranularRandom 三类泛化测试设置与普通“更换 Goal”不同这里进一步改变了墙体布局、物体形态或颗粒配置用于检验 DINO-WM 是否只记住训练场景还是学到了能够迁移到新配置的环境动力学。Figure 5 本身只负责说明实验设置不需要单独详细解释。在Table 4中在未见环境配置下DINO-WM 在 WallRandom 和 PushObj 上分别达到0.82 和 0.34的成功率在 GranularRandom 上取得最低0.63 Chamfer Distance均优于表中其他方法。特别是 WallRandom 中即使墙和门的位置发生变化模型仍能进行有效规划GranularRandom 中粒子数量和分布明显改变后模型也保持了较好的控制表现。说明 DINO-WM 学到的并不只是训练图像的视觉记忆而具有一定的environment dynamics generalization能力。第七部分创新点和局限性1DINO-WM 的核心创新这篇论文真正值得记住的可以压缩成3 点创新点1利用 DINOv2 Patch Features 构建视觉世界状态。DINO-WM 不直接在 RGB Pixel Space 中建模世界而是利用冻结的 DINOv2 将图像编码成具有局部空间结构的 Patch Features使World Model 能够保留物体位置、空间关系和运动变化等控制相关信息。创新点2直接学习 Latent Dynamics而不是生成未来 RGB。Transition Model 学习即预测执行 Action 后未来的视觉 latent state而不要求生成完整的未来图像从而把建模重点从纹理、光照等像素细节转移到真正与控制相关的世界状态变化。创新点3Task-Agnostic World Model Test-time Planning。模型训练阶段只学习“世界如何随 Action 变化”并不提前学习每一个具体任务的 Policy测试时再给定新的 Goal Image通过 CEM MPC 搜索 Action Sequence因此能够在不重新训练 Policy 的情况下进行 Zero-shot Planning。2DINO-WM 的局限性论文自己给出的局限也非常明确可以保留3 点。局限1仍然依赖足够覆盖的 Offline State-Action Data。DINO-WM 只能比较可靠地预测“训练数据里覆盖过的那一片世界”。如果机器人到了训练数据几乎没出现过的状态或者执行了训练数据里几乎没出现过的动作World Model 就可能不知道接下来会发生什么。局限2仍然需要 Ground-truth Action。虽然 DINO-WM 不需要 reward 或任务标签但训练动力学模型仍必须知道机器人实际执行了什么 Action因此不能直接利用只有视觉内容、没有动作标签的大规模互联网视频。作者也将这一点明确列为未来需要解决的问题。局限3Planning 仍主要发生在低层 Action Space。当前方法通过 CEM/MPC 直接搜索连续机器人动作当任务时间跨度进一步增加时低层 Action Sequence 的搜索会越来越困难,因此作者提出未来可以结合High-level Planning Low-level Control Policy的层级结构。这三个局限实际上都指向同一个核心问题DINO-WM虽然摆脱了Task-specific Policy但World Model本身仍高度依赖Robot Interaction Data​3从 DINO-WM 引出 V-JEPA 2能不能从互联网视频学习世界这正好可以非常自然地引出第20篇V-JEPA 2。DINO-WM 证明Visual World ModelPlanning可以替代“提前为每个任务学一个 Policy”的思路。但它仍然有一个非常明显的数据瓶颈学习World Dynamics世界动态规律仍需要带Action的Robot Trajectories​机器人轨迹问题在于机器人交互数据昂贵且规模有限而互联网上却存在海量Human Videos Object Motion Physical Interaction Videos人类活动视频 物体运动 物理交互视频这些视频虽然没有机器人 Action 标签却包含了大量关于物体怎样运动、人与物体怎样交互、世界状态怎样随时间变化的信息。因此下一篇 V-JEPA 2 提出了一个更进一步的问题能不能先从海量、没有Action标签的互联网视频中学习“世界如何运动和变化”再只使用少量机器人交互数据把这种世界知识转换成可用于Action-conditioned Planning的World Model这正是 V-JEPA 2 的核心路线。论文首先利用超过100万小时互联网视频进行 action-free self-supervised video pretraining然后冻结 Video Encoder再使用不到62小时 DROID 机器人数据训练 Action-Conditioned Predictor即 V-JEPA 2-AC最终用于真实 Franka 机械臂上的零样本规划。
返回列表