ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

World-In-World: World Models in a Closed-Loop World

World-In-World: World Models in a Closed-Loop World 我们到底应该怎样判断一个 World Model 对机器人/具身智能有没有用作者认为现在很多世界模型看起来“生成视频很漂亮”但这并不意味着它真的能帮助机器人做决策。因此他们提出了一个闭环世界模型评测框架 World-In-World把世界模型真正放进 agent–environment 的交互循环里看它能不能提高任务成功率。1. 这篇论文为什么要做传统的世界模型评估很多时候看的是生成质量比如生成的视频清不清楚看起来真不真实视觉质量高不高。但作者认为这对于具身智能是不够的。比如一个机器人看到面前有一个桌子它准备“向左移动”。世界模型生成了一段非常高清、非常真实的视频但是视频里的机器人实际上往右走了。那么画面再漂亮对机器人规划也没用。因此作者提出一个很关键的观点World Model 应该按照它能不能提高 embodied task success 来评价而不仅仅是按照生成视频的视觉质量评价。论文明确指出目前缺少一个统一 benchmark去测试生成的世界是否真的能够帮助 agent 进行感知、规划、执行以及根据新观测重新规划。这基本就是这篇论文的核心出发点。2. World-In-World 到底是什么一个把各种 World Model 插进机器人决策循环里的统一“测试平台”。它的核心流程在论文第 3 页 Figure 3 画得非常清楚。整个过程可以压缩成Proposal → Simulation → Revision → Execute → Observe → 再循环也就是真实环境 ↓ 当前观测 ot ↓ Proposal Policy 提出多个候选动作 ↓ A1 A2 A3 ... AM ↓ ↓ ↓ World Model ↓ ↓ ↓ 预测未来状态 O1 O2 O3 ... OM ↓ Revision Policy 比较这些未来 ↓ 选择最好的动作 ↓ 在真实环境执行 ↓ 得到新的观测 ot1 ↓ 重新规划所以它不是简单地输入图片 → 世界模型 → 生成未来视频。而是让世界模型变成 agent 的“想象器”。机器人先在脑子里想“如果我执行动作 A会发生什么”“如果我执行动作 B会发生什么”“如果我执行动作 C会发生什么”然后比较几个预测的未来再决定真正执行哪个动作。作者把这个过程形式化成一种policy-guided beam searchproposal policy 产生 MM 个候选 action planWorld Model 分别 rollout 这些动作然后 revision policy 对这些预测结果评分并选择最终决策。这个思想其实非常重要。3. 为什么需要 Unified Action API这里还有一个现实问题。不同 World Model 接受的控制输入完全不一样。有的模型接受文本 move forward and turn left有的接受camera trajectory (x, y, θ)还有的接受机器人低层 action [x, y, z, rotation, gripper]这样不同模型很难公平比较。所以作者设计了一个Unified Action API统一表示 agent 的动作然后通过一个映射转换成不同 World Model 需要的输入形式。这个 API 支持三大类控制方式text prompt、camera trajectory/viewpoint、low-level actions。于是就可以做到Unified Action ↓ ┌──────────────┼──────────────┐ ↓ ↓ ↓ Text Camera Robot Prompt Trajectory Action ↓ ↓ ↓ Wan SE3DS Action WM LTX PathDreamer ... ...这也是为什么作者能够把一堆非常不同的 World Model 放进同一个 benchmark。4. 它测试了哪些任务这篇论文用了4 类具身任务。“世界模型 benchmark 里面到底什么叫一个 task”论文第 5 页 Figure 4 把四种任务放在了一张图里。Task世界模型帮助 agent 做什么Active Recognition主动移动视角看清被遮挡物体Active Embodied QA在环境里探索然后回答问题Image-Goal Navigation根据目标图片导航到对应位置Robotic Manipulation控制机械臂进行抓取、推动、放置等这四类任务其实覆盖了Perception → Navigation → Reasoning → Manipulation所以它不是只测“视频预测误差”而是看预测出来的未来是否真的帮助 agent 完成任务。5. 一个非常重要的设计Post-training作者还发现直接拿一个很强的视频生成模型当 World Model效果其实没有想象中好。原因很简单。例如 Wan、SVD 这些模型主要是在大量互联网视频上训练的。它可能知道“一个人在房间里走动应该长什么样。”但是它不一定知道“机器人执行 action MoveForward 后相机应该精确移动多少。”所以作者又做了一件事情Action-Observation Post-training用类似Observation_t Action_t ↓ World Model ↓ Observation_t1这样的 embodied 数据继续训练视频模型。对于 Habitat-Sim 的导航任务他们使用 HM3D 的 action-observation 数据对于机械臂 manipulation则使用 RLBench/CoppeliaSim 的 demonstration 数据进行 post-training。这一步非常关键因为它让普通的Video Generator逐渐变成Action-conditioned World Model6. 这篇论文最重要的实验结论我认为真正值得记住的不是哪个模型高了几个百分点而是下面三个现象。第一视频越漂亮 ≠ World Model 越好这是整篇文章最重要的结论。作者比较Generation Quality vs Task Success Rate发现相关性并不强。反而Controllability vs Task Success Rate相关性明显更强。论文将 controllability 定义为模型预测与预期动作结果之间的对齐程度并发现 action-conditioned post-training 后这种控制一致性与任务成功率同步提高。也就是说World Model 最重要的不一定是“画得像”而是“动作给对以后未来变化得对”。这和普通 Video Generation 的目标是有明显区别的。第二训练一个更大的视频模型不一定比增加 embodied 数据更重要他们比较了不同 post-training 数据量400 4K 40K 80K随着 action-observation 数据增加成功率持续提高。而且一个非常有意思的结果是Wan2.2 虽然预训练规模更大但加入足够的 embodied action-conditioned 数据以后较小/较早的模型也能接近它。作者因此认为对 embodied world model 来说post-training data scaling可能比单纯升级 pretrained video generator 更有效。这个结论其实很有研究价值。第三Inference-time Compute 也可以 Scaling这个也非常有意思。正常情况下可能只让 World Model 想象未来 3 种可能但如果让它想未来 5 种 未来 8 种 未来 11 种agent 就有更多候选未来可以比较。实验发现例如 SVD† 在 Active Recognition 中平均 inference 次数从 3 增加到 11 后success rate 从53.36% 提高到 60.98%。因此世界模型也存在类似 LLM 的Inference-time Scaling也就是想得更多 → 比较更多未来 → 做出更好的决策。7. 但是 Manipulation 出现了一个很值得注意的问题这个地方我觉得你尤其要留意。世界模型在Recognition Navigation EQA上的帮助比较明显。但是到了Robotic Manipulation提升明显变小。例如论文中VLM baseline44.5%44.5\%加入最好的 post-trained SVD46.5%46.5\% 只提高了一点。作者认为原因在于机械臂需要模拟接触摩擦机器人运动学物体精确移动articulated objectdeformable object。而现有视觉 World Model 很容易出现画面看起来合理 ≠ 物理过程正确因此作者在 Discussion 中明确把precise interaction and dynamics modeling列为未来的重要方向包括 physics-guided generation、physical properties、physics-aware post-training 等。这个问题其实非常关键。8. 总结这以前大家测试 World Model“你生成的视频像不像真的”World-In-World 说“我不管你视频多漂亮。我要把你放进机器人脑子里让机器人用你预测未来然后看看机器人任务成功率到底有没有提高。”因此评价标准从Visual Quality\text{Visual Quality}变成这就是这篇论文最大的思想贡献。论文结论也明确强调World-In-World 是通过 embodied interaction 而非孤立视觉指标来评价生成式世界模型并用统一 action API 与闭环 planning 将不同 World Model 纳入同一个评测框架。这篇论文的创新点重点其实不在“发明了一个新的世界模型网络结构”而在于提出了一套新的评测与使用 World Model 的方法论。最核心可以概括成 3 个创新点而且这三点基本就是作者自己在论文里列的贡献。 WORLD-IN-WORLD WORLD MODELS IN …提出 World-In-World把世界模型放进真实的闭环任务里评测。过去很多 benchmark 主要看生成质量比如画面是否逼真、视频是否连贯这篇论文认为这些指标不能说明 World Model 是否真的对机器人有用。于是它让 agent 在任务中不断经历“观察 → 提出动作 → 世界模型预测未来 → 选择动作 → 真正执行 → 再观察”的闭环并最终用任务成功率来评价 World Model。 WORLD-IN-WORLD WORLD MODELS IN …所以它的评价标准从“生成得好不好看”转成了“能不能帮助 agent 做成事情”。提出统一的闭环规划框架 Unified Action API。不同世界模型的控制方式完全不同有的吃文本有的吃相机轨迹有的吃机器人低层动作。作者设计了统一接口 \(IC(A)\)把同一个候选动作序列转换成不同模型能够接受的控制形式然后统一执行 proposal → simulation → revision 的规划流程。 WORLD-IN-WORLD WORLD MODELS IN …这个创新的价值是以前不同 World Model 很难在同一个 embodied benchmark 里公平比较现在可以接进同一个框架。系统研究了“怎样把普通视频生成模型变成更有用的 embodied World Model”并发现两种 scaling 规律。作者用 action-observation 数据继续微调已有视频生成模型使其从“会生成合理视频”变成更“听动作指挥”的 action-conditioned world model。然后发现两个重要规律一是增加 embodied action-observation post-training 数据会持续提高任务表现二是测试时增加 world-model rollout / inference 次数也会提高闭环任务成功率。 WORLD-IN-WORLD WORLD MODELS IN …他们还发现一个很关键的现象视觉质量高并不一定意味着任务成功率高controllability 反而更重要。WORLD-IN-WORLD WORLD MODELS IN …你可以把它压缩成一句论文式表述World-In-World 的主要创新不是提出新的生成模型而是构建了一个面向具身智能的闭环世界模型评测平台通过统一动作接口和在线规划框架将异构世界模型用于真实决策并系统揭示了 controllability、action-conditioned post-training data scaling 和 inference-time scaling 对任务成功率的重要性。如果按“创新程度”再细分这里有一点尤其值得注意Action-Observation Post-training 是论文的重要组成部分但如果严格按作者自己列的“三条 contribution”它不是单独一条主贡献而是服务于第三条“training-time scaling / adaptation”的。所以你以后汇报这篇论文时不要把它讲成“作者主要提出了一个新的 post-training 算法”这样会有点偏这篇的主轴还是closed-loop benchmark unified interface scaling/finding。
返回列表