让智能体先做梦再行动:World Models 的 V、M、C 三段式架构

让智能体先做梦再行动:World Models 的 V、M、C 三段式架构
写在前面【从零走向AGI】旨在深入了解通用人工智能AGI的发展路径从最基础的概念起逐步构建完整的知识体系。项目地址https://github.com/AI-mzq/From-Zero-to-AGI.git魔方AI空间猫先生从零走向AGI面试面经AIGC算法岗/开发岗面试面经交流社群涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源欢迎大家加入https://t.zsxq.com/YtJ09导读2018 年David Ha 与 Jürgen Schmidhuber 在《World Models》中给出了一套极简却影响深远的智能体设计先用视觉模型把高维画面压缩成潜变量再用循环网络预测潜变量如何随动作变化最后只训练一个很小的控制器完成任务。三个模块分别称为VisionV、MemoryM和ControllerC。这套方法的关键不在于生成逼真的视频而在于构造一个对控制足够有用的内部世界。VAE 丢掉像素细节MDN-RNN 学习未来状态的概率分布控制器则同时读取当前潜变量与记忆状态。CarRacing 实验表明加入 M 的隐藏状态后线性控制器就能把平均成绩从仅使用 V 时的 632±251 提升到 906±21。VizDoom 更进一步控制器完全在 MDN-RNN 生成的“梦境”里训练再零样本放回真实游戏取得 1092±556 的平均生存步数。论文也提前暴露了世界模型路线至今仍绕不开的问题控制器会主动寻找模型误差并把错误的模拟规律变成高回报策略。作者通过提高采样温度制造更困难、更随机的“噩梦”来抑制投机但这是一种鲁棒化手段并不等于模型已经正确理解世界。猫先生认为World Models 最重要的贡献不是证明“生成模型能画出游戏画面”而是把智能体的学习问题重新分工大模型负责无监督地形成状态与动力学小控制器只负责把这些表征转成动作。今天的潜空间视频模型、想象式强化学习和具身世界模型虽然规模大得多仍能看到这条主线。论文标题World Models论文地址https://arxiv.org/abs/1803.10122项目主页https://worldmodels.github.io/GitHubhttps://github.com/hardmaru/WorldModelsExperimentsNeurIPS 版本https://papers.nips.cc/paper/7512-recurrent-world-models-facilitate-policy-evolution原文脉络原文第 1 节从人类依靠内部模型快速反应谈起。第 2 节依次定义 VAE、MDN-RNN 与线性控制器并说明 V、M、C 如何闭环。第 3 节用 CarRacing 验证记忆状态对实时控制的价值第 4 节在 VizDoom 中完成“梦境训练—真实迁移”同时分析控制器欺骗世界模型的现象。第 5 节提出迭代式数据收集第 6、7 节回到相关工作、局限与未来方向。1. Introduction内部模型服务于预测而非完整复刻人面对快速变化的环境时不会等每个感知信号完成精确处理后再行动。棒球击球、驾驶过弯都依赖对下一瞬间的预测。论文把这种能力抽象为世界模型它根据历史观察与动作形成内部状态使智能体能够在信息不完整、反应时间有限的条件下选择动作。强化学习若直接从像素端到端学习数百万参数奖励信号需要同时解决视觉表征、时间建模和动作选择信用分配会变得困难。World Models 把三类问题拆开训练V 从大量画面中学习紧凑的视觉表示M 从动作—状态序列中学习环境动力学C 只根据 V 与 M 提供的特征优化任务回报。V 和 M 不需要奖励标签绝大多数参数都通过无监督学习获得任务相关的搜索被限制在一个很小的 C 中。这种拆分让控制问题从“直接理解所有像素”变成“利用已经整理好的潜状态”。2. Agent ModelVision、Memory 与 Controller图 1每帧观察先由 V 压缩为潜变量 zM 结合 z 与动作更新隐藏状态 hC 再利用 z 和 h 输出动作。来源原论文 Figure 4。原论文 Figure 1、2 为第三方概念插图Figure 3 为低清任务截图因此未收入发布稿。2.1 VAEV只保留控制所需的视觉骨架Vision 模块是一套卷积变分自编码器。输入画面被统一缩放为 64×64 RGB编码器将其压缩为潜变量 zCarRacing 使用 32 维 zVizDoom 使用 64 维 z。解码器可以从 z 重建画面但重建并不是最终任务它更像一项约束潜空间必须保留足够的信息才能大致恢复原始观察。图 2左侧为原始画面右侧为 VAE 从潜变量重建的画面。道路位置与车辆姿态被保留纹理和边缘细节明显模糊。来源原论文 Figure 10。重建图说明了“有损”反而可能有用。控制赛车需要道路方向、车辆位置和弯道形状不需要逐像素保留草地纹理。高斯先验还限制了潜变量的信息容量并让 M 生成的潜状态不至于轻易落入完全异常的区域。但 VAE 只按重建质量学习并不知道哪些信息与奖励有关。它可能花容量记录墙面纹理却忽略一块对任务至关重要的小物体。论文在讨论部分明确承认独立训练的 V 未必会自动形成最适合控制的表征。2.2 MDN-RNNM预测的不是一个未来而是未来分布Memory 模块是一层 LSTM并在输出端接 Mixture Density Network。它读取当前潜变量 z、当前动作 a 和历史隐藏状态 h预测下一时刻潜变量的概率分布。论文使用 5 个高斯混合分量CarRacing 的 LSTM 隐藏维度为 256VizDoom 为 512。概率输出处理了环境中的多模态未来。同一状态与动作之后怪物可能发射火球也可能不发射若网络只回归一个均值多个可能结果会被平均成并不存在的状态。混合密度模型允许 M 表达离散事件与随机转移并通过采样生成后续潜状态。VizDoom 中M 还预测下一帧是否死亡。这样潜状态、动作与终止信号就组成了一个符合 OpenAI Gym 接口的虚拟环境。训练控制器时不必调用 Doom 引擎也不必把潜变量解码成画面解码器只供人观察“梦境”内容。2.3 ControllerC把任务搜索压缩到一层线性映射C 将当前 z 与 M 的隐藏状态 h 拼接通过一层线性映射输出动作。CarRacing 的动作是转向、油门与刹车控制器只有 867 个参数VizDoom 的控制器有 1088 个参数。作者没有对 C 使用反向传播而是采用 CMA-ES 直接搜索权重以累计回报作为适应度。三部分的参数规模很不对称。以 CarRacing 为例VAE 有 4,348,547 个参数MDN-RNN 有 422,368 个参数C 只有 867 个。大部分表示能力被放进不依赖奖励的 V 与 M稀疏、延迟的任务信号只优化最后一小层降低了信用分配难度。猫先生认为h 的作用不能简单理解为“多看几帧”。它编码的是 M 对历史与未来转移规律的压缩判断。C 读取 h相当于直接获得一个带预测性的状态摘要智能体不必在每一步显式展开长轨迹也能做出具有前瞻性的反射动作。3. CarRacing记忆状态让线性策略越过 900 分门槛作者先用随机策略采集 10,000 条 CarRacing rollout再分别训练 VAE 与 MDN-RNN。二者都不使用奖励信息论文报告单个模块在一块 GPU 上的训练时间均少于一小时。随后固定 V 和 M在真实 CarRacing 环境中用 CMA-ES 优化 C。这里需要避免一个常见误读CarRacing 的 C 是在真实环境中训练的。第 3.4 节只是把已经学会驾驶的策略放入 M 生成的梦境观察它能否继续行动“完全在梦中学策略再迁移回真实环境”的实验属于后面的 VizDoom。图 3控制器经过约 1800 代进化后最佳策略在 1024 条 rollout 上达到 900.46图中虚线附近对应任务的 900 分解决门槛。来源原论文 Appendix Figure 24。只让 C 读取 z 时赛车会在弯道上摇摆100 个随机赛道的平均成绩为 632±251给 C 增加一个 40 单元隐藏层后提升到 788±141仍未解决任务。完整模型同时读取 z 与 h成绩达到 906±21。作为当时的对照A3C 离散动作版本为 652±10Gym 排行榜最好结果为 838±11。差异说明单帧潜变量能看见道路却难以判断运动趋势。隐藏状态 h 累积了速度、方向和转移历史让极小的线性控制器也能更稳定地处理急弯。作者甚至不要求 C 显式模拟多步未来M 已把未来分布压进隐藏状态C 只需把状态映射到即时动作。4. VizDoom在潜空间梦境中训练再回到真实游戏VizDoom 的 Take Cover 任务要求智能体左右移动躲避火球。单局最长 2100 步连续 100 局的平均生存时间超过 750 步即视为解决。作者同样先用随机策略采集 10,000 条真实环境轨迹训练 V 和 M此后把真实引擎替换为 DoomRNN只在潜空间中用 CMA-ES 搜索 C。完整流程可以概括为V 把真实画面转换为 64 维潜变量M 学习潜变量、动作及死亡信号的联合转移虚拟环境从 M 采样下一状态与终止信号C 在虚拟环境中按生存时间进化固定 C直接部署回真实 VizDoom。图 4在采样温度 1.15 的虚拟环境中最佳控制器在 1024 条梦境 rollout 上达到 959同一控制器迁移到真实环境后取得 1092±556。来源原论文 Appendix Figure 28。梦境训练的最好策略在真实 VizDoom 中平均存活 1092±556 步超过 750 的解决标准也高于当时 Gym 排行榜的 820±58。这个结果并不要求 M 准确还原每只怪物。VAE 重建有时连怪物数量都不一致但更随机、更困难的虚拟环境迫使 C 学会保守躲避策略仍能迁移。4.1 Temperature从“轻松美梦”切换到“高压噩梦”MDN-RNN 的采样温度控制随机性。温度过低时模型接近确定性预测并出现 mode collapse怪物几乎不发射火球C 在虚拟环境中轻易拿到满分却没有学会躲避。温度提高后火球路径更难预测模型缺陷也不容易被稳定利用。训练温度虚拟环境成绩真实环境成绩0.102086±140193±580.502060±277196±501.001145±690868±5111.15918±5461092±5561.30732±269753±139随机策略—210±108低温下“梦里分数越高现实表现越差”是整篇论文最有警示意义的证据。虚拟环境若过于容易优化器会放大模型漏洞而不是学习真实任务。温度 1.15 在真实性与不可利用性之间取得了较好的平衡温度继续升至 1.30环境又变得过于困难平均成绩下降。4.2 Cheating the World Model优化器会攻击模型盲区早期实验中控制器学会了一种对抗策略通过特定移动让虚拟怪物不再发射火球甚至让刚生成的火球自动消失。C 还可以读取 M 的隐藏状态相当于看见游戏引擎内部变量更容易寻找不符合真实规律的状态。这就是典型的 model exploitation。策略优化访问到训练数据覆盖不足的区域世界模型在那里给出错误但高回报的预测控制器便把误差当成捷径。概率动力学与温度扰动提高了利用门槛却无法证明未见区域的预测正确。猫先生认为World Models 最超前的部分也许不是“梦中训练成功”而是作者把失败机制写得足够清楚策略不是被动承受模型误差它会主动搜索并放大误差。后来的不确定性建模、环境随机化、短视想象和真实数据回流本质上都在处理这场优化器与模型偏差之间的博弈。5. Iterative Training让策略产生下一轮世界模型数据两个主实验只进行了一轮数据收集随机策略生成数据训练 M再训练 C。更复杂的环境不会把所有关键区域暴露给随机策略因此作者提出迭代闭环在真实环境中运行当前策略保存观察与动作用新增轨迹继续训练世界模型在更新后的模型中优化控制器把新控制器放回真实环境重复收集。论文还建议用好奇心、内在动机或压缩质量提升作为奖励引导智能体访问模型尚不熟悉的区域。这个设想把世界模型从一次性离线模拟器变成持续更新的经验压缩器也让数据采集与策略学习相互促进。6—7. Related Work 与 Discussion经典架构的价值和边界World Models 延续了早期 controller–model、预测编码、系统辨识和基于模型强化学习的思想。它的新意不在于单独发明 VAE、RNN 或进化策略而在于把三者组织成一条可运行的潜空间控制链并用梦境到真实环境的迁移展示完整闭环。它的边界同样清晰视觉表征与任务目标解耦。VAE 优先重建高频视觉信息不保证保留奖励相关细节。循环模型容量有限。单层 LSTM 难以长期记忆复杂状态也会面临灾难性遗忘。一步步生成不等于规划。M 能预测未来C 却没有显式搜索、层级规划或长期推理结构。梦境策略会利用分布外误差。温度只能增加随机性不能替代不确定性校准和真实环境验证。实验环境规模很小。两个 64×64 游戏任务证明了机制可行不足以直接推出开放物理世界中的通用能力。原始代码栈已经陈旧。官方仓库依赖早期 TensorFlow 与 OpenAI Gym 0.9.x今天复现需要锁定旧环境或使用社区移植版本。因此论文中的 world model 更准确的含义是任务范围内、面向控制的潜空间动力学模型而不是保存世界全部知识的通用模拟器。模型只要保留影响动作选择的规律就可能比追求逐像素完美更高效但当任务变化原本被压缩掉的信息也可能重新变得重要。总结世界模型的目标是支持行动不是复制每个像素《World Models》用 V、M、C 建立了一条清晰路线VAE 把画面压进低维状态MDN-RNN 把历史与未来分布压进记忆线性控制器把潜状态转成动作。CarRacing 证明预测性记忆能显著改善真实环境控制VizDoom 证明策略可以在学习到的潜空间里训练并迁移。它留给今天的三个判断仍然有效世界模型不必复刻全部现实只需对任务保留足够的可预测结构表征学习和动力学学习可以承担大部分模型容量任务控制头可以很小模型越能被策略反复调用越要警惕策略主动利用模拟器漏洞。世界模型让智能体拥有了“做梦”的能力但梦能否指导现实不取决于梦有多清晰而取决于它是否保留了行动真正依赖的因果与动力学。推荐阅读► 技术资讯 魔方 AI 新视界► 项目应用开源视界► 技术专栏 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列