代码世界模型:Coding Agent 作为世界大脑)
Code World Model: Coding Agent as World Brain论文地址https://arxiv.org/abs/2608.25927项目页面https://buaacyw.github.io/cwm/学术交流922230617目录1. 引言2. 相关工作2.1 交互式视频世界模型2.2 生成式 3D 世界2.3 代码Agent与世界模型3. 方法3.1 Code World Model3.2 世界状态对视频模型的条件控制3.3 数据4. 实验4.1 实现细节4.2 结果展示5. 总结与展望1. 引言构建一个能够模拟真实世界演化规律的世界模型World Model是通往通用人工智能的关键路径之一。传统的视频世界模型尝试从海量视觉数据中 “看” 出世界如何变化但它们面临一个根本困境视频只记录了演化的结果却丢失了背后的规则、因果和持久状态。例如在游戏《上古卷轴》中如果玩家刺杀了某城市的领主后续会引发政权更迭、NPC 行为变化等一系列连锁反应。这些效应可能发生在数小时之后甚至当玩家离开该城市时仍在后台继续演化。视频模型仅凭像素预测很难推断出这种复杂的因果链条也无法维护离屏实体的状态。为此本文提出Code World ModelCWM其核心创新是将“世界演化”与“视觉渲染”解耦一个代码AgentCoding Agent充当 “世界大脑”负责推理事件后果、维护持久状态并通过生成可执行代码来驱动世界演化一个视频生成模型作为 “视觉后端”负责将抽象世界状态渲染为高保真、物理合理的视觉观测。这种分工既保证了逻辑一致性和长期可追溯性又充分利用了视频模型丰富的视觉先验。论文的主要贡献包括提出 CWM 框架将代码驱动的世界演化与视频驱动的视觉生成统一起来设计Proxy将世界状态转换为 proxy 视频作为中间桥梁以粗粒度的时空约束控制视频生成无需构建完整 3D 资产构建了游戏和真实世界数据的对齐管道初步验证了框架的可行性。2. 相关工作2.1 交互式视频世界模型近年来基于扩散 Transformer 的视频生成模型如 HunyuanVideo、Wan取得了长足进步并被用于构建可交互的 “神经游戏引擎”如 Genie、GameGAN。它们通过动作或文本条件预测未来帧但主要依赖视觉历史记忆缺乏显式的状态管理和因果推理能力。2.2 生成式 3D 世界另一类工作如 WorldGen、HunyuanWorld致力于生成可探索的显式 3D 场景。它们强调几何一致性和自由视角但资产制作和渲染成本高昂且难以覆盖开放世界中的无限变化。2.3 代码Agent与世界模型已有研究如 WorldCoder、Code World Models for General Game Playing证明 LLM 可以通过编写 Python 程序来模拟环境动态。本文在此基础上更进一步将代码作为持续运行、可修改的世界执行引擎而非仅用于离线建模。3. 方法CWM 的整体流程如图 2 所示代码AgentCoding Agent通过读写代码Code来更新可执行世界状态 S_t^exe然后该状态被编译为 Proxy 和提示输入视频模型 G_θ生成最终观测 O_{t1}。其中A_t 表示动作T_AC 表示联合 Agent-Code 的转移。3.1 Code World Model将完整世界状态分解为可执行状态 S_t^exe包含实体属性、规则、关系、事件历史等由代码直接操作。视觉状态 S_t^vis包含由视频模型生成的外观、运动等信息需保持跨帧一致性。更新过程分为两层高层推理稀疏代码Agent如 GPT-5.6负责处理复杂事件如外交、战术生成或修改代码。低层执行高频代码循环负责每帧的位置更新、碰撞检测、属性变化等无需调用大模型。这种设计大幅提升了运行效率同时保持了规则的确定性和可修改性。3.2 世界状态对视频模型的条件控制如何将精确的时空状态传递给视频模型是核心挑战。纯文本描述不够精确而完整 3D 重建成本太高。因此论文引入Proxy。Proxy 是什么Proxy 是一种粗粒度的、程序化生成的空间表示包含实体位置、姿态、轨迹、相机运动等关键信息。它由世界状态直接编译而成例如人物用胶囊体或火柴人表示车辆用线框表示场景用低多边形占位体表示。Proxy 如何工作代码更新状态后轻量级编译器将状态渲染为 “Proxy 视频”低分辨率、仅有几何轮廓。Proxy 视频与文本描述一同输入视频模型。视频模型在 Proxy 提供的强时空约束下利用其生成先验填充纹理、光影、物理细节等。这样Proxy 提供了像素级的控制信号位置、运动轨迹必须准确而视频模型负责外观逼真度。两者结合既保证了逻辑精确性又发挥了生成模型的创造力。3.3 数据训练视频模型理解 Proxy需要大量时空对齐的 (Proxy, 文本, 目标视频)三元组。游戏数据如 GTA V在游戏运行时同步记录 RGB 画面、引擎内部状态坐标、朝向、碰撞等。然后程序化生成对应的 Proxy 视频确保帧级对齐。真实世界数据如 KITTI-360通过 3D 重建和语义分割即使没有游戏引擎也能从真实视频中提取相机位姿、物体位置和深度图进而编译出 Proxy。这大大扩展了数据来源使模型能学习真实世界的物理和光照。4. 实验4.1 实现细节基础模型MiniMax-H3 Ref2VA开源的视频生成模型。微调数据约 5.6 小时的 GTA V 游戏录屏切分为 9,420 个 5 秒片段124 帧1344×76824fps。Proxy 设计低分辨率336×192包含深度图和语义 ID 图。微调方法LoRA秩 128在所有 50 个 Transformer 块上应用可训练参数约 596M。优化器AdamWbatch大小8BF16 混合精度训练 3 个 epoch共 3,534 步。代码AgentGPT-5.6 Sol用于推理时生成或修改游戏逻辑。4.2 结果展示尽管仅使用了少量GTA V数据进行微调模型展现出了惊人的泛化能力多风格迁移在 Proxy 骨架控制下模型能生成 “美少女战士”、“詹姆斯·邦德”、“飞天鳐鱼” 等多种风格角色且动作轨迹严格遵循 Proxy 的时空约束。复杂动作跟随包括行走、摔倒、翻滚、运镜弧线等Proxy 都能精确引导视频模型生成相应的动态。高保真细节生成的画面保留了细腻的纹理、光影和物理交互如雨水、布料飘动远超简单渲染。5. 总结与展望Code World Model 首次将代码Agent的逻辑推理能力与视频生成模型的视觉表现力深度融合为构建可推理、可持久化、高保真的开放世界模型开辟了新路径。它的成功验证了 “符号连接” 混合范式的巨大潜力。局限性系统受限于现有的计算预算训练规模依然较小导致当前的生成质量分辨率、保真度仍有较大的提升空间。此外目前的原型系统尚未实现自回归的实时生成即无法像游戏引擎一样以 30 FPS 或 60 FPS 的速度持续无限地生成新帧。尽管代码Agent如 GPT-5.6进展迅猛但它们目前依然难以可靠地从头实现from scratch高度复杂的游戏机制。CWM 为Agent提供了基础的游戏引擎代码如 GTA V 的基础碰撞、移动循环和场景资源Agent主要负责调用、组合和局部修改而非全自动构建。未来方向加速视频模型推理朝实时交互迈进提升代码Agent自主构建复杂场景和逻辑的能力减少人工预设。这篇论文不仅是一项技术创新更是一种思路的转变——让 AI 通过编写代码来 “理解” 世界再通过生成视频来 “呈现” 世界这或许正是通往通用世界模拟器的正确方向。