ARTICLE DETAIL

资讯详情

深耕网站视觉设计与运营推广的一线实战洞察。

世界模型到底是什么?李飞飞、朱军等如何解读?

世界模型到底是什么?李飞飞、朱军等如何解读? 从渲染器、模拟器、规划器到理解、想象、行动的闭环中美顶尖 AI Lab正在补全世界模型走向 AGI 的两种坐标。2026 年「世界模型」是 AI 圈最没有共识的词之一。一段能够连续生成的视频被叫作世界模型一个随键鼠操作实时变化的数字环境也被叫作世界模型在潜空间预测未来状态的系统以及直接输出机器人动作的策略同样使用这个名字。这些模型都在处理世界的信息能力边界却相去甚远。生成视频里的画面可以足够逼真却违背真实的物理规律机器人能够完成一次抓取也可能只熟悉实验室里的物体、机位和动作轨迹。一个系统究竟学到了视觉相关性、物理结构还是行动与结果之间的关系仅靠 Demo 很难回答。概念混乱增加了技术判断的难度。画质、几何精度、预测能力和任务成功率被混在一起比较不同团队看似争夺同一赛道实际回答的可能是不同问题。因此世界模型研究开始回到一个基本问题模型需要具备哪些能力才能从生成内容走向理解并改变世界李飞飞和 World Labs 按功能将世界模型分为渲染器、模拟器和规划器分别输出像素、世界状态与动作。链接https://www.worldlabs.ai/blog/taxonomy-of-world-modelsLeCun 则主张在抽象潜空间中学习可预测的世界结构让模型保留对理解、推理和规划有用的信息。链接https://ai.meta.com/research/vjepa/清华大学朱军给出了第三个角度。早在去年 12 月 Motus 发布时他就公开阐述「通用世界模型」整体构想今年 3 月他又将其定位为连接数字世界与物理世界的基础。几个月后朱军及团队在论文《General World Models from First-Principles》中进一步完善这套框架从第一性原理定义核心能力并给出一张五级进化路线图。论文链接https://www.shengshu.com/assets/gwm-principles-and-roadmap.pdf技术报告https://www.shengshu.com/zh/general-world-model/论文将通用世界模型的核心能力归纳为理解、想象和行动。模型需要从历史观测中形成对当前世界的判断推演不同选择可能产生的未来采取行动再用新观测修正自身。沿着这一框架视频生成、实时交互、潜空间预测和机器人控制可被视为同一条能力路线上的不同阶段。世界模型距离通用智能还有多远也被转化成更具体的问题它能否维持一个连贯的世界能否预测干预带来的后果能否从真实反馈中学习又能否逐渐形成目标并组织更复杂的行动世界模型的第一性原理很多人都有过学自行车的经验。刚开始时身体总会摇摇晃晃。看到车把偏向一侧感觉身体重心开始下沉人会随即调整方向再根据新的反馈继续修正。随着练习增加大脑逐渐学会预判某个动作将带来什么结果。这正是世界模型最朴素的含义。1943 年Kenneth Craik 提出人类会在头脑中形成关于现实的「小尺度模型」借此推演不同行动可能带来的结果。强化学习中的 POMDP 进一步描述了这个过程智能体接收局部观测估计世界状态采取动作再根据新观测更新判断。朱军团队将这一逻辑概括为通用世界模型的三项核心能力它们相互衔接构成持续更新的闭环理解Understanding把视觉、语言、声音、触觉或机器人传感器等信息整合成对当前世界的内部判断想象Imagination从当前状态推演多个可能未来尤其是「如果我采取动作 A而不是动作 B结果会怎样」行动Action把预测变成对数字或物理环境的干预并让行动后的新观察反过来检验、修正模型。通用世界模型的三项核心能力形成一个闭环理解负责推断当前状态想象负责预测可能的未来行动则改变世界并为下一轮理解提供新的证据。这也是为什么视频生成不等于世界模型的全部。视频模型可以回答接下来画面可能是什么样但要走向通用世界模型它还需要回答「如果我改变这个条件、移动这个物体、施加这个动作世界会如何不同」 这类带有行动条件的预测才触及了因果、反事实和可执行决策。理解、想象、行动如何形成闭环为描述世界模型如何演进朱军团队进一步提出五级路线即从 L1 生成世界、L2 交互世界和 L3 在世界中行动逐步走向 L4 自主世界智能体与 L5 世界组织者。用一只被推到桌边的玻璃杯来理解会更直观。L1 的模型可以生成杯子滑落、撞击、碎裂的连续画面L2 的模型可以在用户改了视角、改变推动方向后继续演化这个世界到了 L3模型需要判断杯子是否要掉落、预测伸手是否来得及并输出机器人真正可以执行的抓取动作。只有行动后它才会知道自己对杯子的重量、摩擦和抓取时机判断得是否正确。再往上L4 不再只等人给指令它要能发现风险、主动观察、补充信息并在失败后修正策略。L5 则进一步面对多主体协作比如谁去抓杯子、谁去避障、谁来调配工具如何在环境变化后重排任务。这条路线的意义在于它把「世界模型」从一个名词变成了一组可以逐级检验的问题。L1 看生成轨迹是否连贯L2 看世界能否持续响应L3 看模型能否改变物理环境L4 看系统能否主动探索和持续学习L5 看它能否组织开放环境中的多主体协作。通用世界模型GWM五级路线图的形式化建模目标与习得能力。按照论文给出的判断现有系统已经触及前三个层级L4 和 L5 仍是开放问题主要缺口包括因果与物理接地、持久记忆、在线学习、高效部署和安全控制。评测也要比较预测与真实结果考察模型在陌生任务、环境和本体上的迁移能力。从视频到具身同一个假设的两次验证世界模型的难处并不只在算法。互联网视频规模巨大记录了广泛的物体、人物、场景和运动模型可以从中学习空间结构、物体持续性、人类行为以及事件通常如何发展但视频很少同步记录造成变化的动作、力量和意图。机器人轨迹能够连接观测、动作和结果采集成本却更高也容易绑定具体硬件和任务。朱军团队提出的路径是把这两类数据放入一座由观察走向行动的数据金字塔。通用世界模型GWM的数据金字塔及其与五级能力路线图的关系。底层是互联网规模的视频用来获得世界知识和动态先验向上依次是领域视频、第一视角人类视频、带有动作记录的人类示范顶层是真实机器人交互数据。越往上数据越稀缺、成本越高但动作、任务与机器人本体的对应关系也越清楚。这就解释了为什么生数科技会同时推进视频生成与具身智能视频提供世界知识的广度机器人数据完成行动接地。在数字世界一侧Vidu系列持续探索对视觉世界的生成与交互。视频不是世界模型的终点却是重要的起点它让模型在大规模时空变化中学习对象、场景、运动与事件如何演化。ViduS1 则进一步把一次性生成推进到实时响应让用户输入可以持续改变后续内容测试模型是否能在交互过程中保持状态连续。在物理世界一侧Motus 与 Motubrain 将环境理解、状态预测与机器人动作接入同一条链路。模型需要看清环境预测干预的后果再将判断转化为能够执行的动作并接受真实结果的检验。实现 L1 至 L3 的现有代表性系统。两条产品线由此形成对同一个世界模型假设的两次验证。数字环境检验模型能否理解并想象世界物理环境检验这些知识能否支持行动并在反馈中得到修正。要让两类验证共享底层能力图像、视频、语言和机器人动作需要围绕同一个世界状态协同计算传统模块化系统逐级传递信息容易在接口处损失几何、时间和不确定性信息。所有模态完全共享参数也可能造成训练冲突让海量视频数据压制稀缺的机器人信号。朱军团队提出的MoTMixture-of-Transformers架构尝试在两者之间取得平衡。不同模态保留各自的专家参数再通过共享注意力机制交换上下文。视觉告诉模型环境中发生了什么语言提供目标和约束动作带来对环境的干预三类信息共同更新模型对世界的判断。MoT 提供了统一计算的基础物理规律、跨本体迁移、实时推理和安全控制仍需依靠数据、训练与系统工程解决。其指向的目标十分明确通用世界模型需要一个能被不同模态共同读写、持续更新的世界状态。Motus2让机器人在动手之前先在自己的世界里试一遍如果说 Motus 与 Motubrain 将生数的世界模型探索推进到 L3使机器人能够根据环境理解和未来预测生成动作那么近期提出的 Motus2 则进一步加入结果评估与策略反馈尝试让行动闭环具备自我改进能力。Motus2 没有把动作生成、未来模拟和结果评估做成三套彼此独立的系统。相反它以一套共享参数的视频 — 动作模型暴露出三种控制接口策略Policy / World-Action Model提出可以执行的候选动作模拟器Simulator / Action-Conditioned World Model预测这些动作在视觉世界中可能造成的后果评估器Evaluator / Value Model判断哪一种结果更接近任务目标并把这一判断用于选择和改进。可以把它想成一次真正的「先心灵再手巧」。机器人不再只是看到物体后直接给出一个动作而是先提出几种候选方案在模型中预演各自会带来的画面与任务进度再选择更好的那一步。执行以后成功、失败和不那么理想的结果也不再只是数据废料而会成为下一轮动力学建模与价值学习的证据。动作、预测、评估、反馈和再行动由此进入同一个决策与学习回路这也是 Motus2 所强调的闭环自进化。在数据侧Motus2 采用分层训练路径从单目第一视角视频扩展到同步双目第一视角数据再通过机器人数据完成本体适配。其训练使用约 13 万小时的人类第一视角记录以及超过 100 小时的机器人轨迹和人机对齐数据。这一路径是先让模型累积一份关于人如何与世界互动的共同经验再让它通过机器人数据学习这具身体如何把理解变成动作。在执行侧Motus2 还通过独立的轻量触觉专家对即将执行的短动作进行细化并预测接触后的力反馈。视觉擅长看清物体在哪里、世界大致如何变化触觉则补上接触发生时最难的「最后一厘米」让模型在「看得见」之外对压、碰、抓、旋等细腻操作多一层即时校正。Motus2 仍处于从 L3 向 L4 延伸的阶段。当前验证主要集中在特定机器人和操作任务自主目标形成、持久记忆、开放环境泛化、长期在线学习与安全控制仍有待探索。它的主要进展是将策略生成、未来模拟、价值评估和触觉反馈放入同一套系统让机器人能够在行动前预演后果在行动后利用结果改进策略为走向 L4 自主世界智能体提供一条可检验的路径。从概率学习到世界智能一条中国技术路径通用世界模型的框架也延续了朱军及清华 TSAIL 长期积累的研究方向。朱军教授长期研究贝叶斯方法、概率机器学习、生成模型与强化学习分别处理不确定性、数据分布、未来生成和行动决策。TSAIL 也培养和影响了一批进入全球前沿团队的研究者。宋飏本科阶段曾与朱军合作贝叶斯学习研究宋佳铭本科期间也参与相关工作后来分别在得分生成模型和 DDIM 方向产生重要影响。从概率建模到生成与决策这条学术脉络也映照出AGI 发展的两类入口。一类从语言出发逐步增强推理、工具调用和任务执行能力另一类从视觉与动态世界出发继续走向实时交互和具身行动。放在中国 AGI 产业版图中智谱与生数可以视两条路径的代表。智谱从语言模型出发持续增强推理、Coding 和 Agent 能力生数则从视频生成出发进一步进入实时交互、具身行动与策略优化。两条路线正在相互渗透。语言 Agent 需要视觉反馈和环境模型世界模型也需要语言表达目标、规则与计划不同入口最终都指向对语言、世界状态和行动的共同建模。结语世界模型的竞争最终会从 Demo 的震撼程度转向系统经受反馈的能力。画面可以制造可信的第一印象几何和物理决定这个世界能否被反复使用行动则把模型的判断带进现实。一次预测是否成立要等干预发生后才能确认一次任务是否成功也要放到陌生场景、长期运行和持续变化中检验。朱军团队的论文没有替世界模型之争写下最后答案却提供了一组可以继续检验的问题模型理解了什么能够想象多远行动之后能否修正自己。过去十年AI 最重要的进展来自学习语言和数据中的规律。下一阶段模型还要面对持续变化的环境。当模型能够在这样的环境中不断形成判断、承担行动后果并持续学习世界模型才会从一个拥挤的技术名词逐渐成为通向通用智能的基础。原文链接世界模型到底是什么李飞飞、朱军等如何解读-36氪我的专辑《人工智能生命体 新启点》CSDN平台https://blog.csdn.net/2501_91883294/article/details/147616608?sharetypeblogdetailshareId147616608sharereferAPPsharesource2501_91883294sharefromlink
返回列表