
你有没有想过AI 生成的交互式视频谁来给它打分不是画质好不好看这么简单。想象你在玩一个 AI 生成的游戏世界你按下前进键屏幕上的画面应该逐渐放大、逼近就像你真的在往前走。但如果 AI 生成的视频压根没理会你的指令镜头还是原地不动这个视频哪怕画质再精美也是废品。这就是**世界模型**一种能根据你的操作指令比如键盘方向键、鼠标移动实时生成后续视频画面的 AI 系统你可以把它理解成会听话的视频生成器。问题是怎么判断它听没听话听话之后画面又好不好看这篇来自腾讯混元和复旦大学等机构的论文就是在解决这个看似简单、实则棘手的评判难题。一个评委不够用的世界先说说这件事到底难在哪儿。在这篇论文之前业界评估这类视频主要靠两套彼此独立的系统。一套是**几何式奖励**用 3D 重建模型比如 DepthAnything3从生成的视频里反推出摄像机实际走了什么路径再跟你下达的指令做比对路径对不上就扣分。这套方法能告诉你镜头有没有按指令移动但它对画面本身闭着眼睛。哪怕视频里全是抖动、模糊、色彩突变只要摄像机路径数字算出来是对的它照样给高分。另一套是**图像式奖励**比如 HPSv3 这类模型抽几帧画面出来单独打分看清不清晰、好不好看。这套方法反过来只盯着画面质量完全不管镜头到底有没有执行你的指令。一个视频哪怕原地不动只要每一帧长得漂亮它也能拿高分。这就好比你请了两个裁判评价一场体操表演一个只会看运动员有没有做出规定动作完全不看动作做得优不优美另一个只会看运动员身材姿态好不好看完全不管有没有做规定动作。两个裁判各打各的分永远凑不出一个综合评价。如果这时候你想训练运动员同时兼顾动作规范和优美度用这两个割裂的裁判系统去指导训练运动员很可能学会了一套讨好裁判A的怪异姿势却完全没学会讨好裁判B真正想要的东西。论文作者们意识到一个更聪明的思路是找一个通才裁判让它同时看懂动作对不对、姿态美不美并且这两个判断来自同一次观察而不是两个互不通气的系统各说各话。这个通才裁判他们选择用**视觉语言模型**VLMVision-Language Model来担任一种既能看图像视频又能说自然语言进行推理的 AI 模型类似 GPT-4V 这种能看图聊天的模型。但事情没这么简单。如果你直接把一整段长视频和一整串复杂的动作指令甩给 VLM让它一次性判断好坏会出现新的麻烦视频太长、动作太多VLM 很容易在海量信息里看漏关键的那几帧。比如向左转这个动作可能只体现在视频中间三四帧的细微变化上淹没在几百帧素材里VLM 扫一眼很可能就错过了。这就像让你在一部两小时电影里找出某个演员某句台词说错的那零点五秒你大概率会看走眼。把长视频切成小块来看WorldReward 的核心设计论文提出的解决方案叫**WorldReward**一个基于 VLM 的成对偏好奖励模型它不是给单个视频打绝对分数而是同时看两个候选视频判断哪个更好这种两两比较的方式叫成对偏好评估。它的核心思路可以用一句话概括别让 VLM 一口吃掉整段视频而是把长视频切成一个个动作片段一块一块地精细检查。具体来说系统会把完整的动作轨迹比如一串连续的前进、转弯指令切分成若干个**动作块**chunk每个块包含连续 4 个动作。这就像老师批改作文不会读完全文才打分而是逐段批注看这一段的论点立没立住、语言通不通顺再把每段的评价汇总成整体分数。如果老师非要憋着不做任何标记一路读到结尾才凭印象打一个总分很可能一开始那段精彩的破题句早就被忘光了最后的分数其实只反映了结尾给他留下的模糊印象。分段批注保留的是全过程的证据而不是最后一刻的记忆。每个动作块里WorldReward 会构造一个包含六张图的结构化输入一张源图像用来对照场景有没有跑偏、一张帧网格总览图展示这个块里每个动作的起始、中间、结束画面、以及四张动作细节对比图把每个动作的首尾帧单独拎出来对比。这样一来VLM 每次只需要专注分析一个短片段既不会被无关信息干扰也不会漏掉转瞬即逝的关键变化。论文里有个很生动的例子见原文图1一辆越野车停在沙漠岩石地貌前指令要求镜头先做几次向左偏航yaw left再向前推进forward。WorldReward 逐个动作检查发现视频 A 在偏航时的三维运动感和景深表现更自然视频 B 则在最后一个块里出现了严重的场景漂移原本的白天光线莫名其妙变成了日落色调背景地貌也跟着走样。这种局部的、瞬时的问题如果放在整段视频里综合评价很容易被整体感觉还不错这种印象稀释掉但拆成块之后问题无所遁形。每个块判断完动作对不对之后系统还会从三个维度评估画面质量**时间一致性**纹理、光照、物体是否稳定不闪烁、**动态生成质量**运动是否符合真实的三维物理规律而不是像纸片一样平移缩放、**伪影与结构完整性**有没有明显的画面破损、场景漂移。所有块级判断出来之后系统用投票的方式汇总成整段视频的最终结论哪个候选视频赢的块多哪个就是整体优胜者平票就判平局。这个设计背后的逻辑是不能让某一个特别精彩或特别糟糕的片段左右整个视频的评价就像评价一部电影不能因为某一个高潮镜头拍得惊艳就无视其他部分剧情松散的问题。训练数据从哪里来AI 生成 AI 审核 人工复核有了评判框架接下来的问题是怎么训练这个模型。VLM 需要海量的标准答案才能学会怎么打分而这些标准答案不可能全靠人工一条条写。论文团队设计了一条三级流水线。第一步用 Gemini 3.1 Pro谷歌的一款前沿 VLM给每个动作块生成初步的推理式判断包括分析文字和最终的胜负结论。这一步产出了海量但不完全可靠的草稿标注。第二步是论文里比较巧妙的一环叫**智能体质检**Agent-based QC用另一个模型 GPT-5.5 扮演审核员角色但它不是简单地读一遍标注文本就下结论,而是像一个真正较真的编辑一样主动调用读图工具先看源图和总览图再根据观察结果决定要不要进一步细看某个具体的动作对比图必要时还能回头重新核对之前看过的证据。如果这个环节直接让 GPT-5.5 一次性看完所有图然后打分效果反而会打折扣。论文里提到直接把所有细节图一股脑塞进模型的初始上下文反而会让模型的注意力被无关信息稀释审核质量下降。所以让它像人类审稿人一样一步一步地按需调取证据反而审得更准。这有点像医生看病历不是把病人所有的检查报告一次性甩到他面前让他自己找重点而是让他先看主诉再根据主诉决定要不要调阅具体的某张CT片子这样他才不会在海量信息里迷失方向。审核完成后数据显示 42.1% 的标注被智能体标记为需要修正其中 67.4% 只是修改了推理文字的表述23.8% 修改了具体的维度评判结果。这说明第一轮 AI 生成的标注确实存在不少偏差需要这道审核工序来纠正。第三步是人工复核专门针对被智能体标记为需要修改的样本进行人工确认。结果显示87% 的智能体修改建议得到了人类审核员的认可说明这套自动化审核机制相当靠谱不是瞎改一通。最终这套流水线产出了约 10 万条带推理过程的训练样本覆盖了 8 种不同的世界模型生成的视频对涵盖平移、旋转、复合运动等多种轨迹类型以及照片级写实、动漫游戏、艺术风格等不同的视觉风格。怎么知道 WorldReward 真的靠谱WorldReward-Bench 基准测试光训练出模型还不够得有一把公认的尺子来量它准不准。论文团队因此专门构建了**WorldReward-Bench**一个包含 760 组配对视频的人工标注基准测试集每组视频共享同样的起始图像、文字描述和动作轨迹专门用来检验各类奖励模型和 VLM 裁判跟真人判断的一致程度。每一组视频都由三名标注员独立评分从动作一致性、外观质量、运动质量三个维度分别打分选项是视频A更好视频B更好或打平模型身份和左右顺序全程对标注员保密避免先入为主的偏见。结果这张成绩单很能说明问题。在总体一致性上WorldReward 拿到了三个维度的最高分动作一致性 77.63%外观质量 81.32%运动质量 73.03%。相比之下GPT-5.5 直接作为裁判打分只能拿到 74.21%、79.87%、69.47%也就是说 WorldReward 在动作、外观、运动三项上分别领先 GPT-5.5 约 3.42、1.45、3.56 个百分点。更有意思的一个细节是WorldReward 的训练数据其实就来自 Gemini 3.1 Pro 和 GPT-5.5 这两个老师的标注但经过那套智能体审核加人工复核的打磨之后学生反而超过了两位老师。这有点像一个学生跟两个老师分别学了一部分知识但他把两边的内容交叉验证、去伪存真之后考试成绩反而比任何一位老师单独出题还要准。这说明真正拉开差距的不是用了哪个 AI 生成标注而是那道审核和纠错的工序。论文的消融实验Table 5也印证了这一点如果只用 Gemini 的直接蒸馏标注训练平均一致性只有 68.69%跟 Gemini 直接当裁判的 68.90% 几乎持平但加上智能体质检环节一致性直接跳到 75.94%再加上人工复核最终达到 77.33%。这就是说光靠找个更聪明的 AI 老师来教提升有限真正的增量来自那套质检加复核的组合拳。在跟几何式和图像式基线模型比较时WorldReward 同样全面领先。比如几何模型 DepthAnything3 在动作一致性上只有 70.53%图像质量模型 HPSv3 在外观质量上是 73.68%都明显低于 WorldReward 的对应分数。这也再次验证了开头那个判断用两套割裂系统各打各的分终究比不上一个统一模型同时看懂动作和画质。结构化证据真的有用吗拆解每个组件的贡献论文还做了一组细致的消融实验逐一拿掉六张图输入里的某个组件看看少了它会怎样。去掉源图像外观质量的一致性掉了 2.37 个百分点因为模型失去了判断场景有没有跑偏的参照物。去掉帧网格总览图影响最大平均掉了 2.48 个百分点动作和运动两项分别掉了 2.71 和 3.29 个百分点因为这张图承载的是整个动作块的演变过程。去掉动作细节对比图动作一致性掉了 2.82 个百分点因为这张图直接把每个动作的首尾变化摆在眼前少了它模型就没法精准定位到底是哪个瞬间出了问题。这三张图各管一摊事缺一不可,就像医生诊断需要同时看病人的病史源图像、连续的体检报告总览图和某次具体检查的详细结果细节图少看任何一项都可能误诊。除了输入证据的设计论文还对比了推理监督的深浅程度。如果只给模型看最终的胜负标签不给任何推理过程的文字说明平均一致性只有 72.47%加上整体对比总结这层监督提升到 74.94%再加上逐段详细分析也就是完整模型的做法最终达到 77.33%。这说明让模型学会说理由不光是让输出更好解释实实在在地提升了判断的准确度。这跟人类学习的道理是相通的一个只背答案不理解过程的学生遇到稍微变化的题目就容易翻车而一个理解每一步推理逻辑的学生才能真正把这套判断能力迁移到新场景里。拿这个裁判去训练选手强化学习实战效果评判模型再准最终目的还是要用它去指导世界模型变得更好。论文把 WorldReward 接入了**DiffusionNFT**一种在线扩散模型强化学习框架的训练流程对 HY-WorldPlay 1.5 这款世界模型做强化学习后训练并跟同门框架 WorldCompass用几何奖励加图像奖励这套割裂系统做直接对比。结果在短期约125帧、中期约253帧、长期约381帧三个时间尺度上都很一致。以长期生成为例WorldCompass 的组合动作准确率是 54.82%WorldReward 训练出来的模型达到 56.40%画质分数HPSv3上WorldCompass 是 0.73WorldReward 是 1.02。也就是说不仅动作执行更准画面质量同时也在提升没有出现常见的顾此失彼现象。论文还给出了非常直观的定性对比图。用几何加图像双奖励训练出来的模型虽然镜头控制准了但视频后段经常出现明显的色偏和纹理漂移比如天空的颜色莫名其妙地变了调。而用 WorldReward 训练的模型因为奖励信号本身就是从带着时间维度的动作对齐视频证据里推理出来的画面在整个轨迹过程中保持得更稳定。这背后的原因也不难理解图像式奖励只抽查单帧天然感知不到这一帧跟上一帧比色彩是不是突变了而 WorldReward 天生就是看着一段连续画面在做判断的。论文最后还找了 GPT-5.5 和真人做了一轮独立的盲测复核200 组视频对三名标注员分别打分。结果三方WorldReward、GPT-5.5、人类给出的排序高度一致在视觉质量上人类偏好新模型WorldReward-RL胜过 WorldCompass 的比例是 48.9% 比 25.2%差距接近两倍。这说明这套奖励模型指导出来的训练效果不是自说自话换一个完全独立的裁判来看结论依然站得住。写在后面读完这篇论文最触动我的其实不是 WorldReward 本身的技术设计而是那套智能体质检的思路。很多人对 AI 标注数据的想象还停留在找个大模型跑一遍就完事了但这篇论文用实打实的数字告诉你直接蒸馏和经过质检审核之间隔着接近 7 个百分点的差距。这个差距不是靠换一个更强的模型能补上的Gemini 3.1 Pro 已经是相当顶尖的模型了但它单次生成的标注质量依然有限。真正起作用的是让另一个模型带着审稿人的姿态用多轮工具调用去反复核实、交叉验证。这提示了一个可能被低估的方向与其一味追求用更强的单一模型去生成数据不如设计一套让模型互相审核、互相纠错的流程,机器和机器之间也需要三审三校。另外一个让我意外的细节是论文里提到把动作块拆成四个动作一组这个具体的粒度选择背后其实是在权衡上下文长度和局部证据完整性之间的取舍。太长了会稀释局部证据太短了又可能割裂一个连贯动作的前后文这种看似不起眼的超参数选择其实藏着不少工程直觉在里面。这篇论文没有解决的问题也很明显它依赖的评判标准归根结底还是人类标注者的主观判断而不同标注者对运动是否流畅这种问题本身就存在分歧。当奖励模型学会的是一群人的平均偏好它会不会在某些边界情形下变得保守倾向于生成四平八稳但缺乏个性的视频这是一个值得继续追问的问题。QAQ1WorldReward是用来做什么的AWorldReward是一个基于视觉语言模型的奖励评判系统专门用来评价摄像机可控的AI视频生成模型世界模型生成的视频同时判断视频是否准确执行了摄像机指令以及画面质量是否过关并能用这个评判结果反过来训练和优化视频生成模型。Q2WorldReward和以前的评价方法有什么不同A以前的方法要么只看镜头轨迹对不对几何式奖励但不管画质要么只看画面好不好看图像式奖励但不管动作执行。WorldReward把长视频切成小的动作片段用一个模型同时评判动作是否正确和画质是否过关两者来自同一次分析而不是两套割裂的系统。Q3WorldReward训练用的数据是怎么来的A先用Gemini 3.1 Pro给视频片段生成初步的判断和推理文字再用GPT-5.5扮演审核员通过多轮工具调用反复核实这些标注是否有误最后由人工审核员确认修改建议是否合理。这套流程最终产出了约10万条高质量的训练样本。