WorldAlign:用解耦的 4D 奖励,让生成视频真正守住“世界一致性”

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WorldAlign 提出解耦的 4D 奖励框架,把静态区域与动态主体在语义上分开:静态部分通过语义掩码重投影对齐几何世界先验,并用相机运动奖励防止近乎静止的投机解;动态主体则由强视觉语言模型按样本清单评判动态性、物理合理性、形状与纹理一致性。无需人类偏好标注,在 Wan2.1 与 Wan2.2 图生视频模型上同时提升静态与动态一致性,且不压低运动幅度。

视频生成模型这两年的进步,几乎都发生在“看起来像”这个维度上:纹理更细,光影更顺,镜头更稳。但当人们开始把它们当作世界模拟器,用来做机器人预演、游戏场景或具身智能的训练环境时,问题就变了。一个模拟器不只要好看,还要守规矩。同一面墙,镜头绕过去再绕回来,不能变形;同一个人,走了十秒,脸和衣服不能悄悄换样。WorldAlign 这篇论文把这件事概括为 4D 世界一致性:三维空间里的结构要稳,时间这一维上的运动与外观也要稳。前者叫静态一致性,后者叫动态一致性。作者团队是 Jing He、Kaixin Ding、Xingye Tian、Guibao Shen、Wenhang Ge 等人,论文发布于 2026 年 10 月 8 日,主类别为 cs.CV。

要提高一致性,一条自然的路是几何感知的后训练:先生成视频,再用几何模型估计深度和相机位姿,把一帧重投影到另一帧,看误差有多大,用误差当奖励去调整生成器。这条路有两个老毛病。第一,它默认场景是静止的。一旦画面里有人在走、车在开,重投影就会把正常的运动误判成几何错误,奖励反而会惩罚真实的动态。第二,即使有些方法勉强容纳了动态场景,它们给出的静态一致性反馈也不可靠,因为静态与动态的像素混在一起算误差。至于动态一致性,也就是运动是否合理、外观是否前后一致,现有工作往往干脆不管,或者只用很粗的指标去衡量。

WorldAlign 的核心想法很朴素:既然静态和动态遵循的假设不同,就别用同一把尺子量。它先在语义层面把画面分成静态区域和动态主体,再让每一部分去对齐最适合自己的“世界先验”。对静态区域,先验是几何世界先验。系统用语义引导的掩码重投影,只在被判定为静态的像素上计算跨视角的几何对齐,运动的主体被排除在外,所以反馈更干净、更可靠。这里还有一个很实际的补丁:只奖励几何一致,模型会发现最省力的办法是让画面几乎不动,重投影误差自然很小。作者因此加入了辅助的相机运动奖励,专门惩罚这种近乎静止的解,迫使模型在保持几何一致的前提下真正移动视角。这是一个典型的奖励投机防御,也提醒我们,任何单一可计算指标都会被优化器找到漏洞。

对动态主体,几何先验帮不上忙,因为运动是否合理不是几何问题,而是常识与物理问题。作者的选择是把一个强大的视觉语言模型当作动态世界先验,让它做“评委”。关键设计是样本专属的检查清单:针对每一段生成视频,先生成一组具体问题,再逐项评估动态性、物理合理性、形状一致性和纹理一致性。动态性问的是该动的东西有没有动;物理合理性问的是动作是否符合重力、接触与惯性;形状与纹理则盯住主体在时间轴上有没有变形或换皮。用清单而不是一个笼统的打分,能把评委的注意力钉在具体证据上,也让奖励更容易解释和排查。更重要的是,这套流程不需要人类偏好标注,两路奖励都由先验自己给出,因此可以做在线后训练,降低了数据成本。

实验部分,论文在两个预训练的图生视频模型 Wan2.1 与 Wan2.2 上验证,结论是 WorldAlign 同时改善了静态和动态一致性,并且没有靠压低整体运动或主体运动来换取分数。最后这一点很关键,因为许多一致性方法的“提升”其实来自让画面更呆板。当然,仅凭摘要我们还看不到具体数值、消融细节和计算开销,这些需要读原文与项目页确认。从方法上看,仍有几点值得追问:视觉语言模型评委本身有偏见与不稳定,奖励质量受限于它;语义分割若把静态和动态分错,掩码重投影会引入噪声;几何先验在反光、透明或极端视角下也会失效。即便如此,这篇工作给出的原则很有价值:当世界由不同性质的部分组成时,奖励也该按性质拆开,各自对齐合适的先验。这条思路有望延伸到更长的视频、多主体交互,乃至真正可用的视觉世界模拟。

对行业来说,这项工作还有一层容易被忽视的意义:它把“评估”与“训练信号”合二为一。过去,世界一致性多半只是事后评测的指标,模型发布后才有人去量。WorldAlign 把同样的评判直接变成奖励,在训练过程中就让模型承受后果。这意味着评测基准与优化目标之间的距离被缩短,但也意味着基准一旦被钻空子,代价会立刻传导到模型本身。对想把视频生成用于机器人、自动驾驶仿真或影视预演的团队而言,更稳妥的做法是同时保留独立的人工抽查与第三方指标,把这类自动奖励当作提效工具,而不是质量的唯一裁判。此外,解耦设计还带来了工程上的好处:静态与动态两路奖励可以分别调权重、分别替换先验。几何模型升级时只需换掉前一路,视觉语言模型换代时只需换掉后一路,不必整体重训。这种模块化的奖励结构,比把所有要求揉进一个黑箱分数更容易维护,也更容易定位问题出在哪一环。

Sources

FAQ

WorldAlign 里的“解耦”具体指什么?

指把画面按语义拆成静态区域与动态主体,各自用不同的世界先验打分。静态区域对齐几何先验,检查跨视角的 3D 结构是否连贯。动态主体交给视觉语言模型,检查运动、物理、形状与纹理。两路奖励互不干扰。

为什么要加入相机运动奖励?

静态一致性奖励有一条捷径:画面几乎不动,重投影误差就很小。模型会学会“偷懒”,生成近乎静止的视频。辅助的相机运动奖励惩罚这种解,逼模型在保持几何一致的同时真正产生视角变化。

这种方法为什么不需要人类偏好标注?

静态奖励来自几何先验,是可计算的重投影对齐。动态奖励来自强视觉语言模型,按每个样本生成的清单逐项打分。两者都不依赖人工标注的好坏对比,因此能在线后训练。代价是评判质量取决于这些先验自身的可靠性。