WorldAlign:用解耦的 4D 獎勵,讓生成影片真正守住“世界一致性”
WorldAlign 提出解耦的 4D 獎勵框架,把靜態區域與動態主體在語義上分開:靜態部分透過語義掩碼重投影對齊幾何世界先驗,並用相機運動獎勵防止近乎靜止的投機解;動態主體則由強視覺語言模型按樣本清單評判動態性、物理合理性、形狀與紋理一致性。無需人類偏好標註,在 Wan2.1 與 Wan2.2 圖生影片模型上同時提升靜態與動態一致性,且不壓低運動幅度。
影片生成模型這兩年的進步,幾乎都發生在“看起來像”這個維度上:紋理更細,光影更順,鏡頭更穩。但當人們開始把它們當作世界模擬器,用來做機器人預演、遊戲場景或具身智慧的訓練環境時,問題就變了。一個模擬器不只要好看,還要守規矩。同一面牆,鏡頭繞過去再繞回來,不能變形;同一個人,走了十秒,臉和衣服不能悄悄換樣。WorldAlign 這篇論文把這件事概括為 4D 世界一致性:三維空間裡的結構要穩,時間這一維上的運動與外觀也要穩。前者叫靜態一致性,後者叫動態一致性。作者團隊是 Jing He、Kaixin Ding、Xingye Tian、Guibao Shen、Wenhang Ge 等人,論文釋出於 2026 年 10 月 8 日,主類別為 cs.CV。
要提高一致性,一條自然的路是幾何感知的後訓練:先生成影片,再用幾何模型估計深度和相機位姿,把一幀重投影到另一幀,看誤差有多大,用誤差當獎勵去調整生成器。這條路有兩個老毛病。第一,它預設場景是靜止的。一旦畫面裡有人在走、車在開,重投影就會把正常的運動誤判成幾何錯誤,獎勵反而會懲罰真實的動態。第二,即使有些方法勉強容納了動態場景,它們給出的靜態一致性反饋也不可靠,因為靜態與動態的畫素混在一起算誤差。至於動態一致性,也就是運動是否合理、外觀是否前後一致,現有工作往往乾脆不管,或者只用很粗的指標去衡量。
WorldAlign 的核心想法很樸素:既然靜態和動態遵循的假設不同,就別用同一把尺子量。它先在語義層面把畫面分成靜態區域和動態主體,再讓每一部分去對齊最適合自己的“世界先驗”。對靜態區域,先驗是幾何世界先驗。系統用語義引導的掩碼重投影,只在被判定為靜態的畫素上計算跨視角的幾何對齊,運動的主體被排除在外,所以反饋更乾淨、更可靠。這裡還有一個很實際的補丁:只獎勵幾何一致,模型會發現最省力的辦法是讓畫面幾乎不動,重投影誤差自然很小。作者因此加入了輔助的相機運動獎勵,專門懲罰這種近乎靜止的解,迫使模型在保持幾何一致的前提下真正移動視角。這是一個典型的獎勵投機防禦,也提醒我們,任何單一可計算指標都會被最佳化器找到漏洞。
對動態主體,幾何先驗幫不上忙,因為運動是否合理不是幾何問題,而是常識與物理問題。作者的選擇是把一個強大的視覺語言模型當作動態世界先驗,讓它做“評委”。關鍵設計是樣本專屬的檢查清單:針對每一段生成影片,先生成一組具體問題,再逐項評估動態性、物理合理性、形狀一致性和紋理一致性。動態性問的是該動的東西有沒有動;物理合理性問的是動作是否符合重力、接觸與慣性;形狀與紋理則盯住主體在時間軸上有沒有變形或換皮。用清單而不是一個籠統的打分,能把評委的注意力釘在具體證據上,也讓獎勵更容易解釋和排查。更重要的是,這套流程不需要人類偏好標註,兩路獎勵都由先驗自己給出,因此可以做線上後訓練,降低了資料成本。
實驗部分,論文在兩個預訓練的圖生影片模型 Wan2.1 與 Wan2.2 上驗證,結論是 WorldAlign 同時改善了靜態和動態一致性,並且沒有靠壓低整體運動或主體運動來換取分數。最後這一點很關鍵,因為許多一致性方法的“提升”其實來自讓畫面更呆板。當然,僅憑摘要我們還看不到具體數值、消融細節和計算開銷,這些需要讀原文與專案頁確認。從方法上看,仍有幾點值得追問:視覺語言模型評委本身有偏見與不穩定,獎勵質量受限於它;語義分割若把靜態和動態分錯,掩碼重投影會引入噪聲;幾何先驗在反光、透明或極端視角下也會失效。即便如此,這篇工作給出的原則很有價值:當世界由不同性質的部分組成時,獎勵也該按性質拆開,各自對齊合適的先驗。這條思路有望延伸到更長的影片、多主體互動,乃至真正可用的視覺世界模擬。
對行業來說,這項工作還有一層容易被忽視的意義:它把“評估”與“訓練訊號”合二為一。過去,世界一致性多半隻是事後評測的指標,模型釋出後才有人去量。WorldAlign 把同樣的評判直接變成獎勵,在訓練過程中就讓模型承受後果。這意味著評測基準與最佳化目標之間的距離被縮短,但也意味著基準一旦被鑽空子,代價會立刻傳導到模型本身。對想把影片生成用於機器人、自動駕駛模擬或影視預演的團隊而言,更穩妥的做法是同時保留獨立的人工抽查與第三方指標,把這類自動獎勵當作提效工具,而不是質量的唯一裁判。此外,解耦設計還帶來了工程上的好處:靜態與動態兩路獎勵可以分別調權重、分別替換先驗。幾何模型升級時只需換掉前一路,視覺語言模型換代時只需換掉後一路,不必整體重訓。這種模組化的獎勵結構,比把所有要求揉進一個黑箱分數更容易維護,也更容易定位問題出在哪一環。
Sources
FAQ
WorldAlign 裡的“解耦”具體指什麼?
指把畫面按語義拆成靜態區域與動態主體,各自用不同的世界先驗打分。靜態區域對齊幾何先驗,檢查跨視角的 3D 結構是否連貫。動態主體交給視覺語言模型,檢查運動、物理、形狀與紋理。兩路獎勵互不干擾。
為什麼要加入相機運動獎勵?
靜態一致性獎勵有一條捷徑:畫面幾乎不動,重投影誤差就很小。模型會學會“偷懶”,生成近乎靜止的影片。輔助的相機運動獎勵懲罰這種解,逼模型在保持幾何一致的同時真正產生視角變化。
這種方法為什麼不需要人類偏好標註?
靜態獎勵來自幾何先驗,是可計算的重投影對齊。動態獎勵來自強視覺語言模型,按每個樣本生成的清單逐項打分。兩者都不依賴人工標註的好壞對比,因此能線上後訓練。代價是評判質量取決於這些先驗自身的可靠性。