WorldAlign:分離型4D報酬で、生成動画に「世界の一貫性」を持たせる
WorldAlignは、静的領域と動的被写体を意味的に分け、それぞれに適した世界事前分布で評価する4D報酬の枠組みである。静的部分は意味マスク付き再投影で幾何事前分布に整合させ、カメラ運動報酬で静止解を防ぐ。動的被写体はVLMがサンプルごとのチェックリストで採点する。人手の選好注釈は不要で、Wan2.1とWan2.2の双方で静的・動的一貫性が向上し、運動量も保たれる。
動画生成モデルはここ数年、「本物らしく見える」という軸で大きく進歩してきた。質感は細かくなり、照明は滑らかになり、カメラワークも安定した。しかし、これらをロボットの事前演習やゲーム空間、身体を持つエージェントの訓練環境といった「世界シミュレータ」として使い始めると、問われる点が変わる。シミュレータは見栄えが良いだけでは足りず、自らの規則を守らなければならない。ある壁をカメラが回り込んで戻ってきたとき、形が変わってはいけない。十秒歩いた人物の顔や服が、いつの間にか別物になってもいけない。本論文WorldAlignは、この要件を「4D世界一貫性」と呼ぶ。三次元空間の構造が安定していること、そして時間軸上で動きと外観が安定していることである。前者が静的一貫性、後者が動的一貫性だ。著者はJing He、Kaixin Ding、Xingye Tian、Guibao Shen、Wenhang Geらで、2026年10月8日にcs.CVの主カテゴリで公開された。
一貫性を高める自然な方法は、幾何を考慮したポストトレーニングである。生成器が動画を作り、幾何モデルが深度とカメラ姿勢を推定し、あるフレームを別のフレームへ再投影して誤差を測る。その誤差を報酬として生成器を調整する。この方式には二つの弱点がある。第一に、場面が静止しているという前提を置くことが多い。人が歩き、車が走る場面では、再投影が本来の運動を幾何の誤りと誤認し、良い動画に必要な動きまで罰してしまう。第二に、動的な場面を許容する手法でも、静止部分と運動部分の画素が一つの誤差に混ざるため、静的一貫性のフィードバックが信頼できない。動的一貫性、すなわち動きが妥当で外観が時間を通じて保たれているかは、無視されるか粗い指標でしか測られないことが多い。 WorldAlignの中心的な着想は単純である。静的な内容と動的な内容は従う前提が違うのだから、同じ物差しで測るべきではない。まず意味的な情報で画面を静的領域と動的被写体に分け、それぞれに最も適した「世界事前分布」へ整合させる。静的領域の事前分布は幾何的なものだ。意味ガイド付きのマスク再投影により、静的と判定された画素だけで視点間の幾何整合を計算する。動く被写体は除外されるので、フィードバックはよりきれいで信頼できる。さらに実用的な工夫がある。幾何整合だけを報酬にすると、映像をほとんど動かさないのが最も楽な方法になる。再投影誤差が自然に小さくなるからだ。最適化はこの抜け道を見つける。そこで補助的なカメラ運動報酬を加え、ほぼ静止した解を罰し、幾何の整合を保ったまま実際に視点を動かすよう促す。これは報酬ハッキングへの典型的な防御であり、計算可能な単一指標は強い最適化に必ず突かれるという教訓でもある。
動的被写体では幾何事前分布は役に立たない。動きが妥当かどうかは、幾何ではなく常識と物理の問題だからである。著者らは強力な視覚言語モデル(VLM)を動的な世界事前分布として用い、審査員の役を担わせる。鍵になるのはサンプルごとのチェックリストだ。生成された動画ごとに具体的な問いを作り、動的性、物理的妥当性、形状の一貫性、テクスチャの一貫性という四つの観点で項目別に採点する。動的性は、動くべきものが実際に動いているかを問う。物理的妥当性は、重力や接触、慣性に沿った動作かを問う。形状とテクスチャは、被写体が時間とともに変形したり見た目が入れ替わったりしないかを見る。漠然とした一つの点数より、チェックリストのほうが具体的な根拠に審査員の注意を固定でき、報酬の検証やデバッグもしやすい。さらに重要なのは、この流れに人手の選好注釈が要らないことだ。二つの報酬はどちらも事前分布から得られるため、オンラインのポストトレーニングが可能になり、データコストも下がる。 実験では、事前学習済みの画像から動画を生成する二つのモデル、Wan2.1とWan2.2で検証している。報告によれば、WorldAlignは静的・動的の一貫性を同時に改善し、しかも全体の運動や被写体の運動を抑え込んでいない。この点は重要だ。文献上の一貫性の向上には、動画を単調にして得られたものが少なくない。場面を凍らせて勝つ手法は成功とは言えない。ただし、要旨だけでは具体的な数値、アブレーションの詳細、計算コストは分からない。これらは全文とプロジェクトページ(worldalign.github.io)で確認する必要がある。手法の設計上、残る疑問もある。VLM審査員には偏りや不安定さがあり、報酬の質は審査員を超えられない。意味分割が静的と動的を取り違えれば、マスク再投影にノイズが入る。反射面や透明な物体、極端な視点では幾何事前分布も破綻しうる。 それでも、この論文が示す原則には価値がある。世界が性質の異なる部分でできているなら、報酬も同じ線で分け、各部分に合った事前分布へ整合させるべきだ。この考え方は、より長い動画や複数被写体の相互作用へ、さらには技術者が信頼できる視覚的世界シミュレーションへ広がる可能性がある。動画モデルを作るチームにとっての実践的な教訓は、報酬に潜む暗黙の前提、たとえば静止した場面という仮定を点検することと、各報酬項に対して最も安上がりな満たし方を防ぐ仕組みを入れることである。
Sources
FAQ
WorldAlignの「分離」とは何を指しますか。
画面を意味的に静的領域と動的被写体に分け、それぞれ別の世界事前分布で採点することです。静的領域は幾何事前分布で視点間の3D構造を確認します。動的被写体はVLMが動き、物理、形状、テクスチャを確認します。二つの報酬は互いに干渉しません。
なぜカメラ運動報酬を加えるのですか。
静的一貫性の報酬には近道があります。映像がほとんど動かなければ、再投影誤差は小さくなります。モデルはほぼ静止した動画を作るよう学習してしまいます。補助的なカメラ運動報酬はこの解に罰を与え、幾何の整合を保ちながら視点を動かすよう促します。
なぜ人手の選好注釈が不要なのですか。
静的報酬は幾何事前分布による再投影の整合度から計算できます。動的報酬は強力なVLMがサンプルごとのチェックリストで採点します。どちらも人が付けた良否の比較に頼らないため、オンラインのポストトレーニングが可能です。ただし報酬の質は、これらの事前分布の信頼性に左右されます。