WOVEN:視覚的世界モデリングをマルチモーダルLLMに織り込む

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WOVENは視覚的遷移推論のための訓練データ兼ベンチマークである。動画事前学習済み生成モデルのロールアウトから、20種のシーン、5種の行動、8種の推論タイプにわたる36,076件を構築した。38の最先端MLLMを評価すると、最強モデルでも人間を大きく下回り、規模を拡大しても欠陥は残った。各約2,000件のサブセットでの訓練は、外部26ベンチマークのうち22を最大27.3ポイント改善し、タスク固有データの30〜50%を代替できた。

マルチモーダル大規模言語モデルは、この二年ほどで画像キャプション、文書理解、視覚的質問応答において急速に進歩した。しかし、問いが空間関係、身体的相互作用、物理法則、時間経過に関わるとたちまち成績が落ちる。ロボットがカップをテーブルの端へ押すと何が起こるのか。積み木の塔から最下段の一つを抜くとどうなるのか。画面内の物体は一秒後にどこにあるのか。こうした問いは一見ばらばらで、長いあいだ互いに独立した弱点として扱われ、それぞれ別のベンチマークで測られ、別のデータで補強されてきた。2026年10月8日にarXivへ投稿された論文WOVEN(2610.12417、著者にZheyu Fan、Yue Zhang、Mingkai Deng、Kangrui Wang、Qineng Wangら)は、より簡潔な見方を示す。これらの失敗は一つの根に共通しており、それは視覚的遷移推論の欠如、すなわち「ある行動が場面に作用したあと、画面がどう変わるか」を内部で推演する力の不足だという。

この仮説の価値は、新しい能力に名前を付けたことよりも、問題の組み立て方を変えた点にある。空間・身体・物理・時間の各推論の失敗が同じ源から来ているのなら、下流タスクごとに高価なラベルを集める必要はない。視覚的遷移推論を共有の訓練プリミティブとして扱い、異なるモデルが異なる監督源からそれを学び、異なるタスクに再利用すればよい。論文の目的はまさにこの主張を検証し、体系的な訓練レシピを導くことである。著者らは、既存のベンチマークが欠陥を個別に記録するだけで、シーン、行動、推論操作をまたいだ統制比較ができないと指摘する。評価だけでは足りず、この三つの軸で整理されたデータ源が必要なのである。

WOVENはそのために作られた訓練データ兼ベンチマークである。36,076件の事例を含み、20種のシーン、5種の行動、8種の推論タイプにわたる。素材は、動画で事前学習した生成モデルが出力する多様で写実的なロールアウトだ。生成モデルに初期フレームと行動を与えて結果を展開させ、得られたフレームを軸に問いを作る。この構成には実用上の利点がある。二つの軸を固定して残る一つだけを動かせるため、転移の良し悪しを決めるのがシーンなのか、行動なのか、推論操作そのものなのかといった、従来は答えにくかった問いを立てられる。変数をきれいに切り分けた点が、本論文の方法論として最も学ぶ価値があると考える。

評価結果は、欠陥が大きく、体系的で、しぶといことを示している。著者らはGPT-5.4やQwen3-VL-235B-A22Bを含む38の最先端マルチモーダルモデルを試験した。最強のモデルでも人間を大きく下回る。同じ失敗がモデルファミリーをまたいで繰り返されるため、特定の訓練パイプラインの癖ではない。さらに、失敗は規模を大きくしても残る。この最後の点が最も重要で、パラメータや汎用データを増やしただけでは、視覚状態の変化を推論する力は自然には育たないことを示唆する。これは物理的常識や空間推論に関する近年の評価結果とも整合し、専用の監督信号が必要だという主張を支える。

訓練実験は、より有用な前向きの成果をもたらした。著者らは複数の規模のモデルをWOVENで訓練し、広く転移する共有能力が学ばれることを確認した。各約2,000件の訓練サブセットは、合わせて外部26ベンチマークのうち22を改善し、最大で27.3ポイント向上させた。エンジニアリングの現場にとってさらに実用的なのは、WOVENのデータがタスク固有の訓練データの30〜50%を、同程度の精度で置き換えられるという数字だ。ラベルが高価な身体性タスクや空間タスクでは、監督の一部を汎用の遷移推論データに任せられる可能性がある。ただし注意が要る。これらの数値は著者自身の報告であり、26件中4件は改善せず、自社のタスクで再検証してから頼るべきである。

最後に、論文は留保ベンチマークで前向きに検証した訓練レシピを示す。第一の規則は、監督データを、示される行動・シーン・領域ではなく、教える推論操作で選ぶことだ。これは通念に反する。多くのチームはロボット課題を伸ばしたければロボット場面のデータを集めると考えるが、WOVENは転移を左右するのは事例がどの推論操作を鍛えるかだと示唆する。第二の規則は、視覚状態の変化がより大きい事例を優先することで、より頑健な能力が得られる。産業への含意は、データ設計の単位を領域から推論操作へ移すべきだという点にある。また、世界モデルの訓練は動画生成だけに頼る必要はなく、マルチモーダル言語モデルに遷移推論を直接学ばせる道にも投資価値がある。残る制約として、データが生成モデルのロールアウトに由来する以上、その物理的忠実度が監督の質の上限を決める。この上限は今後の研究で検証し続ける必要がある。

Sources

FAQ

視覚的遷移推論とは何ですか。

現在の画面と行動から、行動後に場面がどう変わるかを推論する能力です。押した物体がどこへ転がるか、積み木を抜くと塔が崩れるかといった問いが例です。WOVENは、空間・身体・物理・時間推論の失敗がこの共通の欠陥に由来すると仮定しています。

WOVENの訓練レシピの要点は何ですか。

留保データで前向きに検証された二つの原則があります。第一に、監督データは、示される行動・シーン・領域ではなく、教える推論操作で選ぶこと。第二に、視覚状態の変化がより大きい事例を優先すること。これにより頑健性が高まります。

この研究の限界で注意すべき点は何ですか。

データは動画事前学習済み生成モデルのロールアウト由来で、その物理的忠実度が監督の質を左右します。改善数値は論文自身が報告した26ベンチマークのうち22件であり、全件ではありません。自社タスクでの再検証が必要です。