LEGO:リフティング不要の外部視点から一人称視点への動画生成、構造は合成器、細部は拡散モデルが担う
2026年10月8日公開のLEGO(arXiv 2610.12442)は、深度推定や点群を使わずに三人称動画から一人称動画を生成する。LVSM型Transformerが構造を直接レンダリングし、拡散モデルが細部を復元する。対応の信頼度でマスクと初期のノイズ除去を誘導し、再学習なしで他データセットにも一般化するという。
単一の三人称(外部視点)映像から一人称(エゴセントリック)映像を生成する課題は、新規視点合成の中でも特に難しい部類に入る。二つのカメラはほとんど重なりを持たず、目標視点の大部分が入力にまったく現れないからだ。それでも価値は大きい。ロボットの模倣学習には行為者自身の視点からの実演が必要であり、ARやVR、技能指導にも一人称の映像が求められる。しかし一人称データを大規模に集めるのは費用も手間もかかる一方、三人称の映像はどこにでもある。2026年10月8日、Suhwan Cho氏らはLEGO(arXiv 2610.12442、cs.CV)を公開し、主流とは異なる道筋を示した。 まず既存の最先端手法を確認しておく。論文の要旨によれば、現在の最良の手法はシーンを明示的に再構成する。深度を推定し、動画を点群へリフティングし、一人称カメラから再レンダリングして、その結果を動画拡散モデルの条件として渡す。これは決定論的な写像であり、各ピクセルはただ一つの再投影位置に割り当てられる。長所はテクスチャがよく保たれることだ。短所も明確で、深度の誤差がそのまま位置のずれた内容として条件に現れる。二つのカメラの重なりが小さい設定では深度誤差は避けがたく、パイプライン全体の品質が幾何推定の品質に縛られてしまう。 LEGOは問いを変える。動画拡散モデルは、条件として何を受け取るべきか。その答えが「リフティング不要」である。著者らはLVSM型のTransformerを微調整し、学習型の視点合成器として一人称視点を直接レンダリングさせる。深度も点群も再投影も使わず、視点間の対応づけはネットワークの内部で解決される。明示的手法の決定論的写像に対して、こちらは確率的な写像だ。合成器は各領域について、学習された対応分布に従って複数の候補位置にわたる平均を取る。その結果、構造は保たれ、細かなテクスチャは平均化によって失われる。再投影より柔らかい画像になるが、内容はおおむね正しい位置にある。
著者らはこの代償を隠さず、むしろ設計の根拠に転じている。主張は、このトレードオフは拡散生成器に向いているというものだ。拡散モデルのノイズ除去学習は細部の復元に優れる。したがって有効な条件は、鮮明さよりも構造の整合を優先すべきである。条件は「何がどこにあるか」「全体がどう見えるか」を伝え、毛並みや質感といった細部は生成器が自力で補えばよい。要旨の最後の一文がこの分担を要約している。合成器は視点の構造を供給し、拡散モデルは細部を供給する。粗い段階から細かい段階へ進む系統は他にもあるが、ここでは粗い段階が手作業の幾何パイプラインではなく、課題向けにエンドツーエンドで学習されたモジュールになっている点が新しい。 LEGOは分布そのものからも情報を引き出す。対応分布が集中していれば、合成器はその領域の出どころに確信を持っている。分散していれば候補が競合しており、結果は信頼しにくい。論文はこの集中度を領域ごとの信頼度に変換し、二つの場面で使う。一つは低信頼領域のマスクで、不確かな条件を生成器に押しつけない。もう一つは、全体のレイアウトが決まる初期のノイズ除去ステップで、生成器を高信頼領域へ誘導することだ。確かな部分から構図が固まり、残りがそれに続く。条件が確かなところでは強く従い、不確かなところでは弱く従うという、自然な考え方である。 結果について、要旨はLEGOが最先端の明示的パイプラインを一貫して上回り、再学習なしで他のデータセットにも一般化すると述べる。ただし要旨には具体的な指標値がなく、改善幅は本文の実験を読まなければ判断できない。また二点に注意したい。第一に、遮蔽された領域や一度も観測されなかった領域は、最終的には生成器が想像で補うしかない。信頼度はどこまで信用できるかを正直に区別する助けにはなるが、入力にない情報を生み出すわけではない。第二に、データセット間の一般化がどこまで及ぶかは、著者らが試したデータセットに依存するため、原文での確認が必要だ。
それでもLEGOの意義は、この一つの課題にとどまらない。生成器の得意分野に合わせて条件を設計するという原則は、他の研究にも転用できる。動画編集、単眼からの再レンダリング、ロボットの世界モデルなど、幾何的な条件で拡散モデルを駆動する課題は、正確だが脆い幾何と、柔らかいが頑健な構造との間の緊張を共有している。実務者への教訓は具体的だ。上流の推定器が自信を持って誤るためにパイプラインが破綻するなら、硬い写像を確率的な写像に置き換え、不確かさを保持したまま、細部を拡散モデルに任せることを検討するとよい。LEGOは、動画における最も制約の少ない視点合成問題の一つで、この置き換えが機能しうることを示している。
Sources
FAQ
LEGOの「リフティング不要」とは何を指しますか。
深度の推定、点群の構築、再投影を行わないという意味です。LVSM型Transformerを微調整して一人称視点を直接レンダリングし、視点間の対応づけはネットワーク内部で解決します。その出力が動画拡散モデルの条件になります。
ぼやけた条件がなぜ拡散モデルに有利なのですか。
著者らは、拡散モデルのノイズ除去学習は細部の復元に優れるため、条件は鮮明さよりも構造の整合を優先すべきだと述べています。確率的な対応づけは候補位置にわたって各領域を平均化し、構造を保ちつつ細かなテクスチャを失います。明示的手法はテクスチャを保ちますが、深度誤差が内容の位置ずれになります。
領域ごとの信頼度はどう求め、何に使うのですか。
合成器は各領域について対応分布を学習し、その分布が集中しているほど確信が高いと見なします。論文はこの集中度を信頼度とし、低信頼領域のマスクと、レイアウトが決まる初期のノイズ除去ステップで生成器を高信頼領域へ誘導する用途に使います。