LEGO:免抬升的第三人稱到第一人稱影片生成,讓合成器管結構、擴散模型管細節
LEGO(arXiv 2610.12442,2026-10-08)針對從單個第三人稱影片生成第一人稱影片的難題,放棄“估計深度、抬升為點雲、再重投影”的顯式管線,改用微調後的 LVSM 風格 Transformer 直接渲染第一人稱視角,由學習到的對應分佈完成跨視角匹配。其機率式對映保留結構、平均掉細紋理,恰好交給擅長恢復細節的影片擴散模型;分佈的集中度還被用作區域置信度,既遮罩低置信區域,也在早期去噪步驟中引導佈局。論文稱其穩定優於當前最先進的顯式管線,且無需重訓即可遷移到其他資料集。
從單個第三人稱(外中心)錄影生成第一人稱(自我中心)影片,是新視角合成裡最棘手的情形之一。原因很直接:兩臺相機幾乎沒有重疊,目標視角里的大部分內容在輸入裡從未出現過。可這件事的價值很大。機器人模仿學習需要“手眼視角”的示範,AR/VR 和技能教學需要第一人稱素材,而大規模採集第一人稱資料既昂貴又麻煩,第三人稱影片卻隨處可得。2026 年 10 月 8 日,Suhwan Cho 等人在 arXiv 釋出了 LEGO(編號 2610.12442,cs.CV),給出了一條不同於主流的路線。 先看現有的最強方法怎麼做。按論文摘要的描述,當前最先進的方法走的是顯式重建:估計深度,把影片抬升成點雲,再從第一人稱相機的位置重新渲染,然後把渲染結果當作條件交給影片擴散模型。這是一個確定性對映,每個畫素只會被投到唯一的一個位置。好處是紋理被保留得很好,壞處同樣明顯:深度估計只要有誤差,錯誤就會原樣變成錯位的內容。在兩臺相機重疊極少的設定裡,深度誤差幾乎不可避免,這條管線的上限因此被幾何估計的質量卡住。更麻煩的是,這種錯誤是“自信”的:點雲裡的每個點都帶著同樣的確定性,下游的擴散模型無從分辨哪些位置可信,只能照單全收,於是錯位的物體、拉伸的表面和空洞會被當作事實繼續生成。這也是顯式管線在跨視角差異極大的場景裡容易翻車的原因。
LEGO 換了一個問法:影片擴散模型到底應該收到什麼樣的條件?它的回答是“免抬升”。作者微調了一個 LVSM 風格的 Transformer,稱為學習式視角合成器,讓它直接渲染第一人稱視角,全程不使用深度、點雲或重投影,跨視角的對應關係由網路內部自己解決。與顯式管線的確定性對映相對,這裡是機率式對映:對每個區域,合成器按照學到的對應分佈,在多個候選源位置上做加權平均。結構因此被保留下來,而精細紋理在平均中被磨掉。畫面會比重投影的結果更“糊”,但位置大體是對的。可以把它理解為一種“帶不確定性的粗草圖”:它不假裝知道每個畫素的精確來源,只表達“這裡大機率來自源影片的哪幾個位置”。對一個後續還要被擴散模型重寫的條件來說,這種誠實的模糊,比一個精確卻可能錯誤的點更有用。
作者沒有迴避這個代價,而是把它變成設計依據。他們的論點是:這種取捨恰好適合擴散生成器。去噪訓練最擅長的事情就是恢復細節,所以一個有效的條件應當優先保證結構對齊,而不是追求銳度。換句話說,條件訊號的任務是告訴生成器“東西在哪裡、整體長什麼樣”,至於毛髮、紋路這類細節,交給擴散模型自己補。摘要裡的最後一句話概括了這個分工:合成器提供視角結構,擴散模型提供細節。這個思路和不少“粗到細”的系統很像,但它把粗的那一層從手工幾何管線換成了端到端學出來的模組。這樣做的另一個好處是責任劃分清楚:結構錯了,問題出在合成器;紋理不好,問題出在擴散模型。兩部分可以分別訓練、分別評估,也可以各自替換為更強的骨幹網路,而不必重做整條几何管線。 LEGO 還額外利用了分佈本身的資訊。對應分佈越集中,說明合成器對這個區域越有把握;越分散,說明候選位置很多、結果越不可靠。論文把這種集中度轉成每個區域的置信度,並用在兩個地方。其一是遮罩低置信區域,避免把不可靠的條件硬塞給生成器。其二是在去噪早期、也就是佈局形成的那些步驟裡,引導生成器偏向高置信區域,讓整體構圖先穩住,再去處理其餘部分。這是一種很自然的做法:不確定的地方少聽條件的,確定的地方多聽條件的。 就結果而言,摘要稱 LEGO 穩定優於當前最先進的顯式管線,並且無需重新訓練就能泛化到其他資料集。需要說明的是,摘要沒有給出具體的指標數值,所以“優多少”要等讀完全文的實驗部分才能判斷。另外有兩點值得保持清醒。第一,被遮擋或從未被觀察到的區域,最終仍然要靠生成來“想象”,置信度機制只能讓系統更誠實地區分哪裡可信,不能憑空變出真實資訊。第二,跨資料集泛化的範圍取決於論文測試了哪些資料集,這一點需要核對原文。即便如此,LEGO 的價值不只在這一個任務上:它提出了“條件應該為生成器的強項量身定做”的設計原則,對其他以幾何條件驅動擴散模型的任務,例如影片編輯、單目重渲染和機器人世界模型,都有可借鑑之處。最後值得一提的是工程上的含義。免抬升意味著推理時不再依賴獨立的深度估計器和點雲渲染器,系統元件更少,失敗點也更少;代價是需要一個足夠強的視角合成器,其能力取決於訓練資料的規模與多樣性。對想把第三人稱監控或教學影片轉成第一人稱示範資料的團隊來說,這是一條值得跟蹤的路線。至於是否真能降低總體成本,還要看合成器與擴散模型兩部分的實際算力開銷,摘要對此沒有說明。
Sources
FAQ
LEGO 的“免抬升”具體指什麼?
指不再估計深度、不再把影片抬升成點雲、也不再做重投影。LEGO 微調一個 LVSM 風格的 Transformer,直接輸出第一人稱視角畫面,跨視角的對應關係由網路內部解決,再把這個結果作為影片擴散模型的條件。
為什麼“模糊”的條件反而對擴散模型更好?
論文的論點是,擴散模型的去噪訓練本來就擅長恢復細節,所以條件最該提供的是結構對齊,而不是銳度。機率式對映把每個區域在候選源位置上取平均,結構得以保留,細紋理被抹平,正好由擴散模型補回。顯式管線的確定性對映保留了紋理,卻會把深度誤差變成錯位的內容。
區域置信度是怎麼得到的,又用來做什麼?
合成器為每個區域學到一個對應分佈,分佈越集中,說明該區域越確定。論文把這種集中度當作置信度,有兩個用途:一是遮罩低置信區域,二是在早期、負責形成佈局的去噪步驟裡,引導生成器偏向高置信區域。