WOVEN:把視覺世界建模編織進多模態大模型

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WOVEN 是一個面向視覺狀態轉移推理的訓練資料來源與基準,共 36,076 條樣本,覆蓋 20 類場景、5 類動作和 8 類推理操作,素材來自影片預訓練生成模型的 rollout。作者評測 38 個前沿多模態模型,發現最強者也遠低於人類,且缺陷隨規模持續存在。用 WOVEN 訓練後,各約 2,000 條的子集合計改善 26 個外部基準中的 22 個,最高提升 27.3 個百分點,並可替代 30%至50%的任務自有訓練資料。

多模態大語言模型在過去兩年裡,在影象描述、文件理解和視覺問答上進步很快。可是隻要問題涉及空間關係、具身互動、物理規律或時間推移,它們的表現就明顯掉隊。機器人把杯子推向桌邊會發生什麼,積木塔抽走底層一塊之後會怎樣,畫面中的物體下一秒會出現在哪裡,這類問題看上去各不相同,長期被當作彼此獨立的短板,各用各的基準去衡量,各用各的資料去補課。2026年10月8日釋出在 arXiv 的論文 WOVEN(編號 2610.12417,作者包括 Zheyu Fan、Yue Zhang、Mingkai Deng、Kangrui Wang、Qineng Wang 等)提出了一個更簡潔的解釋:這些失敗共享同一個根源,即視覺狀態轉移推理的缺失,也就是模型難以在內部推演“某個動作作用於某個場景之後,畫面會變成什麼樣”。

這個假說的意義不在於命名一個新能力,而在於它改變了問題的組織方式。如果空間、具身、物理和時間推理的失敗確實同源,那麼就不必為每一個下游任務單獨收集昂貴的標註,而可以把視覺轉移推理當作一種共享的訓練原語:不同模型可以從不同的監督來源學到它,再把它複用到不同的任務上。論文的目標正是檢驗這一點,並給出一套系統的訓練配方。作者指出,現有基準只是分別記錄這些缺陷,無法在場景、動作和推理操作之間做受控比較,所以光有評測還不夠,必須有一個按這三個維度組織的資料來源。

WOVEN 就是為此而建。它既是訓練資料來源,也是基準,共包含 36,076 條樣本,覆蓋 20 類場景、5 類動作和 8 類推理操作。素材來自影片預訓練生成模型產生的多樣而逼真的 rollout,也就是讓生成模型根據初始畫面和動作“推演”出後續畫面,再圍繞這些畫面構造問題。這樣的組織方式帶來一個實際好處:研究者可以固定其中兩個維度,單獨改變第三個維度,從而回答“到底是場景、動作,還是推理操作本身決定了遷移效果”這類過去很難回答的問題。把變數拆乾淨,是這篇論文方法論上最值得學習的地方。

評測結果顯示出系統性的缺陷。作者測試了 38 個前沿多模態模型,其中包括 GPT-5.4 和 Qwen3-VL-235B-A22B。結論有三層:缺陷顯著,即使最強的模型也遠低於人類;缺陷系統,同樣的失敗在不同模型家族中反覆出現;缺陷頑固,它們隨模型規模增大仍然存在。最後一點尤其重要,因為它說明單靠堆引數、堆通用資料,並不會自然長出對視覺狀態變化的推演能力。這與近年來不少關於物理常識、空間推理的評測結論相互印證,也為“需要專門的監督訊號”提供了證據。

訓練實驗則給出了更有價值的正面結果。作者在多個規模的多模態模型上用 WOVEN 訓練,發現模型學到的是一種可廣泛遷移的共享能力:每個約 2,000 條的訓練子集,合計讓 26 個外部基準中的 22 個得到提升,最高提升 27.3 個百分點。另一個對工程團隊更實用的數字是,WOVEN 資料可以替代某個任務 30%至50%的自有訓練資料,而精度相當。換句話說,對於標註昂貴的具身或空間任務,一部分監督可以由這種通用的轉移推理資料來承擔。需要提醒的是,這些數字是論文自行報告的,26 個基準中也有 4 個沒有受益,落地前仍應在自己的任務上覆測。從更大的圖景看,這項工作觸及了當前多模態研究的一個結構性問題。過去的基準多半隻回答“模型對不對”,卻很少回答“模型為什麼不對”,所以每發現一個新短板,社群就新做一個基準、新攢一批資料,結果是評測越來越多,能力的提升卻零散而不可複用。WOVEN 的做法是先按場景、動作和推理操作三個維度把監督拆開,再用受控實驗觀察哪一個維度真正承載了遷移,這使得“資料為什麼有效”第一次有了可檢驗的答案。對於正在構建具身智慧體、圖形介面代理和機器人規劃系統的團隊,這條思路尤其有用:這些系統的核心都是預測行動的後果,如果底層的多模態模型連簡單的狀態變化都推不對,上層的規劃和決策就缺少可靠的地基。因此,把轉移推理單獨拎出來訓練和度量,既是研究方法的改進,也是工程上降低試錯成本的辦法。

最後是論文提煉出的訓練配方,它經過在留出基準上的前瞻性驗證。第一條是按樣本所教授的推理操作來選擇監督,而不是按它所展示的動作、場景或領域來選擇。這與直覺相反:許多團隊習慣“想提升機器人任務,就找機器人場景的資料”,而 WOVEN 提示,真正決定遷移的是樣本訓練了哪一種推理操作。第二條是優先選擇視覺狀態變化更大的樣本,因為這樣得到的能力更穩健。對行業而言,這意味著資料策劃的單位應從“領域”轉向“推理操作”,也意味著世界模型的訓練未必只能依賴影片生成,讓多模態語言模型直接學會轉移推理是另一條值得投入的路線。當然,資料來自生成模型的 rollout,其物理保真度會限制監督的上限,這一點需要後續工作持續檢驗。

Sources

FAQ

什麼是視覺狀態轉移推理?

它指模型根據當前畫面和一個動作,推斷動作之後場景會變成什麼樣的能力。例如推一個物體會滾到哪裡,抽走積木後塔會不會倒。WOVEN 假設空間、具身、物理和時間推理的失敗都來自這一項共同缺陷。

WOVEN 的訓練配方有哪些要點?

論文給出兩條經前瞻性驗證的原則。第一,按樣本所教的推理操作來挑選監督資料,而不是按它展示的動作、場景或領域來挑。第二,優先選擇視覺狀態變化更大的樣本,這樣得到的能力更穩健。

這項研究有哪些需要留意的邊界?

摘要顯示資料來自影片預訓練生成模型的 rollout,其物理保真度會限制監督質量。提升數字來自論文自報的 26 個外部基準,並非所有基準都受益。實際部署前仍需在自己的任務上覆測。