OmniCapBench:把音視頻描述評測拆成可驗證的原子單元
OmniCapBench 把音視頻描述評測的預測目標,從自由文字改為原子、可驗證的評估單元集合,覆蓋實體指代、視覺鏡頭、音訊事件三條軌道,含 786 段密集標註視頻。評分用確定性約束檢查加區域性 LLM 語義比較,能區分時間定位失敗、身份漂移、跨模態錯位與幻覺。評測顯示前沿模型區域性感知強,但長程音視頻推理弱。
多模態大語言模型正在從“看一張圖、回答一個問題”,走向持續的音訊與視頻聯合推理。模型要同時聽見聲音、看清畫面,還要把兩者在時間軸上對齊,並在幾十秒甚至幾分鐘裡記住同一個人、同一件物體。能力在變強,評測卻沒有跟上。音視頻描述是檢驗這種能力的理想診斷任務,因為一段好的描述必須同時覆蓋誰在場、畫面如何切換、聲音何時出現。但要把它測準,一直是個難題:描述是自由文字,同一個畫面有無數種合法說法,既難以逐項核對,也難以復現。OmniCapBench 這篇論文針對的正是這個問題,於 2026 年 10 月 8 日釋出在 arXiv,分類為 cs.CV。
作者先指出現有基準陷入一種耦合的取捨。第一類做法是對整段描述打一個總分,它覆蓋面廣,卻說不清錯在哪裡,一個總分裡混著遺漏、幻覺和錯位。第二類做法是設計區域性探針,針對某個具體細節提問,定位清楚,卻只能覆蓋很小一部分內容,換一批探針結論就可能不同。第三個問題來自評分者本身:讓一個不受約束的 LLM 當裁判,它的判斷會隨提示詞、隨長度、隨措辭而波動,穩定性不足。覆蓋、定位、穩定,三者很難同時得到。 OmniCapBench 的核心思路是改變預測目標。它不再把自由文字當作最終產物,而是把評測物件拆成一組原子的、可驗證的評估單元,並按三條軌道組織:實體指代、視覺鏡頭、音訊事件。實體指代檢查模型是否在不同時刻始終指向同一個人或物;視覺鏡頭檢查畫面切換與鏡頭內容;音訊事件檢查聲音的型別與出現時間。評分也分兩層。凡是能硬判定的約束,例如某個事件是否出現、順序是否正確,用確定性檢查完成;確實需要理解語義的部分,則交給區域性的 LLM 比較,把裁判的判斷範圍壓到一個很小的單元內。基準共有 786 段密集標註的視頻,這是它的標註底座。
把評測單元做小,還有一層工程上的好處。自由文字的評分難以復現,是因為同一句話可以有很多種合法寫法,裁判必須在開放空間裡做判斷。原子單元把開放空間切成了許多封閉的小問題:這個人是否在第二個鏡頭裡再次出現,這個爆炸聲是否發生在人物轉身之前。封閉問題可以被規則直接檢查,規則查不了的才進入語義比較,而且比較的物件只是一小段文字,上下文很短,波動自然更小。換一個裁判模型、換一次執行,結果更可能保持一致,這正是一個公共基準最需要的性質。 這種“深度結構化”的設計帶來的最大好處,是錯誤可以歸類。論文稱,它能區分四類 MLLM 感知錯誤:時間定位失敗,即事件發生在哪一刻被說錯;身份漂移,即同一個人在後半段被當成另一個人;跨模態錯位,即聲音和畫面對不上;以及幻覺描述,即寫出視頻里根本沒有的內容。過去這些問題會一起被壓進一個分數,開發者只知道模型“差一點”,卻不知道該改資料、改架構還是改訓練目標。現在每一類錯誤都有對應的單元和軌道,可以單獨追蹤。 對開發者而言,更實際的問題是如何使用這樣的基準。一種做法是把三條軌道的得分分開看,而不是合成一個排名:如果某個模型在視覺鏡頭軌道領先、在實體指代軌道落後,說明它的視覺編碼器不差,問題在跨時間的記憶與繫結;如果音訊事件軌道落後,則可能是音訊編碼或音畫對齊訓練不足。這種分解讓消融實驗有了明確的觀察指標,也讓不同團隊可以圍繞同一套單元復現彼此的結論。 對前沿模型的評測給出了一個有啟發性的畫像:區域性感知很強,長程音視頻推理偏弱。換句話說,模型能認出一個鏡頭裡有什麼、一個瞬間聽到了什麼,但很難在較長的時間跨度裡保持一致。其中身份漂移與跨模態錯位最為突出。這與許多開發者的直覺相符:把長視頻切成片段餵給模型,每一段都答得不錯,拼起來卻前後矛盾。需要說明的是,摘要沒有給出具體分數,各模型的差距有多大、哪一類錯誤佔比最高,需要讀全文才能判斷,此處不做推斷。讀者在引用結論時,也應以論文給出的原始表格為準。
從行業角度看,這類基準的價值在於給出一張“路線圖”。當全模態模型要進入視頻理解、直播輔助、無障礙描述、機器人感知等場景時,長時間的身份一致性和音畫對齊比單幀識別更關鍵。結構化評測讓團隊能夠把有限的研發預算投向最薄弱的環節。當然也要保持審慎:786 段視頻的規模有限,原子單元的拆分方式可能偏向容易列舉的內容,區域性 LLM 比較仍可能帶有殘餘偏差。但把評測從“一個總分”改成“可定位、可複核的單元”,這個方向本身是紮實的,值得評測與模型團隊持續跟進。
Sources
FAQ
OmniCapBench 與以往音視頻描述基準最大的區別是什麼?
它不再對整段自由文字打一個總分,而是把預測目標改成原子、可驗證的評估單元集合,分屬實體指代、視覺鏡頭、音訊事件三條軌道。這樣既保留覆蓋面,又能定位錯誤出在哪裡,同時減少對不受約束的 LLM 裁判的依賴。
這個基準能區分哪些典型錯誤?
論文摘要列出四類:時間定位失敗、身份漂移、跨模態錯位和幻覺描述。前沿模型在區域性感知上表現較強,但在長程音視頻推理上偏弱,身份漂移和跨模態錯位尤其突出。
評分是否完全依賴 LLM 裁判?
不是。評分分兩層:先用確定性的約束檢查處理能硬判定的部分,再用區域性的 LLM 語義比較處理需要理解含義的部分。LLM 只在小範圍內比較,因此穩定性比整段打分更高。