主動觀察者測試:多模態大模型在動態視覺感知中的能力缺失
本文針對當前多模態大語言模型(MLLMs)缺乏類似人類主動視覺觀察能力問題,提出名為 ActiveVision 的基準測試。人類視覺是閉環過程,視線會根據中間假設不斷重定向,而非僅依賴單次靜態快照。然而現有視覺-語言基準無法評估此一關鍵能力。ActiveVision 包含 17 個任務,涵蓋三大類別,旨在強制模型進行重複性視覺感知。實驗結果顯示,前沿 MLLMs 在該基準上表現極差:評分最高的 GPT-5.5 僅解決 10.6% 的項目,且在 11 個任務中得分為零;Claude Fable 5 的解決率僅為 3.5%。相比之下,三名人類參與者的平均得分高達 96.1%。即使模型能編寫並運行視覺程式碼,其在真實影像中的可靠性仍嫌不足,且發現程式碼錯誤本身即需主動感知能力。此結果揭示當前模型在閉合感知-推理循環方面的根本缺陷,為未來架構設計與訓練目標提供重要方向。