Symbal:利用雙階段框架檢測多模態模型生成的系統性圖像-文本錯位
多模態大語言模型(MLLMs)在生成圖像描述時常引入錯誤,導致圖像與文本對錯位。本文聚焦於一類被稱為「系統性錯位」的特定錯誤模式,即模型生成的重複性錯誤與圖像中特定視覺特徵緊密相關。為此,作者提出了Symbal,這是一種利用現成基礎模型的结构化雙階段設定,旨在自動識別並總結系統性錯位。同時,構建了SymbalBench基準測試,包含來自自然和醫療領域的170萬對圖像-文本數據,涵蓋420個標註了系統性錯位的數據集。實驗表明,Symbal在該基準上正確識別了63.8%的數據集中的錯位,性能較基線提升近4倍。此外,在真實世界評估中,Symbal能有效檢測四種MLLM生成的描述中的錯位,成為審計現成圖像描述數據集的有力工具。