Symbal:利用雙階段基礎模型檢測多模態生成中的系統性錯位

多模態大語言模型(MLLMs)在生成圖像描述時,常因視覺特徵與文本描述的關聯錯誤而產生系統性錯位。本文提出Symbal,一種基於現成基礎模型的雙階段框架,旨在自動檢測並總結此類錯誤。同時,作者構建了SymbalBench基準,包含170萬對自然與醫療領域的圖像-文本數據,涵蓋420個帶標註的數據集。實驗顯示,Symbal在基準上正確識別了63.8%的數據集中的錯位問題,性能接近基線方法的四倍。此外,在真實世界評估中,Symbal能有效審計四種不同MLLM生成的描述,並作為強大工具用於審查現成的圖像描述數據集,無需訪問底層模型即可發現關鍵錯誤,為多模態數據質量控制提供了新範式。

Sources