UAV-DualCog:基於雙認知視角的 Multimodal 大模型無人機時空推理基準評測

本文針對多模態大語言模型在無人機場景中的能力不足,提出了首個基於雙認知視角的無人機時空推理基準UAV-DualCog。現有基準多聚焦於場景理解或事件識別,缺乏對無人機自身狀態與外部環境聯合推理能力的評估。UAV-DualCog涵蓋圖像與影片任務,要求模型同時進行自狀態與環境狀態推理,並執行超越離散答案預測的空間或時間定位。透過基於語義點雲的自動化數據建構管線,該基準達成了可擴展性,包含多樣場景、數百地標及數千問答樣本。評測顯示,當前模型在自狀態推理、視角變換及精確時空定位上存在顯著瓶頸。此外,研究驗證了該基準對人類可理解性及其作為訓練數據資源的潛力,為提升基於多模態大模型的無人機智能體能力提供了重要方向。

Sources