主动观察者测试:多模态大模型在动态视觉感知中的能力缺失
最新研究提出ActiveVision基准测试,揭示多模态大语言模型在动态视觉感知方面的根本缺陷。人类视觉是闭环过程,视线会根据中间假设不断重定向,而现有模型仅依赖静态快照。实验显示,GPT-5.5等前沿模型在17个任务中解决率仅10.6%,且在11个任务中得分为零,人类参与者得分则高达96.1%。即使模型能编写视觉代码,其在真实图像中的可靠性仍不足,且发现代码错误本身即需主动感知能力。这一结果暴露了当前模型在闭合感知-推理循环方面的根本缺陷,为未来架构设计提供了重要方向。
人类视觉系统并非被动地接收静态图像,而是一个动态的闭环过程。在长期的心理学和认知科学研究中,学者们一直强调"主动观察"在各类认知任务中的核心地位:我们的视线会根据当前的假设不断调整,通过多次采样来构建对世界的理解,而非仅仅依赖单一时刻的快照。然而,随着多模态大语言模型(MLLMs)的快速发展,一个关键的实证问题悬而未决:这些模型是否具备类似的主动观察能力?现有的视觉-语言基准测试大多侧重于静态图像的描述或问答,无法有效衡量模型在动态感知过程中的表现。为了解决这一空白,本研究引入了 ActiveVision 基准测试。该基准旨在将"主动观察"这一抽象概念量化,使其成为可测量的评估指标。ActiveVision 涵盖了 17 个精心设计的任务,分为三大类别。这些任务的核心设计逻辑是迫使模型不能仅靠一次性的静态描述来回答问题,而是必须进行多次、迭代式的视觉感知,模拟人类在复杂环境中通过不断调整视线来获取关键信息的过程。
这一创新使得评估 MLLMs 的动态视觉推理能力成为可能,填补了当前评估体系的重大空白。在技术方法层面,ActiveVision 的任务设计极具挑战性,旨在打破传统 MLLMs 对静态特征的依赖。传统模型通常将输入图像编码为固定的视觉 token 序列,然后进行推理,这种机制本质上是一种"快照"式处理。而 ActiveVision 要求模型在推理过程中具备"假设-验证"的循环能力。具体而言,任务要求模型在信息不足时,能够识别出需要进一步观察的区域,并生成相应的观察动作或查询,从而获取新的视觉信息。这种机制类似于人类在查看模糊地图时不断放大局部细节的过程。为了验证模型是否真正具备这种能力,研究不仅评估了模型的直接推理输出,还考察了模型通过编写和运行视觉代码来辅助感知的能力。然而,技术细节显示,即使模型能够生成代码,其在处理真实世界复杂图像时的代码执行可靠性依然低下。
更关键的是,要发现并纠正代码执行中的错误,模型本身就需要具备高度的主动感知能力,而这正是当前架构所缺失的。这种设计迫使研究者深入思考如何改进模型的内部表征,使其从静态特征提取转向动态感知驱动。实验结果令人震惊,充分揭示了当前顶尖多模态大模型在主动观察能力上的巨大短板。研究团队在 ActiveVision 基准上对多个前沿 MLLMs 进行了全面评估。结果显示,即使是目前性能最强的模型,如 GPT-5.5(在最高暴露推理努力层级),其解决率也仅为 10.6%。更为严峻的是,在 17 个任务中,有 11 个任务的得分直接为零,表明模型完全无法处理需要动态观察的任务。另一款在推理和编程榜单上名列前茅的模型 Claude Fable 5,其解决率也仅为 3.5%,表现同样惨淡。相比之下,三名人类参与者在相同任务上的平均得分高达 96.1%,两者之间存在难以逾越的鸿沟。
这一差距并非偶然,即使当模型被允许编写并运行视觉代码来辅助感知时,性能提升依然微乎其微。因为代码生成的可靠性在真实图像场景中极不稳定,且识别代码错误本身就需要模型具备主动观察的直觉。消融实验进一步证实,这种能力缺失并非源于计算资源的不足,而是源于模型架构和训练目标中对动态感知循环的忽视。这项研究对多模态人工智能的未来发展具有深远的行业意义和潜在影响。首先,它向开源社区和工业界发出明确信号:当前的 MLLMs 虽然在静态图像理解上取得了显著进展,但在模拟人类动态视觉感知方面仍存在根本性缺陷。这提示研究人员不能仅满足于提升静态基准的分数,而应关注模型在动态环境中的鲁棒性。其次,ActiveVision 的发现为后续研究指明了方向,即需要开发新的网络架构和训练目标,以闭合"感知-推理"循环。未来的模型可能需要引入类似强化学习的机制,让模型学会如何通过主动观察来优化其内部假设。对于工业落地而言,这意味着在自动驾驶、机器人导航等需要实时动态感知的场景中,当前模型可能面临严重的安全风险。因此,推动具备主动观察能力的视觉-语言模型发展,不仅是学术上的突破,更是实现通用人工智能(AGI)在复杂物理世界中可靠应用的关键一步。