ByDeWay-V2:无需训练的轻量级框架,破解多模态大模型空间推理幻觉难题
针对多模态大语言模型在机器人和自动驾驶等关键场景中存在的空间理解模糊与幻觉问题,研究提出ByDeWay-V2框架。该方案无需训练,通过引入基于YOLO-World-L的开放词汇检测器,计算物体间几何关系并转化为可读谓词,与深度线索结合注入提示词。实验显示,Qwen2.5-VL在BLINK基准空间子集上F1提升46%,BLIP-Base在VSR上恢复至0.53竞争力水平。该框架在40-token预算下运行,为资源受限环境的实时决策提供了高效且可审计的解决方案。
随着多模态大语言模型(MLLMs)逐渐被部署于机器人控制、具身智能以及安全监控等对决策准确性要求极高的关键管道中,其内部空间判断过程的"黑盒"特性成为了阻碍操作员信任与系统可审计性的主要瓶颈。尽管现有的 MLLMs 展现出强大的通用推理能力,但在处理细粒度的空间理解任务时往往表现不佳,且极易产生物体幻觉,即错误地描述图像中不存在的物体或关系。早期的工作如 ByDeWay 引入了基于分层深度的提示方法(LDP),通过单目深度估计结构化提示词来缓解幻觉,但其采用的粗略深度分层策略难以有效解析位于同一几何平面上的物体之间的精细空间关系,例如投影关系(如"在...左侧"、"在...上方")和拓扑关系(如"在...内部"、"接触")。为了解决这一核心痛点,本研究提出了 ByDeWay-V2 框架,其核心贡献在于将显式的空间关系上下文与深度线索相结合,通过生成人类可读的逻辑谓词,为下游的决策支持提供可审计的证据链,从而在无需重新训练模型的前提下,显著增强了 MLLMs 对复杂场景的空间感知能力。 在技术实现层面,ByDeWay-V2 采用了一种完全无训练的推理增强策略,巧妙地将计算机视觉中的目标检测技术与自然语言处理中的提示工程相结合。框架首先利用开源的开放词汇对象检测器 YOLO-World-L 对输入图像进行物体检测,这一步骤不仅识别了场景中的关键实体,还获取了它们的边界框信息。随后,系统基于这些检测到的物体,计算它们两两之间的几何关系,并将这些关系转化为结构化的空间谓词。例如,系统能够判断物体 A 是否位于物体 B 的左侧,或者物体 C 是否与物体 D 接触。这些生成的谓词与之前通过单目深度估计获得的深度线索被整合在一起,形成包含丰富空间语义的提示词,并直接注入到 MLLM 的输入中。这种设计巧妙地 bridging 了 3D 场景的深度信息与 2D 空间语义,使得模型能够在推理过程中显式地利用这些经过验证的空间约束,从而大幅减少因空间关系误判而导致的幻觉现象,同时保持了极高的计算效率。 为了全面评估 ByDeWay-V2 的有效性,研究团队在 Visual Spatial Reasoning (VSR) 和 BLINK 这两个权威的多模态空间推理基准上进行了广泛的实验,并采用 POPE 指标来评估幻觉定位的准确性。实验结果显示,该方法在不同架构的 MLLMs 上均取得了显著的性能提升。特别是在 BLINK 基准的空间子集上,结合 Qwen2.5-VL 模型时,ByDeWay-V2 相较于之前的 LDP 方法实现了 46% 的相对 F1 分数提升,证明了其在处理复杂空间查询时的优越性。更为引人注目的是,对于在空间推理任务上原本表现较差的 BLIP-Base 模型,ByDeWay-V2 成功将其在 VSR 基准上的表现从接近随机猜测的水平恢复到了具有竞争力的 0.53 F1 分数。消融实验进一步证实,引入显式的空间谓词对于提升同平面物体间的关系识别至关重要,而仅依赖深度线索则无法达到同样的效果,这验证了多维空间信息融合的有效性。 从行业意义与潜在影响来看,ByDeWay-V2 不仅是一个算法改进,更为资源受限环境下的实时决策支持提供了可行的工程范式。该框架最轻量的配置能够在严格的 40-token 上下文预算下运行,且仅需 CPU 资源即可处理,这使其特别适合部署在边缘设备或实时性要求极高的系统中,如自动驾驶汽车的路径规划或工业机器人的抓取操作。通过提供可解释的空间推理依据,ByDeWay-V2 增强了系统输出的透明度,有助于操作员快速理解模型决策逻辑,从而在安全监控等高风险应用中建立更高的信任度。此外,由于其无需训练的特性,该框架可以无缝集成到现有的各种 MLLMs 中,极大地降低了技术落地的门槛,为开源社区和工业界提供了一种低成本、高效率的空间推理增强方案,对推动具身智能和多模态 AI 在关键领域的应用具有深远影响。