SCoRE 视觉 RAG:显式上下文选择与证据整合的智能体方法
视觉检索增强生成(VRAG)面临证据稀疏与组织混乱的难题,现有智能体方法多依赖原始探索轨迹或压缩文本记忆,缺乏显式图像证据支撑,导致答案易受噪声干扰。SCoRE 提出统一智能体循环,在探索阶段仅保留查询相关观察及来源指针,写入文本账本以维持有界视觉上下文,终止时重新加载原始图像并整合为有序证据,实现推理与探索的解耦。训练结合冷启动轨迹蒸馏与证据感知强化学习,奖励函数兼顾证据覆盖、整合紧凑性与答案正确性。该方法为多模态文档理解提供了更可靠的证据推理范式,有望提升企业知识库问答、学术文献分析等场景的准确性与可解释性。
这篇论文聚焦视觉检索增强生成这一前沿方向所遇到的真实瓶颈。VRAG 让模型能够浏览图像丰富的文档,通过检索相关页面图像作为视觉证据,再对其内容进行推理以回答用户查询。尽管该范式在文档问答、图表理解等场景中潜力巨大,但作者指出,如何有效利用检索到的视觉证据,长期受到两个核心挑战的制约。其一,与答案真正相关的证据往往非常稀疏,它可能只集中在某一页的局部小区域,也可能横跨多个页面零散分布,给检索与定位带来困难。
其二,现有智能体方法多依赖原始探索轨迹或压缩后的文本记忆来作答,而非基于一套显式组织、可追溯的支撑图像集合,这使得答案容易受到探索过程中产生的噪声干扰,也让本应清晰的证据支撑推理链变得模糊。作者由此提出一个关键判断:真正的瓶颈并不只在于能否发现证据,更在于答案生成之前能否妥善保存并有序组织这些证据。基于这一洞察,论文的核心贡献是提出 SCoRE,一个将显式证据选择与整合统一起来的智能体循环框架,试图从机制层面同时解决证据稀疏与证据组织缺失的双重难题。这一思路把研究重心从单纯的检索命中,推进到证据的保留、结构化与可追溯利用,为视觉问答提供了新的设计视角。
在技术方法上,Sc 采用一个贯穿探索与回答两阶段的统一智能体循环。在探索阶段,模型对文档进行浏览与检索,但并不会把全部原始观察直接送入最终推理,而是只将与查询相关的观察及其来源指针保留下来,写入一个持续维护的文本账本。这种做法一方面保留了早期发现的关键证据,另一方面将视觉上下文严格控制在有界范围内,避免因页面过多而导致上下文爆炸。当探索终止、进入回答阶段时,系统会依据账本中记录的指针,重新加载所引用的原始图像,并对这些视觉证据进行整合,将其排列成一个符合逻辑顺序的证据集合,再据此生成最终答案。
这一设计实现了两个重要解耦:最终推理与探索阶段的试错过程被分离开来,使答案不再受探索噪声的直接污染;同时,通过索引化的"论据—图像"链接,每一个结论都能回溯到对应的原始图像,从而保证了严格的视觉接地。在训练策略上,论文提出一种端到端优化统一 roll-out 的范式,将过滤后的冷启动轨迹蒸馏与证据感知强化学习相结合。冷启动阶段先提供具有一定质量的基础轨迹,再经过过滤剔除低效或错误样本,为后续学习提供可靠起点;强化学习则通过专门设计的奖励函数,同时推动三个目标,即证据覆盖的充分性、整合后证据的紧凑性,以及最终答案的正确性,从而引导智能体在探索与整合之间取得平衡。在实验设置与关键结果方面,论文围绕视觉问答这一核心任务展开评估,在相关数据集与基准上检验 Sc 的整体表现与各项设计的有效性。
研究关注的指标既包括答案层面的正确率,也涉及证据层面的覆盖度与整合质量,用以衡量模型是否真正找到了相关证据、能否将其紧凑组织、以及最终答案是否可靠。消融实验重点验证了几个关键环节的作用:文本账本机制是否能在控制视觉上下文的同时保留关键证据、证据重新加载与整合是否提升了答案的视觉接地程度、以及奖励函数中证据覆盖、紧凑性与正确性三项目标各自带来的贡献。实验结果表明,通过显式选择与整合,模型在稀疏证据场景下仍能保持稳定的答案质量,探索噪声对最终结论的干扰被显著削弱,证据支撑的推理链也变得更加清晰可追溯,从而验证了所提框架在证据利用效率与推理可靠性上的双重优势。在行业意义与潜在影响方面,这项工作为视觉检索增强生成提供了一套可复用的设计范式。其价值首先体现在把研究焦点从"能否检索到证据"扩展到"能否保存、组织并追溯证据",这一转变对处理图像丰富、内容庞大的真实文档极具现实意义。文本账本加索引式论据—图像链接的组合,既控制了上下文成本,又保证了结论的可解释性与可核查性,非常适合企业级文档智能、合同审查、技术手册问答等对可信度要求较高的落地场景。同时,蒸馏与证据感知强化学习相结合的训练范式,为智能体类模型的端到端优化提供了可借鉴路径,有助于降低训练难度并提升稳定性。对开源社区而言,这套统一智能体循环与证据整合思路,也为后续在视觉推理、多模态智能体以及长文档理解等方向的研究提供了新的参考基线与改进空间。
Sources
FAQ
SCoRE 是什么?
SCoRE 是一种面向视觉检索增强生成的统一智能体循环:探索时只将与查询相关的观察和来源指针记入文本账本,结束时重新加载原始图像,整合为有序证据后再作答。
SCoRE 解决了什么问题?
它应对视觉证据稀疏、分散的难题,通过文本账本把视觉上下文控制在有界范围内,将最终推理与探索噪声解耦,并用原始图像锚定结论,提升答案准确性与可解释性。
SCoRE 值得关注的应用方向有哪些?
值得关注企业知识库问答、合同审查、技术手册等场景的落地,以及蒸馏与证据感知强化学习训练范式对多模态智能体与长文档推理研究的开源参考价值。