CORE框架:重排序蒸馏破解多模态嵌入组合推理难题

Published 2026-09-03 · AI Daily — AI-assisted deep research, methodology & disclosure

针对多模态大语言模型嵌入在组合检索中难以区分属性-对象绑定的痛点,研究提出CORE框架。该框架利用共享骨干网络作为交叉注意力重排序器,通过引入Rank-KL目标函数进行知识蒸馏,将细粒度的组合判断迁移至嵌入模型。实验显示,CORE-RERANKER-8B在综合基准上得分82.7%,超越Jina-Reranker 10.7分;CORE-EMBED-8B取得最佳平均分0.666。该方法在显著提升组合推理能力的同时,保持了在COCO等标准数据集上的泛化性能,为多模态检索提供了新范式。

多模态大语言模型(MLLM)在视觉-语言理解领域取得了显著进展,但其嵌入模型在组合推理(Compositional Reasoning)方面仍存在明显短板。所谓组合推理,是指模型能否准确理解图像中对象与其属性之间的特定绑定关系,例如区分"穿红衣服的男人"和"穿蓝衣服的男人",即使两者都包含"男人"和"衣服"这两个概念。传统的嵌入模型往往仅关注全局语义匹配,导致在细粒度的组合检索中表现不佳,无法有效区分场景中的属性-对象绑定差异。然而,研究团队发现,若将相同的MLLM骨干网络用作交叉注意力的重排序器(Reranker),它却能展现出强大的组合判断能力。基于这一洞察,本文提出了CORE框架,旨在将重排序器卓越的组合推理能力蒸馏到计算效率更高的嵌入模型中,从而解决嵌入模型在复杂组合检索中精度不足的核心问题。这一贡献不仅为提升多模态检索的细粒度能力提供了新路径,也揭示了模型架构内部知识迁移的潜在可能性。在技术方法上,CORE框架的核心在于构建一套高效的蒸馏机制。研究团队首先合成了一系列跨越五个不同组合匹配层级的候选列表,这些层级涵盖了从简单概念重叠到复杂属性绑定的各种情况,为模型提供了丰富的监督信号。

接着,他们引入了Rank-KL(Ranking Kullback-Leibler)目标函数,这是一种专门针对排序任务设计的损失函数。通过Rank-KL,嵌入模型被训练去复现重排序器生成的细粒度排序结果,而不仅仅是学习简单的正负样本对比。为了验证不同训练策略的有效性,团队在相同的数据和调优预算下,对比了对比学习(Contrastive Learning)、成对CoSENT损失以及列表式Rank-KL损失。结果显示,对比学习难以充分利用多层级监督信息,而CoSENT和Rank-KL则能更有效地利用这些数据,其中Rank-KL因其对排序分布的精细建模能力,取得了最强的整体性能。这种基于列表式排序的蒸馏策略,使得嵌入模型能够在保持推理速度的同时,获得接近重排序器的组合推理精度。实验部分在三个专门针对组合推理的基准数据集上进行:COLA、SUGARCREPE++和NEGBENCH。这些数据集旨在测试模型在处理复杂语义组合时的能力。结果显示,CORE-RERANKER-8B在这些基准上取得了82.7%的总平均分,比现有的最强重排序器Jina-Reranker高出10.7个百分点,证明了蒸馏前重排序器能力的有效性。

更重要的是,蒸馏后的嵌入模型CORE-EMBED-8B在所有评估的嵌入模型中取得了最佳总平均分0.666。消融实验进一步证实,Rank-KL损失在利用多层级监督方面优于其他方法。此外,研究团队还评估了该方法在MCMR(多模态组合记忆检索)基准上的迁移能力,结果表明改进后的模型在提升组合推理精度的同时,并未牺牲在COCO和Flickr30K等标准通用检索数据集上的性能。这一发现至关重要,因为它证明了CORE框架并非以牺牲通用检索能力为代价来换取组合推理的提升,而是实现了两者性能的协同增强。CORE框架的提出对多模态检索领域具有重要的行业意义和潜在影响。首先,它为开源社区提供了一个高效提升嵌入模型组合推理能力的范式,即通过蒸馏重排序器的细粒度判断来增强嵌入模型的语义理解深度。这对于需要高精度细粒度检索的应用场景,如复杂视觉问答、细粒度图像搜索和基于内容的推荐系统,具有直接的工业落地价值。其次,CORE框架展示了不同模型架构(嵌入模型与重排序器)之间知识迁移的有效性,为后续研究提供了新的思路,即如何利用计算成本较高的模型来指导轻量级模型的性能优化。最后,该研究验证了多层级监督信号在训练多模态嵌入模型中的重要性,提示未来的研究应更加关注数据构造的多样性和监督信号的细粒度,以推动多模态大模型在复杂推理任务中的进一步发展。

Sources

FAQ

CORE框架是什么,它解决了什么问题?

CORE框架通过蒸馏重排序器能力,解决多模态嵌入模型在组合检索中难以区分属性-对象绑定的问题。它将细粒度判断迁移到嵌入模型,提升了准确性。

CORE框架有何重要意义和影响?

CORE显著提升了组合推理能力,同时保持了通用检索性能。这为复杂视觉问答和细粒度图像搜索等应用提供了新范式,具有重要产业价值。

该研究对多模态检索的未来发展意味着什么?

该研究为开源社区提供了提升嵌入模型能力的新范式,并揭示了不同模型架构间知识迁移的潜力。未来研究应关注数据构造多样性和监督信号细粒度。