CHARM:打破多模态图零样本迁移瓶颈的层级上下文建模新范式
针对现有图神经网络依赖下游微调及大语言模型局限于单模态的痛点,研究团队提出CHARM,一种专为多模态图设计的零样本迁移基础模型。CHARM通过层级上下文建模,将孤立节点转化为捕获多模态语义与跨模态关系的图令牌,有效解决跨模态泛化与领域特定结构纠缠问题。该方法利用模态感知编码器将信息映射至共享高层概念,显著降低对目标域监督数据的依赖。实验证实,CHARM在零样本多模态图任务中实现持续性能提升,为复杂实体关系建模提供了无需大量标注数据的新范式,推动了图基础模型向通用化、零样本化方向演进。
在图基础模型快速发展的背景下,如何将知识有效迁移至不同图领域及任务成为关键问题。现实世界中的图数据往往包含文本、图像等多种模态,使得多模态图成为表示复杂实体与关系的必要手段。然而,为每个新图领域收集标签并适配模型成本高昂且往往不可行,这促使零样本迁移成为研究热点。尽管图基础模型展现出巨大潜力,但多模态图上的零样本迁移仍处于探索阶段。现有的基于图神经网络的模型通常需要在下游进行适配,而基于大语言模型的方法主要关注单模态图或单一域内的任务。
这种现状带来了两大核心挑战:一是模型需在捕获可迁移跨模态关系的同时,从个体模态中泛化知识;二是若无目标域微调,节点表示易受领域特定结构与模态特定特征纠缠,导致未见领域中的共享概念模糊不清。为此,本文提出CHARM,一种具有分层上下文建模能力的多模态图基础模型,旨在通过消除对目标域微调的依赖,实现高效的零样本迁移,解决上述泛化与表示纠缠问题。CHARM的核心创新在于其分层上下文建模机制,该机制彻底改变了传统孤立节点的处理方式。模型不再直接使用原始节点,而是构建分层图上下文,以捕获丰富的多模态语义及跨模态关系。这种分层结构能够将领域特定的节点模式映射到共享的高层概念上,从而有效降低对目标域监督信号的依赖。
具体而言,CHARM设计了一种模态感知的图上下文编码器,该编码器能够深度融合多模态信息与图结构特征。通过这一编码器,模型将处理后的表示转化为图令牌,这些图令牌随后被输入到大语言模型中进行推理。这种设计不仅保留了图结构的拓扑信息,还充分利用了多模态数据的语义互补性,使得模型能够在没有目标域数据的情况下,依然保持对复杂图模式的敏锐感知。通过这种层级化的抽象与转换,CHARM实现了从底层模态特征到高层语义概念的平滑过渡,增强了模型的泛化能力。在实验评估方面,研究者在多个零样本多模态图任务基准上对CHARM进行了全面测试。
实验结果显示,CHARM在这些任务上均实现了持续且显著的性能提升,验证了其在零样本设置下的有效性。通过对比基线模型,研究进一步揭示了分层上下文建模在减少领域特定偏差方面的关键作用。消融实验表明,移除多模态信息或简化上下文层级会导致性能下降,证明了各组件的必要性。此外,模型在不同规模和数据分布的图数据上均表现出良好的鲁棒性。这些结果不仅证实了CHARM在零样本迁移任务上的优越性,也展示了其在处理复杂多模态图数据时的潜力。
关键指标的提升主要集中在分类准确率与关系预测精度上,特别是在未见过的领域和模态组合中,CHARM的表现优于传统适配方法,证明了其无需微调即可泛化的能力。CHARM的提出对开源社区、工业落地及后续研究具有深远意义。在开源社区,该模型为多模态图基础模型的研究提供了新的技术路线,鼓励开发者探索无需大量标注数据的迁移学习方案。在工业落地方面,由于零样本迁移降低了对特定领域标注数据的依赖,CHARM有望在医疗、金融等数据获取成本高、领域差异大的场景中发挥重要作用,加速图人工智能技术的实际应用。对于后续研究,本文揭示的跨模态关系捕获与分层抽象机制为构建更通用的图基础模型提供了重要启示。未来工作可进一步探索更复杂的模态融合策略及更大规模的预训练数据,以推动图人工智能向更广泛的零样本应用场景拓展,实现真正的通用图智能。