LION:面向多模態歸因圖學習的克利福德代數神經範式

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

針對多模態歸因圖學習(MAG)中現有神經範式的能力瓶頸,本文提出基於克利福德代數與解耦圖神經範式(先傳播、後聚合)的 LION 方法。現有方法在模態對齊階段常採用受拓撲約束或模態特殊性的算子作為分詞器,忽略了圖結構上下文、抑制模態間互動,導致對齊次優;在模態融合階段多為面向雙模態圖的簡單遷移,未能充分複用帶拓撲先驗的對齊 token,泛化差、性能下降。LION 首先建構基於克利福德代數的模態感知幾何流形,透過幾何導高的階圖傳播高效實現模態互動與對齊;隨後針對對齊 token 的拓撲感知克利福德分量,提出自適應全息聚合,將分量級能量與傳播尺度資訊結合可學習參數以提升融合效果。在 9 個文字-图像 MAG 數據集上的大量實驗表明,LION 在 3 類圖任務與 3 類模態任務上均顯著優於當前最佳基線。

随着多模态领域的快速发展,图机器学习正经历一场以数据为中心的范式转变,即从传统的文本归因图(text-attributed graph)转向多模态归因图(multimodal-attributed graph,简称 MAG)。这一转变不仅显著增强了数据的表示能力,还扩展了图下游任务的应用范围,例如面向特定模态的任务,从而提升了图机器学习的实用价值。然而,当前的神经范式仍存在两个关键局限:一是在模态对齐阶段,多数方法采用受拓扑约束或模态特异性的算子作为分词器(tokenizer),这类对齐器不可避免地忽略了图结构上下文、抑制了模态之间的交互,导致对齐效果次优;二是在模态融合阶段,多数方法只是面向双模态图的简单迁移,未能充分复用已配备拓扑先验的对齐 token,从而带来泛化能力不足与性能下降的问题。针对上述问题,本文提出 LION(Clifford Neural paradigm,克利福德神经范式),其核心思想是依托克利福德代数与解耦图神经范式(即先传播、后聚合)来实现模态归因图中的"先对齐、后融合"。

这一设计在理论上为多模态信息的统一表示与高效交互提供了新的几何视角,构成了本文的主要贡献。在技术方法上,LION 首先构建了一个基于克利福德代数的模态感知几何流形。克利福德代数能够为不同模态信息提供统一的代数框架,使得异构的模态特征能够在同一几何结构中被描述与操作。基于这一几何诱导的高阶图传播,模型能够高效地实现模态之间的交互,进而推动模态对齐。

与仅依赖拓扑约束或模态特异性算子的传统方法不同,这种传播方式充分保留了图结构上下文,使模态信息在传播过程中充分交融。在此基础上,针对对齐 token 的拓扑克利福德分量,本文提出自适应全息聚合(adaptive holographic aggregation)模块。该模块将分量级的能量信息与传播尺度信息相结合,并引入可学习参数进行动态调节,从而在融合阶段更充分地利用已对齐且携带拓扑先验的 token 信息。这种"传播-聚合"解耦、再"对齐-融合"串联的流水线设计,使模型在保持拓扑先验的同时实现了更灵活的模态融合,缓解了现有方法泛化能力弱、性能退化的问题。

在实验设置与关键结果方面,本文在 9 个文本-图像多模态归因图(MAG)数据集上进行了大量实验,覆盖了 3 类图任务与 3 类模态任务两类下游评测维度。结果表明,LION 在这两类共 6 类任务上均显著优于当前最优(SOTA)基线模型,验证了其在模态对齐与融合两个环节上的有效性。这一结果说明,通过克利福德代数构建的几何诱导传播与自适应全息聚合,能够有效克服现有方法在上下文利用与模态交互上的不足,从而在多样化的下游任务中保持稳定的性能优势。尽管摘要未给出具体数值指标,但跨多数据集、多任务的一致性提升,反映出该方法在表示质量与泛化能力上的整体改进,为多模态归因图学习提供了更具说服力的实证支撑。

在行业意义与潜在影响方面,本文的贡献在于为多模态归因图学习提供了一个全新的代数与几何视角。克利福德代数将异构模态信息纳入统一的表示框架,使得模态对齐与融合能够在同一套数学语言下被系统地建模,这为后续研究探索更通用的多模态图表示提供了可借鉴的思路。同时,解耦的"传播-聚合"与"对齐-融合"范式具有较强的结构性,有望被推广到更多模态、更复杂的图结构中,从而提升模型在真实场景中的适用性。对于开源社区而言,这一范式为构建多模态图学习基线模型提供了新的参考方向;对于工业落地而言,更强的多模态交互与融合能力有助于在推荐、知识图谱、跨模态检索等任务中提升表示效果。总体而言,本文工作推动了图机器学习向多模态、几何化方向演进,为后续研究在多模态图表示学习领域开辟了新的探索路径。

Sources

FAQ

LION是什么呢?

LION 是 arXiv cs.LG 提出的克利福德神经范式,首次将克利福德代数用于多模态归因图(MAG)的模态对齐与融合,核心思路是“先对齐、后融合”与“先传播、后聚合”。

为什么这项研究重要?

现有方法在模态对齐时忽略图结构上下文、抑制模态交互,融合又只是对双模态图的简单迁移,导致泛化差、性能退化。LION 用几何诱导的高阶传播与自适应全息聚合,在 9 个 MAG 数据集上显著超越 SOTA。

未来值得关注什么?

其解耦结构通用,有望推广到更多模态与更复杂图结构,对推荐、知识图谱、跨模态检索等落地任务有借鉴意义;后续可关注开源实现与更大规模的实证验证。