RP-OPSD:基於推理樞軸引導的在線策略自蒸餾多語言推理遷移方法

本文針對大型語言模型在多語言推理遷移中的痛點,提出了RP-OPSD方法。現有的在線策略自蒸餾(OPSD)雖能提供密集的Token級監督,但未能顯式優先處理對跨語言遷移至關重要的推理信號。作者指出,目標語言推理包含表面文本生成與推理樞軸(Reasoning Pivots,即引導推理進程的關鍵決策)兩部分。RP-OPSD利用帶與不帶英語參考解的老師視圖之間的分布偏移,作為操作代理來引導針對推理樞軸的優先蒸餾和參考錨定。在涵蓋17種語言及多個難度層級的數學推理基準測試中,該方法顯著優於強多語言推理基線及OPSD變體。進一步分析表明,RP-OPSD將優先蒸餾集中在推理控制和狀態更新Token上,同時降低對表面實現Token的權重,有效提升了多語言推理能力。

在多语言大语言模型的研究版图中,如何将从高资源语言(如英语)习得的复杂推理能力有效迁移至低资源或高资源语言,一直是一个极具挑战性且至关重要的课题。尽管在线策略自蒸馏(On-Policy Self-Distillation, OPSD)及其变体通过对学生生成的 rollout 提供密集的 Token 级监督,展现出巨大的潜力,但其核心目标函数往往缺乏对跨语言迁移中关键推理信号的显式优先级排序。传统的蒸馏方法倾向于均匀地优化所有预测概率,这导致模型在生成过程中难以区分哪些部分真正承载了逻辑推导的"骨架",哪些仅仅是语言的"皮肉"。本文深刻洞察到,目标语言的推理过程实际上由两部分组成:一是表面的文本实现,二是推理枢轴(Reasoning Pivots)。推理枢轴是指那些能够推进或重定向推理进程的关键决策点,它们直接塑造了后续的推断路径。然而,现有的蒸馏机制并未针对这些枢轴给予足够的关注,导致模型在跨语言迁移时,往往记住了表面的语言模式,却丢失了核心的推理逻辑。为了解决这一根本性问题,研究团队提出了 RP-OPSD(Reasoning-Pivot-Guided On-Policy Self-Distillation),旨在通过聚焦于推理枢轴,实现更精准、更高效的多语言推理能力迁移,填补了现有方法在推理信号优先级分配上的空白。在技术实现层面,RP-OPSD 的核心创新在于构建了一种基于分布偏移的代理机制,以精准定位并强化推理枢轴。具体而言,该方法通过对比两种教师视图来操作:一种是包含英语参考解的视图,另一种是不包含参考解的视图。

研究假设,当引入英语参考解时,模型在生成推理枢轴(即关键决策点)时的分布会发生显著变化,这种变化反映了模型对正确推理路径的依赖。因此,RP-OPSD 利用这两种视图之间的分布偏移作为操作代理,来引导针对推理枢轴的优先蒸馏和参考锚定。在训练策略上,模型不再对所有 Token 一视同仁,而是动态地调整蒸馏权重。对于那些被识别为推理控制(reasoning-control)和问题条件状态更新(problem-conditioned state-update)的 Token,算法会施加更高的蒸馏压力,强制学生模型模仿教师在关键逻辑节点上的决策分布。相反,对于主要服务于表面语言实现(surface realization)的 Token,如常见的连接词或语气助词,算法则会降低其蒸馏权重。这种差异化的加权机制使得模型能够将有限的优化资源集中在提升逻辑推理能力的"硬骨头"上,从而在保持语言流畅性的同时,显著增强推理的准确性和鲁棒性。这种设计巧妙地利用了英语作为高资源语言的参考信息,通过分布差异提取出通用的推理结构,进而迁移到其他语言中。为了验证 RP-OPSD 的有效性,研究团队在涵盖 17 种不同语言且包含多个难度级别的数学推理基准数据集上进行了广泛的实验。实验结果清晰地表明,RP-OPSD 方法在各项指标上均显著优于当前强大的多语言推理基线模型以及标准的 OPSD 变体。

特别是在处理高难度数学问题时,RP-OPSD 展现出的优势更为明显,证明了其在复杂逻辑推理迁移上的优越性。进一步的深入分析揭示了该方法成功的关键机制:通过可视化或量化分析蒸馏权重的分布,研究发现 RP-OPSD 确实如理论预期那样,将优先蒸馏集中在那些真正控制推理流程和更新问题状态的 Token 上。相比之下,传统方法往往在这些关键节点上权重不足,而在非关键的表面语言 Token 上过度优化。消融实验进一步证实,移除推理枢轴引导机制或改变分布偏移的计算方式,都会导致性能显著下降,这有力地证明了所提机制的必要性和有效性。这些实验结果不仅证实了 RP-OPSD 在提升多语言推理准确率方面的实际效果,也从机制层面解释了为何聚焦推理枢轴能够带来更好的跨语言迁移性能,为后续研究提供了坚实的实证基础。从行业意义和潜在影响来看,RP-OPSD 的提出为多语言大语言模型的推理能力增强提供了一条新的、高效的技术路径。首先,该方法通过减少对表面语言模式的依赖,增强了对通用推理结构的捕捉,这对于提升低资源语言模型的智能水平具有重要意义,有助于缩小不同语言间的 AI 能力差距。其次,RP-OPSD 所采用的基于分布偏移的代理机制,为如何从高资源语言中提取可迁移的推理信号提供了新的视角,可能启发后续研究探索更多基于逻辑结构而非表面形式的迁移方法。对于开源社区而言,代码的公开(https://github.com/NJUNLP/RP-OPSD)将促进相关技术的复现与改进,加速多语言推理研究的进展。在工业落地方面,具备更强多语言推理能力的模型将能更好地服务于全球范围内的复杂任务,如多语言法律分析、跨语言代码调试等,提升 AI 系统的实用性和可靠性。总之,RP-OPSD 不仅在学术上推进了对多语言推理迁移机制的理解,也在应用层面为构建真正全球化、智能化的大语言模型提供了有力的技术支撑,其影响将深远地波及自然语言处理领域的多个子方向。

Sources