Sequential Beats Joint: 論策略蒸餾與強化學習驗證的交互機制

Published 2026-09-03 · AI Daily — AI-assisted deep research, methodology & disclosure

本文深入探討了後訓練階段推理大語言模型中,在線策略蒸餾(OPD)與可驗證獎勵強化學習(RLVR)的相互作用機制。現有研究通常將兩者融合為單步聯合優化,通過加權組合或教師調制縮放來互補稀疏獎勵與密集監督。然而,本研究通過系統性實驗發現,簡單的兩階段方案「先OPD後RLVR」在邏輯與數學推理基準上,持續優於純OPD、純RLVR及所有聯合基線方法。理論分析表明,OPD負責擴展學生模型對教師支持解的覆蓋範圍,而RLVR則在該範圍內進行精細化 sharpening,聯合優化反而導致信號干擾。研究進一步指出,OPD驗證分數是切換至RL階段的關鍵信號,且OPD比監督微調(SFT)更適合作為RL的冷啟動。這一發現為結合兩種方法提供了簡單且高效的實踐指南。

在大语言模型的后训练阶段,如何有效提升模型的复杂推理能力是当前人工智能领域的核心挑战之一。随着可验证奖励强化学习(RLVR)和在线策略蒸馏(OPD)的兴起,这两种方法成为了提升模型推理性能的主流技术路径。然而,现有的研究大多倾向于将这两种信号融合在单一的优化步骤中,试图通过加权组合或教师调制缩放的方式,利用OPD的密集token级监督来弥补RLVR稀疏奖励的不足。本文的研究问题直指这一主流范式的潜在缺陷,即联合优化是否真的能产生协同效应。作者提出并验证了一个看似简单却极具颠覆性的核心贡献:采用"先OPD后RLVR"的两阶段串行方案,而非传统的联合并行方案。这一方案不仅在多个逻辑和数学推理基准测试中取得了超越纯OPD、纯RLVR以及所有现有联合基线的优异表现,更重要的是,它从理论层面揭示了两种方法交互的本质机制,挑战了"信号融合优于分阶段处理"的固有认知,为推理模型的训练提供了新的范式视角。

在技术方法层面,本文并未提出复杂的新型网络结构,而是通过严谨的控制变量实验和深入的学习动力学分析,解构了OPD与RLVR的内部运作机制。研究指出,OPD的核心作用在于通过教师模型的密集监督,快速扩展学生模型对正确解空间的覆盖范围,即"广度探索";而RLVR则通过可验证的奖励信号,在已有的解空间内进行策略的精细化调整,即"深度优化"。当两者在单步中联合优化时,密集的梯度更新与稀疏的奖励信号会产生严重的干扰,导致模型难以收敛到最优策略。相比之下,两阶段方案首先利用OPD建立一个高质量的策略基础,此时模型已经掌握了大量教师支持的解题路径;随后引入RLVR,利用验证奖励对这些路径进行筛选和强化,从而避免信号冲突。此外,研究还发现OPD作为RL阶段的冷启动策略,其效果显著优于传统的监督微调(SFT),因为OPD生成的策略分布更贴近推理任务所需的探索性分布,为后续的强化学习提供了更优的初始状态。实验设置涵盖了多个主流的数学推理和逻辑推理基准数据集,确保了结果的广泛适用性。

关键结果显示,OPD-then-RL方案在各项指标上均显著领先,不仅在最终准确率上超越基线,其学习曲线的稳定性也更高。消融实验进一步证实了阶段切换时机的重要性:研究通过监控OPD阶段的验证分数,发现当验证分数达到特定阈值时,模型已具备足够的解空间覆盖,此时切换至RLVR能获得最佳增益。反之,若过早或过晚切换,性能均会下降。此外,通过分析pass@k行为,作者观察到OPD阶段显著提升了模型生成有效解的概率,而RLVR阶段则提高了这些有效解的置信度和一致性。参数更新轨迹的分析也显示,联合优化导致梯度方向频繁震荡,而两阶段方案则呈现出清晰的阶段性收敛特征,前者迅速扩大解空间,后者稳步提升策略质量。这些发现共同构建了一个自洽的解释框架,证明了分阶段处理在信号解耦上的优势。

这一研究成果对开源社区、工业落地及后续研究具有深远的意义。对于工业界而言,OPD-then-RL提供了一种简单、高效且易于实现的推理模型训练配方,无需复杂的联合优化器设计,即可显著提升模型性能,降低了工程落地的复杂度。对于开源社区,这一发现促使研究者重新审视现有后训练方法的有效性,可能引发对联合优化范式的广泛反思与改进。在后续研究方面,本文提出的通过验证分数判断阶段切换时机的机制,为自动化训练流程的设计提供了新的思路。此外,研究揭示的"覆盖-锐化"互补机制,也为探索其他多信号融合策略提供了理论指导,未来研究可在此基础上探索更细粒度的阶段划分或动态切换策略,以进一步挖掘推理大语言模型的潜力。总之,本文不仅提供了一个强大的训练方案,更深化了我们对多信号学习交互机制的理解。

Sources

FAQ

这项研究主要发现了什么?

最新研究发现,在大语言模型后训练中,先用在线策略蒸馏(OPD)再用可验证奖励强化学习(RLVR)的两阶段方法,在逻辑和数学推理任务上优于联合优化。OPD扩展解空间,RLVR精细化。

为什么这种两阶段方法比联合优化更有效?

理论分析表明,联合优化时OPD的密集梯度与RLVR的稀疏奖励会产生信号干扰,导致难以收敛。分阶段处理避免了这种冲突,OPD先建立高质量策略基础,RLVR再进行精细筛选和强化。

这项发现对未来的AI模型训练有何启示?

研究提供了一种简单高效的推理模型训练新范式,降低了工程复杂度。它促使研究者重新审视现有联合优化方法,并为自动化训练流程设计和多信号融合策略提供了新思路。