RISE框架:自外推策略蒸馏打破小模型推理瓶颈,实现无需外部教师的递归进化

Published 2026-09-04 · AI Daily — AI-assisted deep research, methodology & disclosure

最新研究提出RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)框架,旨在解决现有在线策略蒸馏中教师模型质量瓶颈问题。RISE利用模型自身的强化学习验证推理轨迹,通过在参数空间或输出对数几率空间外推当前检查点与滞后锚点之间的位移,将稀疏的结果诱导参数更新转化为密集的令牌级目标。该方法构建了RLVR与OPD的互补循环,随着学生模型进步自动刷新教师模型,实现递归提升。实验表明,RISE在数学推理、代码生成等任务中显著优于传统方法,有效提升了小模型的推理能力与泛化性能。

大型语言模型在复杂推理任务中的表现往往受限于训练数据的稀疏性与监督信号的强度。尽管强化学习验证推理(RLVR)能够通过稀疏的结果奖励有效引导模型探索正确的推理路径,但其缺乏细粒度的过程监督,导致训练效率低下且容易陷入局部最优。与此同时,传统的在线策略蒸馏(OPD)虽然能提供密集的令牌级监督,但其效果高度依赖于教师模型的质量。外部教师模型往往面临分布不匹配的问题,而依赖特权条件的自蒸馏则受限于上下文学习能力的天花板。针对这一核心痛点,本研究提出了 RISE 框架,旨在通过自外推策略蒸馏机制,构建一个动态演进的合成教师模型。该框架的核心贡献在于完全摒弃了对昂贵外部教师或特权信息的依赖,转而利用模型自身的训练轨迹,通过数学上的外推技术生成高质量的过程监督信号,从而实现了从稀疏结果奖励到密集过程监督的有效转化,显著提升了模型在复杂推理任务中的收敛速度与最终性能。

在技术实现层面,RISE 的核心创新在于其"自外推"机制。具体而言,该方法并不直接复制教师模型的输出,而是通过分析模型在强化学习训练过程中的轨迹,计算当前检查点与一个滞后锚点(trailing anchor)在参数空间或输出对数几率空间中的位移向量。通过将该位移向量外推,RISE 能够预测模型在下一步可能达到的更优状态,从而生成一个合成教师。这一过程将原本稀疏的、仅基于最终结果正确性的参数更新,转化为密集的、针对每个令牌的细致目标分布。此外,RISE 构建了一个 RLVR 与 OPD 互补的闭环系统:RLVR 提供的结果奖励确保了外推方向始终指向正确的逻辑推理路径,防止模型偏离正轨;而由外推生成的教师模型则提供了细粒度的令牌级指导,帮助模型优化中间推理步骤。更为关键的是,由于合成教师是基于学生模型的最新检查点动态生成的,随着学生模型的不断迭代与能力提升,教师模型的质量也随之同步提升,形成了一种递归改进的良性循环,而非传统蒸馏中的一次性压缩过程。

为了验证 RISE 的有效性,研究团队在多个具有挑战性的基准测试上进行了广泛的实验,涵盖数学推理、多领域科学、技术工程与数学(STEM)问题、代码生成以及多轮智能体交互任务。实验设置严格对比了仅使用 RLVR 训练、传统在线自蒸馏以及 RISE 框架的性能差异。结果表明,RISE 在所有测试场景下均显著优于基线方法。特别是在数学推理和代码生成等对逻辑严密性要求极高的任务中,RISE 展现出了更强的泛化能力与稳定性。消融实验进一步揭示,外推机制的引入是性能提升的关键因素,它有效地弥补了稀疏奖励带来的监督信号不足。同时,动态更新教师模型的策略确保了蒸馏过程能够持续捕捉模型能力的最新进展,避免了因教师模型滞后而导致的性能瓶颈。

这些实验结果有力地证明了 RISE 在提升小参数模型推理能力方面的巨大潜力。RISE 框架的提出对开源社区与工业落地具有深远的意义。首先,它打破了高性能推理模型对昂贵外部教师模型的依赖,大幅降低了模型微调与对齐的成本,使得资源受限的研究团队与开发者也能轻松训练出具备强大推理能力的小模型。其次,这种递归改进的机制为后续研究提供了新的思路,即如何利用模型自身的进化轨迹来生成更高质量的数据与监督信号,而非单纯依赖静态数据集。在工业界,RISE 有望被广泛应用于智能体系统的训练,提升其在复杂多轮对话与任务规划中的表现。随着大模型向更小、更高效的方向发展,此类无需外部依赖、能够自我进化的训练范式将成为提升模型智能水平的关键路径,推动人工智能技术在更多垂直领域的深度应用与普及。

Sources

FAQ

RISE 框架是什么以及它解决了什么问题?

RISE(自外推策略蒸馏递归改进)是一个无需外部教师的强化学习框架。它解决了小模型在复杂推理任务中训练效率低、依赖外部教师模型或特权条件的问题,通过自我提升来提高推理能力。

RISE 框架为何重要,它会带来哪些影响?

RISE 通过利用模型自身轨迹进行数学外推,将稀疏结果奖励转化为密集的令牌级监督。这显著降低了高性能推理模型的微调成本,使资源有限的团队也能训练出强大模型,并为AIagent系统提供了新的训练思路。

RISE 框架未来的发展方向和应用前景如何?

RISE 的递归改进机制为如何利用模型自身进化轨迹生成高质量数据与监督信号提供了新思路。它有望在工业界广泛应用于智能体系统训练,提升复杂多轮对话与任务规划表现,推动AI技术在更多垂直领域的深度应用。