突破强化学习信号稀疏瓶颈:DASH方法重塑大模型推理优化范式

针对基于可验证奖励的强化学习(RLVR)中普遍存在的信号稀疏难题,最新研究提出DASH(Divergence-Adaptive Supervision Horizons)方法。该方法突破了传统策略自蒸馏(OPSD)忽略生成过程时间结构差异的局限,通过构建自适应传播门控,动态映射局部蒸馏信号与序列均值的差距,从而控制反向多步聚合。实验显示,DASH无需额外前向传播即可根据局部发散演变动态调整令牌级监督权重,在多个数学推理基准和模型规模上均显著优于标准OPSD,为提升大语言模型推理效率提供了全新的高精度优化路径。

在大型语言模型的推理能力训练中,基于可验证奖励的强化学习(RLVR)因其能够利用自动可验证的结果信号而备受关注。然而,这类信号通常具有稀疏性,仅在序列级别提供反馈,导致模型难以在生成过程中获得细粒度的指导。为缓解这一信号稀疏问题,策略自蒸馏(OPSD)方法被提出,它通过在学生模型访问过的词元前缀处查询特权教师模型,提供密集的令牌级分布监督。尽管OPSD在一定程度上缓解了信号稀疏性,但我们发现标准OPSD仍未充分利用 rollout 过程中的时间结构特性。具体而言,标准OPSD为每个局部发散分配相同的系数,无论其发生的位置或所在的发散序列如何。在自回归生成中,相同程度的发散可能伴随着不同的差异历史,反映出师生模型间不匹配的不同演变过程。由于局部标量本身无法区分这些时间上下文,标准OPSD无法根据实现的分发序列自适应地调整令牌级权重。针对这一局限性,本文提出了发散自适应监督视界(DASH)方法。

DASH的核心创新在于将每个局部蒸馏信号与序列级均值之间的差距映射为一个自适应传播门控,并利用这些门控来控制反向多步聚合。通过这种方式,DASH能够根据生成过程中局部发散的演变情况,动态调整令牌级的监督权重,从而更精准地引导模型学习。这种机制使得模型能够识别并强化那些对最终结果有积极贡献的路径,同时抑制无效探索,显著提升了训练效率和推理准确性。在技术实现层面,DASH并未引入复杂的网络结构变更,而是聚焦于训练策略的优化。它复用了OPSD已计算出的教师和学生分布,因此无需额外的教师或学生前向传播,计算开销极低。具体而言,DASH首先计算每一步生成的局部蒸馏信号,即学生模型在该步的输出分布与教师模型在对应前缀下的分布之间的差异。接着,它计算该序列所有局部信号的平均值,作为基准。DASH将每个局部信号与该均值的差距映射为一个门控值,该门控值反映了当前步骤的发散程度相对于整体序列平均水平的偏离程度。

随后,利用这些门控值对反向传播过程中的多步聚合进行加权控制。这意味着,如果某一步的发散较大且对后续步骤有积极影响,其对应的门控值将允许更多的梯度流动,从而加强该步骤的监督信号;反之,若发散较大但属于无效探索,则门控值会抑制梯度流动。这种基于时间演变的动态权重调整机制,使得模型能够更敏锐地捕捉到生成过程中的关键决策点,从而在复杂的推理任务中表现出更强的鲁棒性和准确性。为了验证DASH的有效性,我们在三个数学推理基准数据集上进行了广泛的实验,涵盖了三种不同规模的模型。实验结果显示,DASH在所有基准和所有模型规模上均优于匹配的标准OPSD重运行结果。具体而言,在难度较高的数学推理任务中,DASH不仅提升了最终的答案准确率,还显著减少了训练过程中的收敛时间。消融实验进一步揭示,DASH的性能提升主要来源于其对时间结构的自适应利用。当移除自适应门控机制,仅保留标准OPSD的固定权重时,性能出现明显下降,证明了动态权重调整的必要性。

此外,实验还表明,DASH在不同模型规模上均表现出良好的可扩展性,小模型通过DASH获得的提升幅度与大模型相当,这证明了该方法在资源受限场景下的巨大潜力。这些结果有力地证明了DASH作为一种高效、低开销的优化策略,能够显著提升基于强化学习的推理模型性能。DASH的提出对开源社区和工业落地具有深远意义。首先,由于DASH复用了现有的教师和学生分布,无需额外的计算资源,这使得它极易集成到现有的强化学习训练流程中,降低了工业界部署先进推理模型的门槛。其次,DASH通过优化监督信号的分配,提高了训练效率,减少了达到相同性能所需的训练步数,从而降低了大规模模型训练的碳足迹和成本。对于开源社区而言,DASH提供了一种新的视角,即通过精细化的时间结构分析来优化强化学习信号,这为后续研究提供了重要的参考方向。未来的工作可以探索将DASH扩展到其他类型的生成任务,如代码生成或自然语言理解,或者结合其他稀疏奖励处理技术,进一步挖掘其在复杂推理场景中的潜力。总之,DASH不仅是一个具体的算法改进,更是一种强调时间敏感性和动态适应性的训练哲学,有望推动大语言模型推理能力训练向更高效、更智能的方向发展。

Sources