CriPO突破量规强化学习瓶颈:自蒸馏机制重塑大模型优化范式

针对基于量规的强化学习在开放域任务中面临的探索不足与优化信号丢失两大核心缺陷,研究提出CriPO新框架。该框架通过策略自蒸馏机制,利用Criterion-injection自教师解决未探索量规问题,并通过Counterfactual自教师翻转被抑制量规的负优势信号。实验显示,CriPO在医学和科学基准上表现优异,且优化步数减少约两倍,有效避免了传统方法中因引入外部指导而产生的训练与推理偏差,为LLM对齐提供了更高效的技术路径。

在大型语言模型处理开放域生成任务时,基于量规的强化学习(Rubric-based RL)因其能利用细粒度的评估标准来提升输出质量而备受关注。然而,该领域长期存在一个被广泛认知的局限性,即探索能力不足。具体而言,当某些量规标准在所有生成轨迹中均未被满足时,这些未探索量规(Unexplored Criteria, UC)无法提供有效的优化信号,导致模型在这些维度上停滞不前。尽管近期研究尝试在生成过程中引入外部指导信息以增强探索,但这不可避免地引入了训练与推理阶段的不匹配(train-inference mismatch):策略在训练时依赖外部指导,而在推理时该指导缺失,这种差异会导致自回归解码过程中的误差累积。更为严重的是,现有方法往往忽视了一种截然不同的失效模式,本文将其定义为被抑制量规(Suppressed Criteria, SC)。这类量规虽然在部分生成轨迹中被满足,但由于标量奖励聚合机制的特性,它们在学习过程中获得的聚合优势值可能为非正数,导致其蕴含的有效学习信号在优化阶段被意外丢弃。分析显示,SC现象极为普遍,超过57%的样本在整个训练过程中都表现出这种失效模式,平均每个样本涉及1.8个被抑制量规。

针对上述双重挑战,本文提出了一种名为Criterion-Distilled Policy Optimization(CriPO)的新框架,旨在通过策略自蒸馏机制同时解决UC和SC问题,且无需引入训练-推理偏差。CriPO的核心创新在于其独特的自蒸馏策略设计,分别针对UC和SC两种失效模式构建了不同的自教师机制。对于未探索量规(UC)问题,CriPO构建了一个Criterion-injection自教师。该机制通过在生成过程中注入特定的量规信息,计算局部化的前向KL散度损失(forward-KL loss),从而将缺失的行为模式有效地注入到策略网络中,弥补了探索不足的缺陷。对于被抑制量规(SC)问题,CriPO则采用了一种Counterfactual自教师。该机制专门针对那些具有负优势值的生成轨迹,通过反事实推理定位与量规相关的token,并强制将这些token层面的优势值翻转为正值。这一操作保留了那些原本会被标量聚合机制掩盖的有效模式,防止了有用学习信号的丢失。

这种双管齐下的自蒸馏策略,不仅避免了外部指导带来的训练-推理不匹配问题,还从微观的token层面和宏观的轨迹层面同时优化了策略,显著提升了学习的效率和稳定性。为了验证CriPO的有效性,研究者在医学和科学领域的基准数据集上进行了广泛的实验。实验结果显示,CriPO consistently(一致地)优于传统的基于量规的强化学习方法。在最终性能方面,CriPO实现了更强的生成质量,关键指标的提升证明了其在处理复杂开放域任务时的优越性。值得注意的是,CriPO在优化效率上也表现出色,达到相同或更优性能所需的优化步数减少了约两倍。这一结果不仅验证了自蒸馏机制在解决UC和SC问题上的有效性,也展示了其在降低计算成本方面的巨大潜力。消融实验进一步揭示了Criterion-injection和Counterfactual两个模块各自的贡献,证实了两者对于全面解决量规优化中的探索与信号抑制问题缺一不可。

这些实验结果有力地支持了CriPO作为提升Rubric-based RL性能的有效框架的地位。CriPO的提出对开源社区、工业落地及后续研究具有深远的意义。在开源社区层面,该方法提供了一种无需外部指导即可高效利用细粒度评估标准的策略,降低了基于量规强化学习的实现门槛和计算成本。在工业落地方面,减少优化步数意味着更低的训练成本和更快的迭代速度,这对于资源受限的大模型部署场景尤为关键。此外,CriPO对SC现象的深入分析揭示了标量奖励聚合机制的固有缺陷,为后续研究提供了新的视角,即如何在保持奖励信号简洁性的同时,保留细粒度的学习信息。这一发现可能启发更多关于奖励塑形、优势估计以及策略优化算法的创新。总体而言,CriPO不仅解决了一个具体的技术难题,更为推动基于量规的强化学习在更广泛场景中的应用奠定了坚实的理论和方法论基础。

Sources