超越教师似然:组校准在线策略蒸馏,破解长上下文推理的蒸馏难题

Published 2026-08-19 · AI Daily — AI-assisted deep research, methodology & disclosure

这篇论文聚焦在线策略蒸馏在长上下文推理任务中的失效问题。作者指出,传统在线策略蒸馏依赖更强教师模型在每个 token 上提供稠密引导,但长上下文任务中证据往往分散于整段输入,token 级引导容易偏向局部看似合理、却遗漏全局证据或违反任务约束的响应;而任务专用验证器在响应层面给出可分级奖励,反映部分成功,二者出现系统性错位。作者先在两个代表性长上下文证据聚合任务上诊断了这一失配,发现随输入变长,轨迹级分数与验证器奖励对齐度逐渐下降。为此作者提出组校准在线策略蒸馏,在每组 rollout 内分别归一化验证器奖励与分数,以其差值作为带符号的不一致残差,并借助相对优势信用分配将残差按 token 的相对优势分配,同时保留原始信号。在五个长上下文基准上,该方法将 Qwen3-4B 与 Qwen3-8B 的平均分分别从 29.08 提升至 40.47、从 35.12 提升至 44.65,显著优于朴素方法。

在长上下文推理任务中,如何让一个轻量学生模型真正学会教师模型的推理能力,一直是模型压缩与训练优化的核心难题。在线策略蒸馏(On-Policy Distillation,简称 OPD)是当前备受关注的路线之一:它让学生模型在生成自身响应的过程中,从更强的教师模型处获得逐 token 的稠密引导,从而在自分布数据上持续学习。然而,这篇论文敏锐地指出,OPD 的这套机制在长上下文场景下会系统性失效。作者的核心贡献在于,先通过诊断实验揭示问题,再提出针对性的组校准在线策略蒸馏(Group-Calibrated On-Policy Distillation,简称 GC-OPD),并在五个长上下文基准上验证了其有效性。这一工作没有停留在经验性调参,而是从教师信号与任务目标错位这一根本矛盾出发,给出了一套可解释、可复现的改进方案。要理解问题的根源,需要回到两种信号的本质差异。OPD 依赖的教师引导是 token 级别的,它关注的是当前 token 在局部上下文下是否"看起来合理"。但在长上下文任务中,完成任务所需的关键证据往往分散在输入的多个位置,最终的正确响应需要跨段落整合这些信息,并满足全局性的任务约束。此时,逐 token 的稠密引导容易让学生模型偏向那些局部连贯、读起来顺理成章,却遗漏了关键证据或违背全局约束的响应。相比之下,任务专用验证器在响应层面进行评判,能够评估整个任务是否真正完成,并且可以返回分级奖励,反映出部分成功的程度。这两种信号在评价尺度与评价粒度上的错位,正是 OPD 在长上下文下表现打折的潜在原因。为了把这种直觉转化为可量化的证据,作者选取了两个代表性的长上下文证据聚合任务,在固定响应上对教师引导与验证器奖励之间的匹配度进行了诊断。关键发现是:随着输入长度的增加,轨迹级 OPD 分数与验证器奖励之间的对齐程度会逐步下降,也就是说,教师模型的判断与任务验证器的判断出现了越来越明显的分歧。这一现象说明,在长上下文中,教师模型给出的稠密 token 级信号已经不能完全代表任务真正需要的目标,单纯依赖它会导致学生模型学到与任务完成度不一致的能力。这一诊断直接 motivating 了 GC-OPD 的设计。该方法的核心思想,是显式地建模并校正教师信号与验证器信号之间的不一致。具体而言,GC-OPD 在每次 rollout 构成的小组内部,分别对验证器奖励和轨迹级 OPD 分数进行归一化处理,然后把二者相减,得到一个带符号的"教师-验证器不一致残差"。这个残差为正,表示验证器比教师更看好该轨迹;为负则表示教师信号高估了该轨迹。关键在于,GC-OPD 并没有因此丢弃原始的稠密 token 级 OPD 信号,而是把这一残差作为额外的校准项叠加进去。为了让残差合理落到各个 token 上,作者引入了相对优势信用分配(Relative-Advantage-based Credit Assignment,简称 RACA)。它根据每个 token 的相对 OPD 优势,将轨迹级残差分配到具体 token 上,从而在引入验证器信号的同时,仍然保留 OPD 原有的稠密引导结构。这一设计兼顾了全局任务信号与局部 token 信号,避免了简单粗暴地用验证器奖励替换教师引导所带来的信息损失。在实验层面,作者五个长上下文基准上进行了系统评估。在相同的后训练设置下,GC-OPD 将官方 Qwen3-4B 检查点在五个基准上的平均分从 29.08 提升到 40.47,将 Qwen3-8B 的检查点从 35.12 提升到 44.65。作为对照,朴素版的 OPD 在同一设置下分别只能达到 39.31 和 43.56,明显低于 GC-OPD。这一差距说明,组校准带来的残差校正对长上下文推理能力的提升具有实质性贡献。消融实验进一步揭示了各组件的作用。作者发现,带符号的残差项比单纯额外叠加一个由 OPD 派生的项更有效,也比直接加入按组归一化的验证器奖励更有效,这说明显式建模教师与验证器的分歧、并保留其符号信息至关重要。同时,RACA 相比均匀的 token 分配方式能够进一步带来提升,证明把残差依据 token 的相对优势进行差异化分配是合理且必要的。这些结果共同支撑了一个核心结论:通过组相对的不一致残差校准,可以在不丢弃稠密 token 级引导的前提下,把验证器的任务级结果有效融入蒸馏过程。从更广泛的意义来看,这篇论文的价值不仅在于提出了一种新的蒸馏改进方法,更在于它提供了一个观察视角:当教师信号与任务目标在粒度与尺度上不一致时,盲目信任稠密引导可能会损害最终的任务表现。这一洞察对长上下文建模、强化学习式训练以及任何依赖外部验证信号的学习系统都具有启发意义。在工业落地方面,GC-OPD 为在有限算力下把大模型能力迁移到小模型提供了一条更贴合任务目标的途径,尤其是在证据聚合、长文档问答等需要跨段整合信息的场景中,有望带来更稳健的效果。对开源社区而言,作者已公开代码,便于后续研究直接复用与扩展。对于后续工作,这一框架也提示人们可以进一步探索如何更精细地建模教师与验证器分歧、如何把这种校准推广到更多类型的长上下文任务,从而推动在线策略蒸馏在复杂推理场景中的实用化。

Sources