教師尤度を超える:グループ校正オンライン戦略蒸留による長コンテキスト推論
本論文は、長コンテキスト推論タスクにおけるオンラインポリシーディストillation(OPD)の失敗に焦点を当てる。著者は、従来のOPDはより強い教師モデルに依存して各トークンで密集したガイダンスを提供するが、長コンテキストタスクでは証拠がしばしば入力全体に分散するため、トークンレベルのガイダンスは局所的に妥当に見えるが、グローバルな証拠を見落としたりタスクの制約に違反したりする応答を好む傾向があると指摘する。一方、タスク専用バリデータは応答レベルで段階的な報酬を与え、部分的な成功を反映するため、系統的な不一致が生じる。著者は、2つの代表的な長コンテキスト証拠集約タスクでこの不一致を診断し、入力が増長するにつれて軌道レベルのOPDスコアがバリデータ報酬から徐々に乖離することを発見した。そこで、グループ校正オンラインポリシーディストillation(GC-OPD)を提案する。これは各rolloutグループ内でバリデータ報酬とOPDスコアをそれぞれ正規化し、その差を符号付きの教師-バリデータの不整合残差として利用し、Relative Advantage Credit Allocation(RACA)によりトークンの相対OPDアドバンテージに応じて残差を配分しつつ、元のOPD信号も保持する。5つの長コンテキストベンチマークで、GC-OPDはQwen3-4Bの平均点を29.08から40.47へ、Qwen3-8Bを35.12から44.65へそれぞれ向上させ、 naïveなOPDを大幅に上回る。
背景と概要
オンラインポリシーディストillation(OPD)は、軽量な学生モデルが強い教師モデルの推論能力を、自身の応答生成過程中に逐トークンの稠密ガイダンスを吸収することで学ぼうとする手法だ。教師モデルは各トークンが局所的な文脈で「妥当に見えるか」を判断する。しかし長コンテキストタスクでは、正解に必要な証拠が入力の複数の位置に分散しており、最終的な応答は段落をまたいで情報を統合し、グローバルな制約を満たさなければならない。トークンレベルのガイダンスは、局所的には整合的だが关键な証拠を見落としたり制約に違反したりする応答を好む傾向を持つ。一方、任務専用バリデータは応答レベルで段階的な報酬を返す。この尺度と粒度のズレが、長コンテキストでOPDが性能を発揮できない根本原因である。
著者はこの直感を可量化な証拠へ転換するため、2つの代表的な長コンテキスト証拠集約タスクで診断実験を行った。固定された応答に対して教師ガイダンスとバリデータ報酬の一致度を比較した結果、入力长度が増えるにつれ、軌道レベルのOPDスコアとバリデータ報酬の対斉度が徐々に低下することが明らかになった。教師の稠密な判断が、任務が実際に報酬とする内容与来越ず乖離しているのだ。これは、教師信号だけに依存すると学生モデルが任務の完了度と整合しない能力を学んでしまうことを示している。
深掘り分析
著者はこの不一致を明示的にモデル化・校正する形で問題に対処し、組校正オンラインポリシーディストillation(GC-OPD)を提案する。各rolloutグループ内でバリデータ報酬と軌道レベルのOPDスコアをそれぞれ正規化し、その差から符号付きの「教師-バリデータ不整合残差」を算出する。残差が正ならバリデータが教師よりもその軌道を高く評価していることを、負なら教師が過大評価していたことを意味する。重要なのは、GC-OPDが元の稠密なトークン級OPD信号を捨てない点だ。残差を校正項として上乗せすることで、教師信号と任務信号の両方を活かす。
残差を各トークンに適切に配分するため、手法は相对优势信用分配(RACA)を導入する。RACAは各トークンの相对OPDアドバンテージに応じて軌道レベルの残差を個別トークンへ割り当てる。これによりバリデータ信号が学習過程へ取り込まれつつ、OPDの既存の稠密ガイダンス構造は破壊されない。グローバルな任務信号とローカルなトークン信号の両立を図り、バリデータ報酬で教師ガイダンスを単純置換することで生じる情報損失を避ける設計だ。
消融実験により各要素の貢献が切り分けられた。符号付き残差項は、単にOPD由来の項を重ねるよりも、またグループ正規化されたバリデータ報酬を直接加えるよりも優れる。教師とバリデータの不一致を明示モデル化し、その符号情報を保持することが重要なのだ。さらにRACAは均等分配よりさらに改善し、相对アドバンテージに基づく差異化配分が合理かつ必須であることを裏付ける。これらの結果は、組相対的な残差校正によって稠密トークン級ガイダンスを保持したままバリデータの任務級結果を蒸馏へ取り込めるという核心結論を支えている。
業界への影響
実験結果は実質的だ。同一の後学習設定下で、GC-OPDは公式Qwen3-4Bチェックポイントを5つのベンチマークで平均29.08から40.47へ、Qwen3-8Bを35.12から44.65へ引き上げた。対照の朴素OPDは同一設定で39.31と43.56に留まり、明確な差が生じた。この差は組校正による残差校正が、コンパクトなモデルの長コンテキスト推論能力向上に実質的な貢献をしていることを示している。
手法そのものを超えて、本論文は教師信号と任務目標が粒度と尺度でズレる状況では、稠密ガイダンスを盲目的に信頼するのが最終性能を損なう可能性があるという、より広い視点を提供する。この洞察は長コンテキストモデリング、強化学習式学習、外部検証信号に依存するあらゆる学習システムに拡張できる。工業的導入においては、GC-OPDは有限の計算資源で大モデルの能力を小モデルへ転移させる任務整合的な経路を提供する。特に証拠集約や長文档问答のように段落横断的な情報統合が必要な場面で、より堅牢な効果が期待できる。
著者はコードを公開し、オープンソースコミュニティが本フレームワークをそのまま再利用・拡張できるようにした。これにより後続研究の障壁が下がり、稠密教師信号が段階的検証結果とズレうる他の長コンテキスト設定での再現が促される。GC-OPDは、計算制約の下で複雑な推論を実用的に支える手法として位置づけられる。
今後の展望
GC-OPDフレームワークは複数の後続研究の方向性を開く。1つは教師とバリデータの不整合をより精緻にモデル化することだ。単一の符号付き残差を超え、両信号がどこでなぜ乖離するのかを構造化表現へ展開する。もう1つは、校正をより多様な長コンテキストタスクへ一般化することだ。証拠集約以外のドメインでも組相対的残差アプローチが転移するかを検証する。
自然な次のステップは、学生モデルのスケールアップと入力の長期化への拡張だ。対斉ギャップがさらに拡大するか、RACAが効果的に信用を分配し続けるか examine する。複数のバリデータや階層的報酬信号の統合により、部分的成功をトークンへどう配分するかを精緻化できるだろう。
最終的に本作業は、オンラインポリシーディストillationを計算制約下の複雑な推論の実用的ツールとして位置づける。ローカルな稠密ガイダンスと段階的なグローバル目標を整合させることで、GC-OPDは、ただ整合的に聞こえるだけでなく、長コンテキストタスクを本当に遂行する学生モデルへの道を示している。