「導くことを学び、導いて見る」:学習可能ベクトルで解き明かす LLM の RLVR の幾何と Alpha-Stabler
本論文は RLVR を活性化空間での介入問題として扱います。ベースモデルを凍結し、層ごとに学習可能なベクトルを1本足すだけで、大半のタスクで全パラメータ学習の利得の85%以上を回復しました。有効容量は小さいが無限には圧縮できず、制御方向は主成分部分空間の低分散補空間にあると示します。これを基に Alpha-Stabler を提案し、PSI で崩壊を予告、逆伝播で主成分成分を除去して2,000ステップの安定学習を実現。対象はテキスト専用 LLM です。
強化学習は大規模言語モデルの推論能力を高める中心的な後学習手法になりましたが、モデル内部で何が変わっているのかは、まだ十分に分かっていません。パラメータ更新は極めて高次元で、最適化ノイズや設定の違いが、意味のある変化を覆い隠してしまうからです。中国科学技術大学(USTC)、Tencent Hunyuan、北京郵電大学の研究チームは、2026年9月28日に投稿した論文(arXiv 2609.34344、cs.LG)で、見方を変えました。パラメータ空間ではなく、RLVR(検証可能な報酬による強化学習)を活性化空間での介入問題として捉えたのです。
先に一点、訂正があります。この記事に付いていた背景説明は「視覚言語推論」を扱うとしていましたが、arXiv の正式タイトルは「Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors」です。対象はテキストのみの LLM で、数学推論、科学推論、コード生成、指示追従の4種類のタスクで実験しています。マルチモーダルのベンチマークは出てきません。以下は論文の記述に沿っています。
中核の手法:学習可能な1本のベクトルを探針にする
著者らはベースモデルを凍結し、選んだ層の出力に学習可能なベクトルを足します。h'_l = h_l + delta_l です。このベクトルは入力に依存せず、全サンプル・全トークン位置で共有されます。つまり、制御する層ごとに追加されるのは隠れ次元 d の1本のベクトルだけです。学習は RL そのものではなく蒸留で行います。まず GRPO または DAPO で教師モデルを訓練し、「凍結したベース+ベクトル」の生徒を教師に近づけます。オンポリシーとオフポリシーの両方の蒸留を行い、全パラメータ学習、LoRA、ベクトルステアリングの3形式を比べています。
これは曖昧な考えを検証可能な仮説に変える設計です。RL の利得が本当に低次元なら、わずかなパラメータで再現できるはずだからです。使用モデルは DeepSeek-R1-Distill-Qwen の1.5Bと7B、Qwen3 の4B、8B、14B です。合計で5つの LLM と、6つの検証可能報酬タスクを扱っています。
性質1:有効多様体の容量は小さいが、無限には圧縮できない
オンポリシー蒸留では、LoRA と全パラメータ学習はほぼ同等の性能でした。それでも、制御する層ごとに1本のベクトルだけで、評価した大半のタスクで全パラメータ学習の利得の85%以上を回復しています。教師が生成した軌跡を使うオフポリシー蒸留でも、評価セットでの回復率は同程度に高く、この圧縮しやすさが生徒自身の生成に依存しないことを示しています。
興味深いのは限界です。論文は2つを挙げます。1つ目は教師と生徒の分布の差で、近ければ1本のベクトルで足り、差が広がるとより柔軟なパラメータ化が必要になります。2つ目は挿入する深さで、固定ベクトルは低層から中層ではよく働き、出力層に近づくと劣化します。非線形解析によれば、これは深い層で最適化の信号が弱いからではありません。入力に依存しない低次元のシフトでは、高層が必要とする入力依存の補正を表現できない、という表現力のボトルネックです。必要な容量は、介入の形が必要な補正にどれだけ合っているかで決まります。
性質2:制御多様体は主成分部分空間から分離している
次に著者らは、層ごとの1本のベクトルを、互いに直交する複数のベクトルに拡張しました。後から抽出した方向は単独では成績が下がりますが、それでも単独で目的の挙動を支えられます。先頭の方向が支配的ですが、唯一有効なわけではありません。同じタスクと同じベースモデルでは、パラメータ空間では大きく異なる学習設定でも、圧縮すると再現性のある一組のタスク関連方向に収束します。タスクをまたぐと、方向ベクトル間の整合度が能力の転移の利得と対応しています。
最も重要な発見は、その方向の位置です。有効な制御方向は、主に活性化の主成分部分空間の「低分散の補空間」にあります。RL は表現を支配する分散の大きな方向を押すのではなく、目立たない方向を細かく調整しているのです。論文はこれを制御多様体の分離と呼びます。
Alpha-Stabler:幾何を学習ツールに変える
この知見をもとに、2つのモジュールからなる Alpha-Stabler を提案しています。差し込むだけで使える枠組みです。
Predictor(予測器)は「主成分部分空間への侵入」(PSI)を監視します。凍結したベースモデルから固定の主成分部分空間をあらかじめ推定し、学習中にトークン単位の活性化差のエネルギーのうち、その部分空間に入る割合を測ります。成功する RL では活性化の変化が低分散の補空間にとどまり、PSI の上昇は性能低下や崩壊と同時に現れます。そのため、崩壊の早期警告になります。
Controller(制御器)は逆伝播だけで働きます。活性化勾配から主成分部分空間の成分を取り除き、直交補空間の成分は残します。学習可能パラメータは増えず、オプティマイザ、報酬関数、モデル構造の変更も要りません。
結果とコスト
論文は、Alpha-Stabler が2,000ステップにわたり学習を安定させ、RL の利得を一貫して高めると報告しています。勾配クリッピングや他の勾配射影手法より、報酬の伸びが滑らかです。
著者は、改善の源は勾配の一般的な抑制ではなく、特定の部分空間の勾配成分を取り除くことだと強調しています。コストについては、付録の図で、同じ実時間では有無のスコア曲線がほぼ重なっており、追加のオーバーヘッドは小さいとされています。なお、確認できた範囲では、絶対スコアをまとめた単一の表は見つからなかったため、この記事では具体的な数値の向上幅は引用していません。
開発者と企業への意味
最も取り入れやすいのは監視です。PSI は安価な指標で、学習ダッシュボードに常時表示し、報酬曲線が崩れる前にロールバックや学習率の引き下げを起動できます。次にタスク適応です。
RL の利得が層ごとの1本のベクトルで再現できるなら、タスク専用の挙動を保存・切り替えるコストが大きく下がります。さらに転移の予測です。方向の整合度が転移と相関するので、大規模な学習の前に、2つのタスクが互いに助け合うかをおおまかに見積もれる可能性があります。コードは GitHub(caiyuchen-ustc/On_Policy_Vector_Training)で公開されています。
限界と今後
著者自身が限界を挙げています。理論は経験的な動機に基づく仮定に依存し、第一原理から導かれたものではありません。対象は数学やコードなどの RLVR に限られ、RLHF、マルチターンのエージェント的意思決定、自由形式の生成では検証していません。今後は、ニューロン帰属や因果追跡で仮定を緩めること、RLHF やエージェントへの拡張、補空間の正則化項や、PSI を学習率や介入強度の適応信号に使うことなどが挙げられています。
全体として、これは分析寄りの論文です。価値は、使える幾何学的な見方と、その上に作った低コストの安定化手法にあります。結論はテキストのみの LLM に対するものと受け取るべきで、マルチモーダルモデルで成り立つかどうかは、この論文では答えていません。