學會引導,引導以見:用可訓練向量揭示 LLM 中 RLVR 的啟用幾何與 Alpha-Stabler 穩定訓練

Published · AI Daily — AI-assisted deep research, methodology & disclosure

這篇論文把 RLVR 看作啟用空間裡的干預問題:凍結基座,每層只加一個可訓練向量,就能恢復多數任務上全引數訓練 85% 以上的增益。作者歸納出兩條几何規律:有效容量很小但不可無限壓縮,控制方向集中在主成分子空間的低方差補空間。據此提出 Alpha-Stabler,用 PSI 預警崩潰,並在反向傳播中投影掉主成分梯度,可穩定訓練 2,000 步。注意:研究物件是純文字 LLM,不是多模態模型。

強化學習已經成為提升大語言模型推理能力的核心後訓練手段,但它到底改變了模型內部的什麼,至今沒有清晰答案。引數更新維度極高,最佳化噪聲和訓練配置差異又會掩蓋真正有意義的變化。中國科學技術大學、騰訊混元和北京郵電大學的研究者在 2026 年 9 月 28 日提交的論文《Learning to Steer, Steering to See》中,換了一個角度:不再盯著引數空間,而是把 RLVR(可驗證獎勵強化學習)看作啟用空間裡的一次干預問題。

需要先澄清一點:本文入選時附帶的背景介紹稱其研究「視覺語言推理」,但 arXiv 頁面上的正式標題是「Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors」,研究物件是純文字大語言模型,實驗覆蓋數學推理、科學推理、程式碼生成和指令遵循四類任務,並未涉及多模態基準。下文全部依據論文摘要與正文。

核心方法:用單個可訓練向量做「探針」

作者凍結基座模型,在選定的若干層輸出上加一個可訓練向量:h'_ℓ = h_ℓ + δ_ℓ。這個向量δ_ℓ與輸入無關,對所有樣本和所有 token 位置共享,因此每層只多出一個 d 維向量,d 是隱藏維度。訓練目標不是直接做強化學習,而是蒸餾:先用 GRPO 或 DAPO 訓練出 RL 教師模型,再讓「凍結基座加向量」的學生去逼近教師,同時對比全引數訓練和 LoRA 兩種更新形式。蒸餾既做了線上策略(on-policy)版本,也做了離線策略(off-policy)版本。

這個設計的巧妙之處在於,它把一個問題變成了可檢驗的假說:如果 RL 帶來的增益真的只是低維的,那麼極少的引數就應該足以復現。實驗模型包括 DeepSeek-R1-Distill-Qwen-1.5B 與 7B,以及 Qwen3-4B、8B、14B,共 5 個模型、6 個可驗證獎勵任務。

第一條規律:有效流形容量很小,但不是無限可壓縮

在線上策略蒸餾下,LoRA 與全引數訓練表現相當,而每個受控層只用一個向量,就能在大多數評測任務上恢復全引數訓練增益的 85% 以上。離線策略蒸餾下,在評測集上的恢復率同樣很高,說明這種可壓縮性並不依賴學生自己生成的軌跡。

但壓縮有邊界。論文指出兩個限制。其一是師生分佈差距:兩者接近時,單個向量就夠;差距變大,就需要更靈活的引數化。其二是插入深度:固定向量在低層到中層效果好,越靠近輸出層越差。作者進一步做了非線性分析,結論是深層的退化並非因為最佳化訊號變弱,而是低維干預在高層的表達能力不足。換言之,容量取決於干預形式與所需修正之間的匹配程度。

第二條規律:控制流形與主成分子空間分離

作者把每層的單向量擴充套件為多個相互正交的向量。後提取的方向單獨表現逐漸下降,但仍能獨立支撐目標行為,所以首要方向佔優,卻並不唯一有效。更有意思的是:在同一任務和同一基座上,不同訓練配置在引數空間裡差異很大,壓縮之後卻收斂到一組可復現的任務相關方向。跨任務時,方向向量之間的對齊程度與能力遷移收益相關。

最關鍵的發現是位置:這些有效控制方向主要落在啟用主成分子空間的低方差補空間裡。通俗地說,RL 帶來的改變並沒有去撥動表示中方差最大的那些主導方向,而是在「不起眼」的方向上做精細調整。論文把這稱為控制流形分離。

工程落地:Alpha-Stabler

基於上述幾何結論,作者提出 Alpha-Stabler,一個即插即用的訓練穩定框架,由兩個模組組成。

Predictor(預測器)監測「主成分子空間侵入」(PSI)。它用凍結基座模型預先估計出固定的主成分子空間,然後在訓練中計算 token 級啟用差落入該子空間的能量佔比,即投影后的 Frobenius 範數平方除以總範數平方。論文觀察到,成功的 RL 訓練中啟用偏移基本留在低方差補空間,而 PSI 上升則伴隨效能退化與訓練崩潰,因此 PSI 可以作為崩潰的早期預警。

Controller(控制器)只在反向傳播中工作:把啟用梯度投影掉主成分子空間的分量,保留其在正交補空間的分量。它不引入額外可訓練引數,不改最佳化器、獎勵函式或模型結構。

效果與成本

論文報告 Alpha-Stabler 能讓訓練穩定執行 2,000 步,並持續放大 RL 的增益;與梯度裁剪及其他梯度投影方法相比,獎勵增長更平穩。作者強調,改進來自於移除特定子空間中的梯度分量,而不是籠統地壓制梯度。

關於開銷,附錄中的圖顯示在相同掛鐘時間下,有無 Alpha-Stabler 的得分曲線幾乎重合,說明額外時間開銷很小。需要注意,我們讀到的公開材料沒有給出統一的單一基準分數表,因此無法在此轉述具體的絕對分數提升。

對開發者與企業的意義

第一,監控。PSI 是一個可以在訓練日誌裡常駐的廉價指標,團隊可以用它在獎勵曲線崩掉之前觸發回滾或降低學習率。第二,低成本適配。

如果一個任務的 RL 增益能被每層一個向量復現,那麼儲存和切換任務專用能力的成本會大幅下降,這對多工部署有吸引力。第三,遷移預測。方向對齊與遷移收益相關,意味著在真正訓練之前,可以用向量幾何粗略判斷兩個任務是否會互相促進。程式碼已在 GitHub 開源(caiyuchen-ustc/On_Policy_Vector_Training)。

侷限與未來

作者自己列出了幾點。理論框架依賴經驗動機的假設,並非從第一性原理推出。研究只限於數學推理、程式碼生成等 RLVR 任務,沒有驗證 RLHF、多輪智慧體決策和開放式生成。後續方向包括用神經元歸因和因果追蹤放寬假設,把框架擴充套件到 RLHF 與智慧體場景,以及把「離主成分定位」當作更一般的設計原則,例如加入補空間正則項,或者把 PSI 當作自適應學習率與干預強度的訊號。

綜合來看,這是一篇偏分析的論文,價值在於給出一個可操作的幾何視角,並附帶一個低成本的穩定工具。讀者應當把它看作對純文字 LLM 上 RLVR 的結論,在多模態模型上是否成立,論文沒有回答。

Sources