学会引导,引导以见:用可训练向量揭示 LLM 中 RLVR 的激活几何与 Alpha-Stabler 稳定训练

Published · AI Daily — AI-assisted deep research, methodology & disclosure

这篇论文把 RLVR 看作激活空间里的干预问题:冻结基座,每层只加一个可训练向量,就能恢复多数任务上全参数训练 85% 以上的增益。作者归纳出两条几何规律:有效容量很小但不可无限压缩,控制方向集中在主成分子空间的低方差补空间。据此提出 Alpha-Stabler,用 PSI 预警崩溃,并在反向传播中投影掉主成分梯度,可稳定训练 2,000 步。注意:研究对象是纯文本 LLM,不是多模态模型。

强化学习已经成为提升大语言模型推理能力的核心后训练手段,但它到底改变了模型内部的什么,至今没有清晰答案。参数更新维度极高,优化噪声和训练配置差异又会掩盖真正有意义的变化。中国科学技术大学、腾讯混元和北京邮电大学的研究者在 2026 年 9 月 28 日提交的论文《Learning to Steer, Steering to See》中,换了一个角度:不再盯着参数空间,而是把 RLVR(可验证奖励强化学习)看作激活空间里的一次干预问题。

需要先澄清一点:本文入选时附带的背景介绍称其研究「视觉语言推理」,但 arXiv 页面上的正式标题是「Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors」,研究对象是纯文本大语言模型,实验覆盖数学推理、科学推理、代码生成和指令遵循四类任务,并未涉及多模态基准。下文全部依据论文摘要与正文。

核心方法:用单个可训练向量做「探针」

作者冻结基座模型,在选定的若干层输出上加一个可训练向量:h'_ℓ = h_ℓ + δ_ℓ。这个向量δ_ℓ与输入无关,对所有样本和所有 token 位置共享,因此每层只多出一个 d 维向量,d 是隐藏维度。训练目标不是直接做强化学习,而是蒸馏:先用 GRPO 或 DAPO 训练出 RL 教师模型,再让「冻结基座加向量」的学生去逼近教师,同时对比全参数训练和 LoRA 两种更新形式。蒸馏既做了在线策略(on-policy)版本,也做了离线策略(off-policy)版本。

这个设计的巧妙之处在于,它把一个问题变成了可检验的假说:如果 RL 带来的增益真的只是低维的,那么极少的参数就应该足以复现。实验模型包括 DeepSeek-R1-Distill-Qwen-1.5B 与 7B,以及 Qwen3-4B、8B、14B,共 5 个模型、6 个可验证奖励任务。

第一条规律:有效流形容量很小,但不是无限可压缩

在在线策略蒸馏下,LoRA 与全参数训练表现相当,而每个受控层只用一个向量,就能在大多数评测任务上恢复全参数训练增益的 85% 以上。离线策略蒸馏下,在评测集上的恢复率同样很高,说明这种可压缩性并不依赖学生自己生成的轨迹。

但压缩有边界。论文指出两个限制。其一是师生分布差距:两者接近时,单个向量就够;差距变大,就需要更灵活的参数化。其二是插入深度:固定向量在低层到中层效果好,越靠近输出层越差。作者进一步做了非线性分析,结论是深层的退化并非因为优化信号变弱,而是低维干预在高层的表达能力不足。换言之,容量取决于干预形式与所需修正之间的匹配程度。

第二条规律:控制流形与主成分子空间分离

作者把每层的单向量扩展为多个相互正交的向量。后提取的方向单独表现逐渐下降,但仍能独立支撑目标行为,所以首要方向占优,却并不唯一有效。更有意思的是:在同一任务和同一基座上,不同训练配置在参数空间里差异很大,压缩之后却收敛到一组可复现的任务相关方向。跨任务时,方向向量之间的对齐程度与能力迁移收益相关。

最关键的发现是位置:这些有效控制方向主要落在激活主成分子空间的低方差补空间里。通俗地说,RL 带来的改变并没有去拨动表示中方差最大的那些主导方向,而是在「不起眼」的方向上做精细调整。论文把这称为控制流形分离。

工程落地:Alpha-Stabler

基于上述几何结论,作者提出 Alpha-Stabler,一个即插即用的训练稳定框架,由两个模块组成。

Predictor(预测器)监测「主成分子空间侵入」(PSI)。它用冻结基座模型预先估计出固定的主成分子空间,然后在训练中计算 token 级激活差落入该子空间的能量占比,即投影后的 Frobenius 范数平方除以总范数平方。论文观察到,成功的 RL 训练中激活偏移基本留在低方差补空间,而 PSI 上升则伴随性能退化与训练崩溃,因此 PSI 可以作为崩溃的早期预警。

Controller(控制器)只在反向传播中工作:把激活梯度投影掉主成分子空间的分量,保留其在正交补空间的分量。它不引入额外可训练参数,不改优化器、奖励函数或模型结构。

效果与成本

论文报告 Alpha-Stabler 能让训练稳定运行 2,000 步,并持续放大 RL 的增益;与梯度裁剪及其他梯度投影方法相比,奖励增长更平稳。作者强调,改进来自于移除特定子空间中的梯度分量,而不是笼统地压制梯度。

关于开销,附录中的图显示在相同挂钟时间下,有无 Alpha-Stabler 的得分曲线几乎重合,说明额外时间开销很小。需要注意,我们读到的公开材料没有给出统一的单一基准分数表,因此无法在此转述具体的绝对分数提升。

对开发者与企业的意义

第一,监控。PSI 是一个可以在训练日志里常驻的廉价指标,团队可以用它在奖励曲线崩掉之前触发回滚或降低学习率。第二,低成本适配。

如果一个任务的 RL 增益能被每层一个向量复现,那么存储和切换任务专用能力的成本会大幅下降,这对多任务部署有吸引力。第三,迁移预测。方向对齐与迁移收益相关,意味着在真正训练之前,可以用向量几何粗略判断两个任务是否会互相促进。代码已在 GitHub 开源(caiyuchen-ustc/On_Policy_Vector_Training)。

局限与未来

作者自己列出了几点。理论框架依赖经验动机的假设,并非从第一性原理推出。研究只限于数学推理、代码生成等 RLVR 任务,没有验证 RLHF、多轮智能体决策和开放式生成。后续方向包括用神经元归因和因果追踪放宽假设,把框架扩展到 RLHF 与智能体场景,以及把「离主成分定位」当作更一般的设计原则,例如加入补空间正则项,或者把 PSI 当作自适应学习率与干预强度的信号。

综合来看,这是一篇偏分析的论文,价值在于给出一个可操作的几何视角,并附带一个低成本的稳定工具。读者应当把它看作对纯文本 LLM 上 RLVR 的结论,在多模态模型上是否成立,论文没有回答。

Sources