TRACE:用 rollout 引导的量化感知训练,实现 MoE 语言模型的 FP4 强化学习
TRACE 针对混合专家(MoE)语言模型的 FP4 强化学习:用 rollout 侧的量化结果去指导训练侧的 FP4 舍入,直接缩小两条量化路径的差异,并只缓存深层的尾数与缩放信息以控制开销。据摘要,在四个大型 MoE 模型上,FP4 权重、激活与 KV 缓存联合 rollout 的 RL 性能可与 BF16 rollout 相当,rollout 最高提速 5.4 倍,且优于对 BF16 策略做事后 FP4 量化。
论文要解决什么问题
强化学习(RL)后训练已经成为提升大语言模型推理、代码和长程任务能力的主流手段。但它有一个很重的成本:每一轮训练都要先用当前策略做大量 rollout(采样生成),再用这些样本更新模型。论文指出,rollout 阶段带来了显著的计算和显存开销,这促使业界尝试用低精度做 rollout。FP4 是目前硬件支持的最激进的浮点精度之一,权重、激活和 KV 缓存都能压到 4 位。
问题在于,现有的 FP4 RL 方法有一个关键缺陷。按照论文的描述,它们主要是分别优化训练路径和 rollout 路径各自的量化精度,而没有直接缩小两条量化执行路径之间的差异。RL 对这种差异非常敏感:rollout 用 FP4 采样出的轨迹,是在训练侧以另一套数值行为计算梯度的。两边的数值不一致,就会变成离策略偏差,训练变得不稳定,最终性能下降。
TRACE 的核心思路
TRACE 的全称是 Train-Rollout Quantization Alignment via Compact GuidancE,即借助紧凑指引实现训练与 rollout 的量化对齐。它面向混合专家(MoE)语言模型,包含两个核心设计。
第一个设计是 rollout 引导的量化感知训练(QAT)。传统 QAT 在训练侧自行决定每个数值如何舍入到 FP4 网格。TRACE 改为让 rollout 侧的量化结果去指导训练侧的 FP4 舍入决策。换句话说,训练侧不再各自为政,而是尽量复现 rollout 侧实际发生的舍入,从而直接降低 train-rollout 差异。这是论文区别于以往方法的主要创新点:优化目标从“每条路径各自量化得准”变成“两条路径彼此对得齐”。
第二个设计是高效的量化信息缓存方案。要让训练侧知道 rollout 侧的舍入结果,就得保存并传递相应的量化信息,这会带来存储和通信开销。TRACE 选择性地只保留来自较深层的尾数(mantissa)和缩放因子(scale)信息,以此压缩这部分额外成本。摘要没有给出具体保留哪些层、占用多少额外显存,这些细节需要读正文确认。
工作原理的工程理解
FP4 通常采用分块缩放:一小组数值共享一个缩放因子,组内每个数值只用 4 位表示。舍入方向(向上还是向下取最近的网格点)在每个数值上都是一个离散决定。两条路径如果对同一个权重或激活做出不同的舍入决定,输出就会出现微小但系统性的偏差。偏差经过多层 MoE 网络累积,再叠加路由器选择专家的离散性,就可能被放大。
TRACE 的做法可以这样理解:rollout 引擎先完成 FP4 量化并记录结果,训练侧在前向计算时参考这份记录来决定舍入,使两边的计算图在数值上尽量一致。因为深层的误差对最终输出影响更直接,缓存深层信息是在精度与开销之间的折中。以上是对摘要描述的机制解读,具体算法细节以论文正文为准。
实验结果与性能
论文在四个大规模 MoE 语言模型上做了评估,覆盖推理、代码和长程 RL 任务。根据摘要,主要结论有三点。 其一,TRACE 实现了 FP4 权重与激活、以及 FP4 KV 缓存的联合 rollout,同时 RL 性能与 BF16 rollout 相当。这意味着低精度并没有以牺牲最终效果为代价。 其二,rollout 速度最高提升 5.4 倍。注意“最高”二字:这是最好情形下的数字,实际加速取决于模型、序列长度、批量大小和硬件,不能直接当作平均值。 其三,与“对 BF16 训练出的策略做事后 FP4 量化”相比,TRACE 的最终 FP4 性能更强。这个对比很关键,它说明让模型在训练中就适应 FP4,比训练完再压缩更好。
摘要没有给出具体的基准分数、显存节省比例和模型名称,本文不做推测。
对开发者与企业的影响
对做 RL 后训练的团队,rollout 往往占据训练墙钟时间的很大一部分,尤其在长思维链和长程任务里。如果 FP4 rollout 在不损失效果的前提下带来数倍加速,同样的 GPU 预算能跑更多迭代,或者缩短实验周期。对 MoE 模型而言,权重体积大、KV 缓存压力大,FP4 的收益更明显。
在生态层面,这项工作依赖支持 FP4 的硬件和推理内核。采用门槛包括:推理引擎要能导出量化结果,训练框架要能消费这些结果,两者之间的数据通路需要工程改造。它也提示了一个更一般的设计原则:在 RL 系统里,训练与推理的数值一致性应当作为一等目标,而不是副产品。
局限与未来方向
有几点需要保持清醒。第一,摘要中的 5.4 倍是上限数字。第二,实验覆盖四个 MoE 模型,是否能推广到稠密模型或更小规模,需要独立验证。第三,rollout 引导增加了系统耦合:训练侧依赖 rollout 侧的输出,会带来额外的同步、存储与通信,即使已经做了缓存压缩。第四,这是一篇刚发布的预印本,尚未经过同行评审,结论应等待复现。
未来的方向包括:把对齐思想扩展到更多精度格式、与异步 RL 系统结合、研究缓存策略在更长序列下的扩展性,以及评估在安全性和稳健性等维度上是否同样不受影响。
小结
TRACE 抓住了 FP4 RL 的真正瓶颈:不是单条路径量化得不够准,而是训练与 rollout 两条路径对不齐。
通过 rollout 引导的 QAT 与紧凑的量化信息缓存,它在摘要所述的实验里做到了与 BF16 rollout 相当的 RL 性能,并获得最高 5.4 倍的 rollout 加速。是否值得采用,要看你的硬件、框架和模型规模,建议在小规模任务上先复现。