混合27B大模型中Gated DeltaNet為何能扛住4比特量化:NVFP4全精度壓縮實戰
本文針對混合架構大語言模型中線性注意力層(如Gated DeltaNet)難以量化的傳統認知,提出了名為Minima的NVFP4 W4A4全模型量化方案。研究打破了以往僅對GDN模組保留8/16位精度的慣例,首次實現了包括衰減門和寫入強度門在內的所有496個線性層的4比特量化。實驗表明,該方案在MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench及RULER檢索等基準測試中,性能與BF16基線幾乎無異(平均差異僅-0.52),同時將模型體積壓縮至17.5 GiB,預填充速度提升14-19%。文章深入剖析了NVFP4塊縮放機制、門投影的魯棒性、Delta規則噪聲抑制特性及量化誤差隨上下文稀釋等現象,揭示了混合模型中循環部分反而更易量化的機制原因,為工業界部署高效混合架構LLM提供了實用指南。
在混合架构大语言模型的发展进程中,如何平衡推理效率与长上下文处理能力始终是核心挑战。传统的混合模型通常将softmax注意力机制与线性注意力层(如Gated DeltaNet,简称GDN)相结合,其中GDN通过固定大小的循环状态来总结上下文信息。然而,社区长期以来存在一种直觉,认为由于误差在长上下文中会随循环累积,因此GDN模块,特别是其关键的衰减门和写入强度门,必须保持8位或16位的高精度,而不能进行低比特量化。本研究直接挑战了这一假设,提出了一种名为Minima的全新量化方案。该方案的核心贡献在于实现了NVFP4 W4A4格式下的全模型量化,涵盖了包括GDN在内的所有496个线性层。这不仅是对传统量化界限的突破,更是对混合模型内部误差传播机制的一次深度验证,旨在证明在合理的量化策略下,循环部分不仅不会成为性能瓶颈,反而可能因其独特的动力学特性而具备极高的量化容忍度,从而为构建更小、更快且保持高性能的混合大模型提供了理论依据与实践路径。
从技术方法来看,Minima方案采用了NVFP4(非均匀向量浮点4位)与W4A4(权重4位、激活4位)的混合量化策略。在具体的网络结构处理上,研究并未采取简单的逐层量化,而是针对GDN的特殊结构设计了精细的量化路径。首先,NVFP4的16元素块缩放机制被用于将残差流中的极端异常值局部化,从而均衡了不同层级角色之间的激活误差。其次,针对以往被认为极其脆弱、容易因量化而失效的门投影层,研究发现其实际上对量化误差最不敏感。通过采用softplus/exponential和sigmoid等参数化方式,这些门投影能够将约11%的GEMM(通用矩阵乘法)误差压缩至仅约2%的输出误差。此外,训练策略上并未引入复杂的微调,而是依赖于模块级校准的NVFP4检查点。
值得注意的是,研究还修复了当模块级校准的检查点被融合为单一GEMM内核服务时出现的全球尺度不匹配问题,并证明了校准后的FP8 KV缓存比例在性能上是免费的,无需额外计算开销即可实现高效推理。在实验设置与关键结果方面,研究在Qwen3.8-27B这一具有48个GDN层和16个注意力层的混合模型上进行了全面评估。基准测试涵盖了困惑度(在4K和32K上下文长度下)、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench以及RULER检索任务(最长支持64K上下文)。结果显示,Minima方案在五项任务的平均指标上与BF16基线仅相差-0.52,差异在种子噪声范围内,表明量化未造成显著性能损失。同时,该方案将模型体积压缩至17.5 GiB,成为对比中最小的模型,且预填充速度提升了14-19%。更令人惊喜的是,在32K上下文下的困惑度差距随位置增加而缩小,显示出良好的长程稳定性。
消融实验进一步揭示了四个关键机制:一是NVFP4块缩放均衡了误差;二是门投影的鲁棒性;三是Delta规则递归将注入的噪声保持在平坦高原上,并在数百步内遗忘状态脉冲,因为每次写入都会沿当前键方向覆盖状态;四是每令牌量化成本随上下文增加而被稀释而非累积,这解释了为何长上下文性能并未恶化。这项研究的行业意义与潜在影响深远。首先,它提供了一个实用的量化配方:量化一切并分发KV比例,这极大地简化了混合架构LLM的部署流程。对于开源社区而言,Minima模型权重已公开,促进了高效混合模型的研究与复现。在工业落地方面,17.5 GiB的体积和14-19%的速度提升使得在消费级或边缘设备上部署27B级别的混合大模型成为可能,显著降低了推理成本。对于后续研究,本文揭示的"循环部分反而是量化容易部分"的机制解释,挑战了现有的量化直觉,可能引导研究者重新评估其他循环神经网络或状态空间模型(如Mamba)的量化潜力。此外,对KV缓存校准的免费性证明也为优化长上下文推理的内存占用提供了新思路。总体而言,这项工作不仅验证了NVFP4在混合模型中的有效性,更为下一代高效、长上下文大语言模型的量化部署奠定了坚实的理论与实践基础。
Sources
FAQ
Minima量化方案是什么?它做出了什么突破?
Minima是一种NVFP4 W4A4全模型量化方案,首次将Qwen3.8-27B混合大模型全部496个线性层(含Gated DeltaNet的衰减门与写入强度门)压缩到4比特,打破了循环层必须保留8/16位精度的旧惯例。
这项研究为什么重要?对部署有什么影响?
量化后模型体积降至17.5 GiB,预填充速度提升14-19%,六大基准平均性能与BF16基线仅差约0.52%,使27B级混合大模型有望在消费级设备上低成本部署,显著降低推理门槛。
接下来值得关注什么?
研究揭示循环部分反而更易量化,挑战了现有直觉。下一步可关注Minima权重开源后在Mamba等状态空间模型上的复现,以及免费KV缓存校准对长上下文推理内存的进一步优化。