DSAQuant:面向視頻生成的去噪階段對齊量化感知訓練框架

Published 2026-09-03 · AI Daily — AI-assisted deep research, methodology & disclosure

視頻擴散模型在文本到視頻生成領域取得了顯著進展,但其高昂的記憶體與計算成本嚴重阻礙了實際部署。儘管量化感知訓練(QAT)是壓縮模型的有效手段,但現有方法在視頻生成中常導致視覺細節、紋理保真度和清晰度的嚴重退化。本文深入剖析了這一現象的根源,指出傳統量化管道採用與時間步無關的設計,忽視了視頻去噪過程的分階段特性。為此,作者提出了DSAQuant框架,通過去噪階段導向的監督機制,在訓練早期保留教師蒸餾以穩定結構規劃,而在後期轉向目標驅動優化以增強細節重建。在推理階段,該框架引入去噪階段門控引導,在最終去噪步驟禁用CFG,防止量化誤差被放大為高頻偽影。在Wan和CogVideoX系列模型上的實驗表明,DSAQuant在W4A4和W3A3設置下均優於現有SOTA基線,在激進的W3A3量化下VBench平均分提升高達6.60,同時保持了強大的文本視頻對齊能力。

视频扩散模型(VDMs)近年来在文本到视频生成任务中展现了令人瞩目的性能,能够生成高质量且连贯的动态视觉内容。然而,这些模型庞大的参数量和计算复杂度使其在实际部署中面临巨大的内存与算力挑战,成为阻碍其广泛落地的主要瓶颈。量化感知训练(QAT)作为一种在训练阶段模拟量化误差的技术,被视为在不增加推理运行时开销的前提下压缩和加速生成模型的有效途径。尽管现有的QAT方法在保留提示词语义、整体布局和粗略运动方面表现尚可,但在应用于视频生成时,量化后的模型往往会出现严重的视觉细节丢失、纹理保真度下降以及图像清晰度受损的问题。

这一现象不仅影响了生成内容的视觉质量,也限制了量化技术在高端视频生成模型中的应用潜力。因此,如何在不牺牲细节质量的前提下实现高效量化,成为当前视频生成领域亟待解决的关键科学问题。本文旨在揭示这一退化现象的内在机理,并提出一种全新的量化训练框架,以突破现有方法的性能瓶颈,推动视频扩散模型在资源受限环境下的实用化进程。针对上述挑战,本文深入剖析了传统量化管道的设计缺陷,发现其核心问题在于采用了与时间步无关(timestep-agnostic)的量化策略,忽视了视频去噪过程固有的分阶段功能特性。

视频扩散模型的去噪过程并非均匀分布,早期去噪步骤主要负责建立全局结构和运动轨迹,而中期和晚期步骤则专注于细化局部外观和高频细节。基于这一深刻洞察,作者提出了DSAQuant(Denoising-Stage-Aligned Quantization-aware training),一种去噪阶段对齐的量化感知训练框架。在训练阶段,DSAQuant引入了去噪阶段导向的监督机制,该机制在早期去噪步骤中保留教师蒸馏,以确保全局结构的稳定规划,防止因量化导致的结构坍塌;而在后期去噪步骤中,则转向目标驱动优化,重点增强对细节的重建能力。这种分阶段的监督策略使得模型能够根据不同去噪阶段的任务需求,动态调整量化误差的容忍度和优化方向,从而在结构稳定性和细节保真度之间取得最佳平衡。

在推理阶段,DSAQuant进一步提出了去噪阶段门控引导(Denoising-Stage Gated Guidance)策略。传统的分类器自由引导(CFG)机制在生成过程中起到增强语义对齐的作用,但在量化模型中,CFG可能会在最终的去噪步骤中放大由量化引入的高频误差,导致生成图像出现伪影。DSAQuant通过在最后几个去噪步骤中动态禁用CFG,有效防止了量化误差的累积和放大,从而提升了最终生成图像的清晰度和细节质量。为了验证该方法的有效性,作者在Wan和CogVideoX两大主流视频生成模型家族上进行了广泛的实验,并在W4A4(4位权重,4位激活)和W3A3(3位权重,3位激活)两种极端量化设置下进行了评估。

实验结果显示,DSAQuant consistently超越了现有的SOTA QAT基线方法。特别是在激进的W3A3量化设置下,DSAQuant使得VBench的平均得分提升了高达6.60分,同时在保持强大文本视频对齐能力的同时,显著改善了视觉细节和纹理质量。消融实验进一步证实了去噪阶段导向监督和门控引导策略各自的关键作用,证明了将量化训练和推理与视频扩散的分阶段特性对齐的重要性。DSAQuant的提出对视频生成领域的开源社区和工业落地具有深远的意义。首先,它提供了一种无需修改模型架构即可显著提升量化模型性能的新范式,为其他生成模型的量化优化提供了宝贵的参考思路。其次,通过在不牺牲视觉质量的前提下大幅降低模型的计算和内存需求,DSAQuant使得在边缘设备或资源受限环境中部署高质量视频生成模型成为可能,极大地拓展了视频生成技术的应用场景。此外,该工作强调了理解模型内部机制(如去噪阶段的差异性)对于优化模型性能的重要性,激励后续研究更加关注模型行为与优化策略之间的深层联系。随着视频生成技术在娱乐、教育、设计等领域的广泛应用,DSAQuant所代表的精细化量化技术将成为推动行业降本增效、实现大规模落地的关键基础设施之一,为构建更高效、更普惠的AI视频生成生态奠定坚实基础。

Sources

FAQ

DSAQuant是什么?它解决了什么问题?

DSAQuant是一种面向视频扩散模型的去噪阶段对齐量化感知训练框架,通过将训练与推理对齐到去噪阶段,解决量化导致的视觉细节和纹理严重退化问题。

DSAQuant为什么重要?会带来哪些影响?

它能在保持画质的同时大幅降低内存和算力需求:在Wan和CogVideoX模型上,W3A3激进量化下VBench平均分提升6.60,使高质量视频生成可在边缘设备和资源受限环境中部署。

接下来值得关注什么?

值得关注DSAQuant向更多视频扩散模型与更低比特量化扩展的效果,以及去噪阶段对齐思路能否启发其他生成模型的压缩优化,推动视频生成在边缘设备上规模化落地。