拒絕丟棄:通過優化層稀疏性實現高效大語言模型訓練與推理

Published 2026-09-04 · AI Daily — AI-assisted deep research, methodology & disclosure

本文針對層丟棄(Layer Dropout)在大型語言模型預訓練中逐漸被棄用的現象,通過大規模實驗重新評估其價值。研究指出,儘管此前有觀點認為丟棄會損害精度,但本文通過量化分析並優化分佈、時間表及超參數,證明了在同等訓練算力下,層丟棄能降低損失函數;或在固定步數下節省高達25%的訓練FLOPs。此外,該方法顯著提升了推理效率,通過早期退出、中間層跳過及自投機解碼等技術,實現最高1.5倍的推理加速且精度損失可忽略。基於Cerebras CS-3系統,在271M至8.2B參數模型及160B token數據集上進行的2400多次實驗驗證了該策略在大規模訓練中的可靠性與泛化能力。

在大型语言模型(LLM)的发展进程中,层丢弃(Layer Dropout),亦称随机深度(Stochastic Depth),曾因其能加速训练、提升准确率及增强对零样本层剪枝的鲁棒性而在视觉和语言Transformer中广泛应用。然而,随着模型规模和数据集的急剧扩张,这一技术却在LLM的预训练配方中逐渐销声匿迹。尽管已有部分研究指出丢弃机制可能导致精度下降,但缺乏系统性研究来量化这一负面影响并提出缓解方案。本研究的核心贡献在于彻底扭转了这一趋势,通过详尽的缩放分析和最佳实践建立,证明了层丢弃不仅不应被抛弃,反而应成为当前最先进LLM训练流程中的标准组件。研究团队不仅揭示了层丢弃在训练阶段的效率优势,还深入挖掘了其在后训练阶段的潜力,为构建高效能、低延迟的大语言模型提供了全新的理论依据与实践路径,填补了该领域在大规模场景下对层稀疏性优化研究的空白。在技术方法层面,本研究并未简单套用传统的丢弃策略,而是对层丢弃的分布、时间调度以及优化器超参数进行了精细化的联合优化。研究团队发现,通过合理配置层丢弃的概率分布与训练阶段的时间表,并结合特定的优化器设置,可以在不增加计算负担的前提下显著改善模型收敛特性。

具体而言,在保持相同训练FLOPs(浮点运算次数)的情况下,引入优化后的层丢弃机制能够使模型达到更低的损失值。这种技术路径的核心在于利用训练过程中的随机性来增强模型的泛化能力,同时通过稀疏化层连接来减少冗余计算。此外,研究还探讨了如何利用训练阶段形成的层稀疏性结构,在后训练阶段实施早期退出机制、中间层跳过策略以及自投机解码(Self-Speculative Decoding)。这些方法充分利用了模型内部不同层的表达能力差异,在推理时动态跳过对最终结果贡献较小的层,从而在不牺牲模型智能表现的前提下,大幅降低推理阶段的计算复杂度。实验设置与关键结果部分涵盖了极其广泛的规模与数据量,以确保结论的普适性。所有预训练实验均在Cerebras CS-3系统上运行,涵盖了从2.71亿参数到82亿参数的多种模型架构,训练数据量最高达到1600亿token。研究团队进行了超过2400次训练实验,这一庞大的实验基数为结论的可靠性提供了坚实支撑。

关键结果显示,对于给定的训练步数,采用层丢弃的LLM能够实现更低或相当的验证集损失,同时节省高达25%的训练FLOPs,这意味着在同等资源约束下可以训练更大的模型或更快的迭代。在推理优化方面,结合早期退出和自投机解码等技术,模型实现了最高1.5倍的推理速度提升,且精度损失微乎其微。消融实验进一步证实了层分布、时间调度及超参数优化对最终性能的关键作用,排除了单一因素导致性能提升的可能性,确立了多因素协同优化的必要性。从行业意义与潜在影响来看,这项研究对开源社区和工业落地具有深远影响。对于工业界而言,节省25%的训练FLOPs意味着显著的算力成本降低,使得在有限预算下训练更大规模模型成为可能。同时,推理阶段的加速直接提升了用户体验,降低了部署成本,特别适用于对延迟敏感的应用场景。对于开源社区,本研究提供了一套经过大规模验证的最佳实践,鼓励开发者重新审视并集成层丢弃技术,从而推动更高效的基础模型开发。此外,该研究为后续关于模型稀疏性、动态推理架构以及高效训练策略的研究开辟了新的方向,证明了通过巧妙的训练策略设计,可以在不改变模型架构的前提下,实现训练效率与推理性能的双重突破,为下一代高效大语言模型的设计提供了重要的参考范式。

Sources

FAQ

这项研究主要发现了什么?

研究重新评估了层丢弃技术在LLM训练中的价值,发现通过优化,它能在同等算力下降低损失,或节省高达25%的训练FLOPs,并加速推理达1.5倍。

为什么这项发现对大型语言模型很重要?

它能显著降低LLM训练和部署的算力成本,同时提高推理速度,对工业界和开源社区都具有深远影响,推动高效LLM发展。

未来在LLM开发中可以关注哪些方面?

可以关注如何在现有模型架构下,通过层稀疏性优化、动态推理和高效训练策略,实现训练与推理性能的双重突破。