翁丽莲深度解析 Scaling Laws:现代预训练中的测量偏差与不变量漂移

Published · AI Daily — AI-assisted deep research, methodology & disclosure

知名 AI 研究者翁丽莲发布万字长文深度反思神经网络 Scaling Laws。全面剖析 Token 质量饱和、分词器词表漂移以及下游基准评测污染如何扭曲幂律预测,并提出标准化测量不变量框架以重塑预训练推断。

引言与历史审视:缩放定律的神话与现实困境

自 2020 年 Kaplan 等人发表开创性的神经缩放定律(Neural Scaling Laws)论文以来,整个大语言模型(LLM)工业界便被一条看似简洁有力的幂律曲线所统治:只要以固定比例协同增加模型参数量、训练数据量与计算预算,交叉熵损失(Cross-Entropy Loss)就会以确定的幂律衰减。这一经验规律在过去数年里成为了全球科技巨头投入百亿乃至千亿美元算力进行「蛮力缩放」(Brute-force Scaling)的根本信仰支柱。从 GPT-3 到 GPT-4,再到后续一系列千亿级开源与闭源基础模型,工程团队习惯于在小规模模型(如 100M 至 1B 参数)上拟合幂律斜率,并据此直接推断数千亿甚至万亿参数规模下的资源配置与模型表现。

然而,伴随着 2025 至 2026 年前沿模型预训练规模逼近 10^26 甚至更高 FLOPs 的极限,这种基于简单幂律外推的工程范式正遭遇前所未有的系统性危机。在工业界多个核心预训练流水线中,研究人员频繁遭遇所谓的「缩放墙」(Scaling Wall):小模型上测定的完美幂律在模型扩展至千亿规模时发生非线性偏离,损失函数下降显著放缓甚至停滞;更严重的是,即使某些预训练运行在形式上保持了平滑的验证集损失下降,其在下游权威基准测试(如 GSM8K、HumanEval 或 MMLU-Pro)上的实际性能跃升却呈现出不可预测的方差。

面对这一弥漫于业界的焦虑与分歧,前 OpenAI 关键安全研究主管、知名 AI 学者翁丽莲(Lilian Weng)正式发布了万字深度综述《Scaling Laws, Carefully: Measurement Errors and Invariant Shifts in Modern Pre-training》。在这篇极具里程碑意义的剖析中,翁丽莲没有停留于「缩放定律是否已死」的非黑即白争论,而是以极其严谨的统计物理与实验科学视角,指出当前工业界对 Scaling Laws 的应用存在大量根本性的测量偏差(Measurement Errors)与不变量漂移(Invariant Shifts)。我们过去所崇拜的平滑幂律,很多时候并不是基础物理规律的体现,而是粗糙度量指标、未经校准的数据分布以及非标准化评测共同制造的统计幻觉。

测量偏差的三大根源:数据饱和、分词漂移与基准污染

翁丽莲在文中系统地拆解了扭曲现代预训练缩放观测的三大核心机制。第一大测量偏差源于**高质量训练数据的边际质量衰减与饱和效应**。在经典 Chinchilla 定律的假设中,训练数据集被假定为从单一且无限平稳的数据分布中独立同分布(i.i.d.)采样的 Token 流。但在当今十万亿乃至数十万亿 Token 规模的真实预训练中,这种假设早已荡然无存。互联网上由人类编写的优质原生文本几乎已被挖掘殆尽,工业界被迫在预训练中大规模混入合成数据(Synthetic Data)、重写清洗文本以及多轮过滤语料。 当预训练数据从高信息熵的维基百科、教科书和高质量代码库,扩展至低质量网页爬取及由弱模型生成的合成语料时,每个新增 Token 的有效信息增益急剧下降。这种数据密度的动态衰减破坏了计算量与有效知识量之间的固定映射。在小规模实验中,训练集往往仅由最高纯度的数据子集构成;而一旦将计算预算放大百倍,进入训练管道的语料质量梯级不可避免地整体下移。因此,小规模拟合得到的损失下降斜率必然过于乐观,从而在超大规模推断时产生严重的欠拟合与偏差。 第二大关键偏差来自于**分词器(Tokenizer)词表演进与语义密度漂移**。业界习惯于将「每 Token 的负对数似然」(NLL per token)或困惑度(Perplexity)作为衡量缩放的核心指标。然而,分词器并不是一个物理常数。随着多模态统一表示与多语言能力的演进,现代分词器词表规模从早期 GPT-2 的 50K 激增至 128K、256K 乃至 512K。更长的词表意味着相同的文本序列会被切分为更少的 Token,单个 Token 所承载的信息位(Bits)显著增加。翁丽莲严密指出,在跨架构或跨版本对比缩放效率时,若未将损失归一化为基于纯字节级别(Bits per Byte, BPB)的物理不变量,基于 Token 的损失曲线计算将产生高达 15% 到 30% 的人为测量误差,甚至可能得出模型效率提高而实际表达能力下降的荒谬结论。

第三大系统性偏差则是**下游评测基准的非平滑离散化与隐性污染**。在工程实践中,管理层和工程师往往将下游测试集的准确率(Accuracy)视为模型有效缩放的终极判据。但绝大多数现有评测(如多项选择或代码单测通过率)具有强烈的阈值跃迁特性(Emergent Abilities),这些离散指标对于细微的预训练表征优化极不敏感,只有当隐状态表示的置信度突破某个特定临界点时才会爆发式跃升。更为致命的是下游基准污染:当数十万亿规模的语料库遍历全网时,无论是评估题目的原文、变形还是解题思路,都会不可避免地渗入训练集。在小模型阶段,由于容量有限,受污染样本无法被有效过拟合;但在巨量参数模型中,模型能够轻松记住污染模式,从而表现出虚假的高准确率增长,掩盖了真实泛化能力的放缓。

标准化度量体系:确立预训练测量不变量

为了拨开伪缩放的迷雾,翁丽莲在文章中提出了构建现代化预训练测量体系的四大不变量准则(Standardized Measurement Invariants):

1. **统一信息论度量基准(Bits-per-Byte Invariant)**:彻底摒弃依赖于特定 Tokenizer 实现的 token 级困惑度指标。所有跨规模、跨架构的预训练优化,必须统一折算为标准 UTF-8 编码下的字节级比特消耗(BPB)。唯有在字节级别,不同词表规模、不同压缩率分词方案之间的能量消耗与知识容量才具备跨实验的可比性。

2. **有效数据熵加权计算(Entropy-Weighted Compute Budget)**:提出建立数据纯度动态标定机制,计算「有效 FLOPs」(Effective FLOPs)。通过引入参照探针网络,对各批次进入模型的数据流进行动态信息熵评分,修正由于合成数据重复与低质数据稀释带来的虚假计算量膨胀。

3. **连续化下游表征探针(Continuous Representation Probing)**:在监控下游任务能力时,严禁仅依赖二值化的最终正确率。取而代之的是,在目标任务的关键决策点提取模型输出 logits 的边缘后验分布与校准误差(Calibration Error),利用连续的能量距离(Energy Distance)追踪下游能力的平滑演进。

4. **隔离式不可见沙箱评估(Isolated Blind-Box Benchmarking)**:建立物理级隔离的动态基准评测流水线。所有基准测试集不公开于任何公共网络,定期通过受控的逻辑等价变换机制生成新实例,彻底切断下游指标与互联网爬虫语料之间的隐性污染传导链。

工业实践启示与未来技术演进

翁丽莲的这篇长文对于全球大模型基础设施与算法团队具有深远的指导意义。盲目相信未校准的幂律外推不仅会导致数千万美元硬件投资的沉没,更会误导整个算法团队的技术路线演进。在预训练范式步入精细化深水区的今天,粗放的算力堆砌时代已经落幕,取而代之的是建立在精确测量科学之上的系统工程。

从长远来看,预训练缩放定律的重构也将反哺后训练(Post-training)与测试时计算(Test-time Compute)的理论发展。当预训练的基础损失测量回归物理真实,研究人员便能够更加客观地评估何种知识应当在预训练中完成底层压缩,何种复杂推理应当转移至强化学习与思考时间推断阶段。翁丽莲的深刻洞察提醒了整个 AI 社区:在追求宏大通用智能的征途上,保持对实验科学最基本测量准则的谦逊与敬畏,远比沉迷于虚幻的指数神话更为重要。

Sources

FAQ

为什么传统 Scaling Laws 在千亿参数规模时会失效?

传统定律假定数据无限且分布平稳,但在数十万亿级训练中,高质量原生语料耗尽,低纯度合成数据稀释了信息密度,导致边际学习效率急剧衰减。

分词器词表变化如何导致损失测量的系统性偏差?

词表扩充使单个 Token 承载的信息比特显著增加,若直接以 Token 级困惑度评估模型,会产生高达 30% 的测量扭曲,掩盖真实的表征优化进度。

翁丽莲提出的标准化测量不变量有哪些核心要素?

核心包括采用 UTF-8 字节级比特度量(BPB)、引入动态熵加权的有效计算量、使用连续化表征探针,以及建立物理隔离的防污染评测沙箱。