幻影增益:给自改进审计装上"对照组"这面镜子
语言模型自改进评估正从看平均准确率,转向追踪模型具体在哪些个体问题上获得或丧失能力。本文对 Qwen3-8B 上三轮 rank-32 LoRA 自训练进行审计,并设置一个走完全相同流程的冻结对照组作为标尺。结果识别出七种测量失效,每一种在缺失对照组时都会反转一项已报告的结论。文章揭示标准实践中的陷阱:仅凭单次贪心解码台账,能在未训练模型上凭空制造出能力变化,本质是推理批处理的产物;而区分"获取"与"锐化"的扩张统计量则给模型赋予了 0.280 的虚高速率。作者主张以每问题的精确检验替代朴素阈值,并在错误发现率控制下工作。审计还发现,外部蒸馏提升了基座模型难以触及的问题,而三种自训练形式均未做到。
这篇论文解决的是语言模型自改进评估中长期被忽视的测量可靠性问题。随着模型自我训练成为常态,学界判断一个模型是否"变强了",越来越不再看整体平均准确率的提升,而是聚焦于它究竟 gain 还是 lose 了哪些具体的个体问题。追踪这些问题的获得与丧失,本质上是对两个带有噪声的估计量做差分,因此极易受到测量伪影的干扰。作者针对 Qwen3-8B 上进行的三轮 rank-32 LoRA 自训练展开审计,关键设计在于设置了一个经过完全相同训练流程的冻结对照组,从而将自训练流程本身引入的噪声与真实的能力变化区分开来。基于这一对照设计,作者识别出七种测量失效,每一种在缺失对照组时都会把一项已报告的结论反转过来。这一核心贡献的意义在于,它首次系统性地揭示:许多看似稳健的自改进结论,实际上建立在有缺陷的测量方法之上,而非模型真实能力的提升。文章由此呼吁,任何关于自改进的断言都必须附带一个独立测量的空值基准,否则结论可能完全是测量 artefact 的产物。 在技术方法上,文章首先剖析了两种被广泛采用的标准做法。第一种是仅凭单次贪心解码来构建能力账本的做法,作者发现这种设计能在从未训练的模型上"制造"出能力变化,其根源在于推理阶段的批处理(inference batching)效应,即解码顺序与批处理交互产生的系统性偏差。第二种是用于区分问题"获取"(acquisition)与"锐化"(sharpening)的扩张统计量,作者指出它给同一个未训练模型赋予了 0.280 的速率,这一明显违背直觉的结果进一步暴露了该统计量的失效。针对自然阈值修复方案,作者通过在该冻结比较中估算发现,其空值本身并不为零,因此这一修复无法在复制中存活。为此,作者提出以每问题的精确检验来替代,即在错误发现率(FDR)控制下,将每个问题与一个合并基线(pooled baseline)进行精确检验。这一方法在任意留出副本上都没有检测到显著变化,并且在改变多重检验规则、错误率与合并池大小时保持稳定,展现出良好的鲁棒性。 在实验设置与关键结果方面,作者构建了一组在数据流、数据量与评估方式上均匹配的不同实验臂(arms),并在此基础上展开审计。核心发现是:外部蒸馏显著提升了基座模型难以触及的问题,而三种形式的自训练则未能做到,这一不对称性在统计上稳健。然而进一步的回归分析拒绝将这种不对称性归因于自训练本身的缺陷,而是指出它其实是蒸馏具有更大整体增益的副产品(p < 10^-8)。在基座模型永远无法触及的那批更小的问题上,证据尚不充分(inconclusive);与此同时,自训练导致基座模型原本能正确解决的问题以远高于测量下限的速率被破坏。这些消融式发现共同指向一个结论:自训练并非简单地带来净收益,它在某些问题上失效的同时,还会侵蚀已有的能力。 在行业意义与潜在影响上,这篇文章为开源社区与工业界敲响了警钟。当前大量自改进工作依赖便捷的测量手段,而本文证明这些手段可能系统性地高估甚至虚构改进效果。其提出的解决方案具有低成本、易推广的特点:所需的空值基准无需任何新实验,只需利用多臂研究本身已拥有的基座副本即可构建,尽管实际中很少有人拥有如此之多的副本。这一洞见对后续研究具有指导意义,它要求任何关于自改进的断言都必须附带独立测量的空值基准。对工业落地而言,这意味着在投入资源进行自训练之前,应当重新审视评估管线,避免基于有缺陷的测量做出错误的工程决策。文章最终强调,过渡层面的审计必须为其报告的每一个统计量配备单独测量的空值,这一原则或将重塑语言模型自改进的评估标准。