幻影增益:對自改進審計的測量空值檢驗
本文聚焦語言模型自改進評估中的一個核心問題:判斷模型是否真正提升,越來越不依賴平均準確率,而是看它具體 gaining 和 losing 了哪些個體問題。作者對 Qwen3-8B 上三轮 rank-32 LoRA 自訓練進行審計,並設置一個經過完全相同流程的凍結對照組,識別出七種測量失效,每一種在缺失對照組時都會反轉一項已報告的結論。文章揭示標準實踐中潛藏的陷阱:僅憑單次貪心解碼構建的帳本能在未訓練模型上製造出能力變化,本質是推理批處理的產物;區分"獲取"與"銳化"的擴張統計量給該模型賦予了 0.280 的速率。作者提出以每問題的精確檢驗替代自然閾值修復,並在錯誤發現率控制下工作。審計發現外部蒸餾提升了基座模型難以觸及的問題,而三種自訓練形式未能做到。
这篇论文解决的是语言模型自改进评估中长期被忽视的测量可靠性问题。随着模型自我训练成为常态,学界判断一个模型是否"变强了",越来越不再看整体平均准确率的提升,而是聚焦于它究竟 gain 还是 lose 了哪些具体的个体问题。追踪这些问题的获得与丧失,本质上是对两个带有噪声的估计量做差分,因此极易受到测量伪影的干扰。作者针对 Qwen3-8B 上进行的三轮 rank-32 LoRA 自训练展开审计,关键设计在于设置了一个经过完全相同训练流程的冻结对照组,从而将自训练流程本身引入的噪声与真实的能力变化区分开来。基于这一对照设计,作者识别出七种测量失效,每一种在缺失对照组时都会把一项已报告的结论反转过来。这一核心贡献的意义在于,它首次系统性地揭示:许多看似稳健的自改进结论,实际上建立在有缺陷的测量方法之上,而非模型真实能力的提升。文章由此呼吁,任何关于自改进的断言都必须附带一个独立测量的空值基准,否则结论可能完全是测量 artefact 的产物。 在技术方法上,文章首先剖析了两种被广泛采用的标准做法。第一种是仅凭单次贪心解码来构建能力账本的做法,作者发现这种设计能在从未训练的模型上"制造"出能力变化,其根源在于推理阶段的批处理(inference batching)效应,即解码顺序与批处理交互产生的系统性偏差。第二种是用于区分问题"获取"(acquisition)与"锐化"(sharpening)的扩张统计量,作者指出它给同一个未训练模型赋予了 0.280 的速率,这一明显违背直觉的结果进一步暴露了该统计量的失效。针对自然阈值修复方案,作者通过在该冻结比较中估算发现,其空值本身并不为零,因此这一修复无法在复制中存活。为此,作者提出以每问题的精确检验来替代,即在错误发现率(FDR)控制下,将每个问题与一个合并基线(pooled baseline)进行精确检验。这一方法在任意留出副本上都没有检测到显著变化,并且在改变多重检验规则、错误率与合并池大小时保持稳定,展现出良好的鲁棒性。 在实验设置与关键结果方面,作者构建了一组在数据流、数据量与评估方式上均匹配的不同实验臂(arms),并在此基础上展开审计。核心发现是:外部蒸馏显著提升了基座模型难以触及的问题,而三种形式的自训练则未能做到,这一不对称性在统计上稳健。然而进一步的回归分析拒绝将这种不对称性归因于自训练本身的缺陷,而是指出它其实是蒸馏具有更大整体增益的副产品(p < 10^-8)。在基座模型永远无法触及的那批更小的问题上,证据尚不充分(inconclusive);与此同时,自训练导致基座模型原本能正确解决的问题以远高于测量下限的速率被破坏。这些消融式发现共同指向一个结论:自训练并非简单地带来净收益,它在某些问题上失效的同时,还会侵蚀已有的能力。 在行业意义与潜在影响上,这篇文章为开源社区与工业界敲响了警钟。当前大量自改进工作依赖便捷的测量手段,而本文证明这些手段可能系统性地高估甚至虚构改进效果。其提出的解决方案具有低成本、易推广的特点:所需的空值基准无需任何新实验,只需利用多臂研究本身已拥有的基座副本即可构建,尽管实际中很少有人拥有如此之多的副本。这一洞见对后续研究具有指导意义,它要求任何关于自改进的断言都必须附带独立测量的空值基准。对工业落地而言,这意味着在投入资源进行自训练之前,应当重新审视评估管线,避免基于有缺陷的测量做出错误的工程决策。文章最终强调,过渡层面的审计必须为其报告的每一个统计量配备单独测量的空值,这一原则或将重塑语言模型自改进的评估标准。