每次消融都是一次劑量:配重機制與自我修復的假象

Published · AI Daily — AI-assisted deep research, methodology & disclosure

研究者提出一條統一解釋:當語言模型某個組件被消融時,其他組件看似「自我修復」,其實是模型權重中早已固化的固定增益在起作用。他們把任何因果干預抽象為一個帶符號強度軸 λ,證明下游單元的響應服從仿射關係 E_r(λ)=own_r+γ_r·λ,斜率 γ_r 的正負決定該單元是對抗還是強化被移除的訊號。在 Gemma、Qwen、LLaMA、Mistral 四個模型家族的事實判斷任務上,81 個下游方向中有 68 個遵循該定律;在 GPT-2 Small 的 IOI 電路上,可觸達的十個注意力頭中有七個遵循定律,且全部為配重頭。

技术背景与问题定义

可解释性研究者反复观察到一个令人困惑的现象:当他们消融(即手术式移除或置零)语言模型中的某个组件后,其他组件似乎会调整自身行为去弥补缺失,仿佛整个网络在主动"自我修复"。这一现象被称为"自我修复",最早在注意力头的研究中被记录,后来又扩展到 MLP 神经元等更细粒度的单元。此前最系统的一项研究得出结论:自我修复是嘈杂的、在不同情境下表现不一致的,并且不太可能存在单一的统一解释。这个结论让整个领域缺少一套可预测的理论——研究者只能事后观察该现象,却无法在运行消融实验之前就预判其幅度与方向,这直接削弱了因果可解释性研究对消融这一核心工具的依赖。

Areeb Ahmad、Pratinav Seth 和 Vinay Kumar Sankarapu 三位作者重新审视这个难题,提出了一个关键的视角转换:消融并非一种特殊且独立的操作,而只是一条连续的反事实干预强度轴上的一个点——而且往往是一个未经校准的极端点。如果一个组件的下游效应本就随干预强度平滑变化,那么消融之后看似"修复"的现象,完全可能只是这条平滑曲线在某个特定点上的取值。论文的核心论断是:自我修复存在单一的统一机制,而这个机制就是模型权重中早已固化的固定线性增益。

核心架构与原理解析

作者将反事实干预形式化为一个带符号的标量 λ,代表施加于某个因果关键组件的对比性扰动的强度与方向。传统的消融操作——将神经元、注意力头或某个方向置零——被重新表述为这条 λ 轴上一个未经校准的采样点,而不再是一种性质独特的操作。在此基础上,他们提出了一条支配任意细粒度下游单元 r 响应方式的仿射定律:E_r(λ) = own_r + γ_r·λ。其中 own_r 表示该单元独立于干预之外的基线行为,γ_r 是该单元特有的固定斜率系数。关键在于,γ_r 并非只在消融发生时才被激活,而是该单元现有权重中固定存在的属性,它在任何扰动强度下都会塑造该单元的输出,包括在完全没有消融的正常状态下。

γ_r 的符号决定了该单元的性质角色:相对于被移除信号呈负斜率的单元会成为"配重"(counterweight),它会对抗扰动的方向,从而产生出表面上的补偿效果;而正斜率的单元则会反过来强化这个扰动。由于 γ_r 是固定的,并且可以直接从模型权重中推导出来,作者证明了无需先真正运行消融实验观察结果,仅通过静态权重分析就能预测某单元表面上"自我修复"反应的大小。这把自我修复从一种涌现的、动态的现象,重新定义为对一套早已存在的线性结构的读出——把看似具有适应性的机制,还原成了普通的线性代数。

关键功能与实战评估

研究团队在一个事实判断分类任务上检验了这条仿射定律,覆盖了四个架构与训练方式各不相同的模型家族:Gemma、Qwen、LLaMA 和 Mistral。在这些模型中,他们将 MLP 神经元、OV(输出-价值)神经元,以及通过权重矩阵分解得到的奇异方向,作为研究的细粒度单元。在所测试的 81 个下游方向中,有 68 个遵循该定律,这个命中率既足够支撑"单一机制"的论断,也坦诚地指出了大约 16% 不完全吻合的例外情况——这种对边界情况的诚实态度,反而增强了论文的可信度,而非削弱它。

作为第二个、独立选取的验证场景,他们检验了 GPT-2 Small 中被广泛研究的间接宾语识别(IOI)电路,这是可解释性社区多年来用作基准电路的经典任务。在该特定干预能触达的十个注意力头中,有七个遵循仿射定律,而且这七个全部被归类为配重——即其固定斜率与被消融信号方向相反的注意力头。这种跨架构、跨任务的一致性,既涵盖了现代指令微调模型上的分类场景,也涵盖了经典的小模型电路,是支持仿射定律并非某一模型家族或某一任务设计的偶然产物的最有力证据。

行业影响与未来演进

对于正在构建可解释性工具的从业者而言,这项工作的现实意义在于:自我修复不再需要被当作一种每次消融实验后都必须重新实测的不可预测干扰项。如果某单元的 γ_r 仅凭权重就能估算出来,那么负责审计模型安全相关电路——例如负责欺骗、拒答或事实判断的电路——的团队,就能在投入昂贵的消融扫描实验之前,预先筛查出哪些组件可能是配重,从而收紧假设与验证之间的反馈循环。这也揭示了一个方法论上的风险:如果消融研究没有考虑其所选 λ 在这条轴上的具体位置,那么不同论文之间的消融强度可能根本不可比,因为一个模型上未经校准的消融强度,并不保证对应另一个模型轴上的同一个点。

剩下那 16% 不符合仿射定律的方向,以及那三个可触达却不遵循定律的 IOI 注意力头,标出了当前理论诚实的边界——它们很可能涉及非线性交互、高阶效应,或者角色会随上下文变化、而固定斜率无法捕捉的单元。基于这一成果的后续可解释性研究,需要去刻画这些例外情况,而不是把它们平均掉,因为一个悄悄抛弃反例的统一理论,恰恰会重犯作者本想纠正的"把异常归为噪声"的老错误。

Sources

FAQ

论文提出的仿射定律具体是什么?

下游单元 r 对干预强度 λ 的响应服从 E_r(λ) = own_r + γ_r·λ,其中 own_r 是基线行为,γ_r 是该单元固定的斜率系数,正负号决定其是配重还是强化单元。

该定律在哪些模型和任务上得到验证?

在 Gemma、Qwen、LLaMA、Mistral 四个模型家族的事实判断任务上,81 个下游方向中 68 个遵循该定律;在 GPT-2 Small 的 IOI 电路中,可触达的十个注意力头中有七个遵循定律,且全部为配重头。

论文如何重新定义“消融”这一操作?

论文将消融重新表述为反事实干预强度轴 λ 上一个未经校准的采样点,而非一种性质特殊、独立于常规扰动之外的操作。