无需额外训练的稀疏权重分解:大模型电路提取的新范式

针对预训练Transformer模型缺乏可解释电路单元的问题,研究提出稀疏权重分解(SWD)方法。该方法通过将线性投影权重矩阵分解为两个稀疏因子,利用共享中间坐标作为可寻址电路单元,无需训练独立替换网络。实验显示,SWD在GPT-2、Qwen2.5及Qwen3.5-27B等模型上,以更少激活边和单元实现同等电路充分性与必要性目标,且训练数据用量不足传统Transcoder方法的1%。这一突破显著降低了机制可解释性分析的门槛,为高效电路提取提供了新范式。

大型预训练Transformer模型虽然性能卓越,但其内部运作机制往往如同黑盒,难以直接提取出具有明确语义或功能意义的"电路单元"。现有的机制可解释性研究通常依赖于学习辅助的稀疏表示或专门训练稀疏模型来暴露这些单元,然而这一过程不仅引入了巨大的额外计算开销,还可能导致所分析的表示与原始预训练模型之间产生保真度差距,即"分析对象"与"真实模型"不一致。为了解决这一核心痛点,本研究提出了一种名为稀疏权重分解(Sparse Weight Decomposition, SWD)的创新方法。SWD的核心贡献在于它无需训练任何独立的替换网络,而是通过对预训练模型中的线性投影权重矩阵进行参数化重参数化,将其分解为两个稀疏因子。这两个因子共享的中间坐标直接构成了可独立寻址的电路单元,从而使得研究人员能够沿用现有的评分、选择和消融等电路提取工作流,同时保持了与原始模型的高度一致性。这种设计巧妙地平衡了可解释性与计算效率,避免了传统方法中常见的表征偏移问题。在技术实现层面,SWD的具体方法极具巧思。

它不再试图从头学习一个新的稀疏编码器,而是直接对现有的权重矩阵进行数学上的分解。具体而言,SWD将每一个线性层的权重矩阵分解为两个稀疏矩阵的乘积或组合形式,这两个稀疏矩阵共享一组中间坐标。这些共享坐标在数学上对应于原始特征空间中的特定维度或组合,它们在分解后的结构中成为可被单独访问和操作的"原子单元"。这种参数化表示使得SWD能够直接嵌入到标准的电路提取流程中,包括对单元重要性的评分、基于评分的单元选择以及通过消融实验验证因果关系的步骤。由于没有引入额外的网络层或复杂的训练目标,SWD在保持模型原始推理路径不变的前提下,赋予了权重矩阵内部结构以清晰的电路语义。此外,该方法还具备灵活性,允许通过微调非零因子值来适应全模型的替换需求,进一步扩展了其应用场景。这种基于权重分解的思路,从根本上改变了以往通过外部学习来逼近内部机制的做法,转而通过内部结构的重新参数化来直接揭示机制。

为了验证SWD的有效性,研究者在多个主流大语言模型上进行了广泛的实验,包括GPT-2、Qwen2.5以及参数量高达27B的Qwen3.5。在单矩阵替换任务中,SWD展现出了惊人的数据效率:它在仅使用不到1%的训练数据的情况下,达到了与Transcoder及其他强基线方法相当的外推保真度。这意味着SWD能够以更低的成本拟合原始模型的输入输出行为。在更关键的电路提取指标上,如电路的充分性(Sufficiency)和必要性(Necessity),SWD在匹配同等保真度的前提下,使用了更少的激活读写边和更少的选定单元。这一结果表明,SWD提取出的电路单元更加精炼和高效,去除了冗余信息。此外,研究还展示了SWD在全模型替换中的有效性,即通过对所有注意力机制和MLP层的权重矩阵进行分解并微调非零因子值,SWD能够成功重建整个模型的行为。消融实验进一步证实,这种稀疏分解结构对于提取具有因果效力的电路单元至关重要,而非零因子的微调则是实现高保真全模型替换的关键步骤。

这些实验结果共同证明了SWD在效率、准确性和通用性上的优越表现。SWD方法的提出对机制可解释性领域具有深远的行业意义。首先,它极大地降低了进行电路提取的计算门槛。由于无需训练庞大的辅助模型,研究人员可以在资源受限的环境下快速对大型模型进行可解释性分析。其次,SWD提供的零数据变体(Zero-data variant)为无需额外训练数据的即时分析提供了可能,这使得对模型每一步推理过程的细粒度分析变得更加可行和广泛。对于开源社区而言,SWD提供了一种标准化的、基于权重分解的分析框架,有助于统一不同研究间的比较基准。在工业落地方面,高效的电路提取有助于开发者理解模型的决策逻辑,发现潜在的安全漏洞或偏见,从而提升模型的可信度和安全性。未来,SWD可能成为机制可解释性研究的基础工具之一,推动该领域从定性分析向定量、高效、大规模自动化分析的方向发展,为构建更透明、更可控的人工智能系统奠定技术基础。

Sources