すべてのアブレーションは用量である:カウンターウェイトと自己修復の見かけ

Published · AI Daily — AI-assisted deep research, methodology & disclosure

本論文は、言語モデルの「自己修復」という長年の謎に統一的な説明を与える。これはアブレーションへの適応的反応ではなく、コンポーネントの重みにあらかじめ固定された利得の表れだという。任意の因果的介入を符号付き強度軸λ上の一点として捉え、下流ユニットの応答が仿射則 E_r(λ)=own_r+γ_r・λ に従うことを示す。傾き γ_r の符号がカウンターウェイトか補強的ユニットかを決定する。Gemma、Qwen、LLaMA、Mistral の4モデルで81方向中68方向が法則に従い、GPT-2 Smallの IOI 回路では到達可能な10ヘッド中7ヘッドが法則に従い、全てカウンターウェイトであった。

背景と課題の所在

メカニスティック解釈可能性の研究者たちは、トランスフォーマー言語モデル内のある構成要素をアブレーション(手術的に除去またはゼロ化)すると、他の構成要素があたかもネットワークが自ら修復しているかのように振る舞いを調整して補償するように見える、という不思議な現象を繰り返し観察してきた。この現象は「自己修復」と呼ばれ、最初はアテンションヘッドの研究で記録され、その後 MLP ニューロンなどより細かい単位にも拡張された。これまでで最も体系的だった先行研究は、自己修復はノイズが多く文脈によって一貫性がなく、単一の根本原因を共有している可能性は低いと結論づけていた。この結論は、この分野に予測理論を欠いたままにした。実務者は現象を事後的に観察することしかできず、アブレーションを実行する前にその大きさや方向を予測することができなかった。これは、構成要素の挙動への因果関係を特定する主要な手段としてアブレーションに依存する因果的解釈可能性研究を損なうものであった。

Areeb Ahmad、Pratinav Seth、Vinay Kumar Sankarapu の三名は、この謎に新たな視点を与える。アブレーションは特別で独立した操作ではなく、連続した反事実的介入強度の軸上の一点——しばしば未校正で極端な一点——に過ぎないという視点である。ある構成要素の下流への効果が、完全に除去する前からすでに介入の強さに応じて滑らかに変化しているのであれば、アブレーション後に「修復」のように見えるものは、その同じ滑らかな応答をある特定の点で評価したものに過ぎない可能性がある。本論文の中心的主張は、自己修復には複数ではなく単一の統一的機構が存在し、その機構とは重みそのものに固定された線形感度であるということだ。

コアアーキテクチャと技術原理

著者らは反事実的介入を符号付きスカラー λ として形式化し、因果的に重要な構成要素に加えられる対比的摂動の強さと方向を表す。従来のアブレーション——ニューロン、ヘッド、方向をゼロ化すること——は、質的に異なる操作ではなく、この λ 軸上の未校正なサンプル点として再定義される。その上で、任意の細粒度の下流ユニット r がどのように応答するかを支配する仿射則を提案する:E_r(λ) = own_r + γ_r・λ。own_r は介入とは独立したユニットの基準行動を表し、γ_r はそのユニット固有の固定された傾き係数である。重要なのは、γ_r はアブレーション時にのみ働くものではなく、通常の非アブレーション状態を含むあらゆる摂動強度の下でその出力を形作る、ユニットの既存の重みに内在する一定の性質だということである。

γ_r の符号はそのユニットの質的な役割を決定する。除去された信号に対して負の傾きを持つユニットは「カウンターウェイト」となり、摂動の方向に逆らって押し返すため、見かけ上の補償が生じる。一方、正の傾きを持つユニットは逆に摂動を補強する。γ_r は固定されモデルの重みから導出可能であるため、著者らはアブレーションを実際に実行して経験的に結果を観察する前に、静的な重み解析だけからユニットの見かけ上の自己修復応答の大きさを予測できることを示す。これにより自己修復は、動的で創発的な現象から、あらかじめ存在する線形構造の読み出しへと再定義され、適応的に見えた機構が通常の線形代数へと還元される。

実用性と検証結果

研究チームはこの仿射則を、Gemma、Qwen、LLaMA、Mistral という、アーキテクチャと学習方式が異なる4つのモデルファミリーにわたる事実判定分類タスクで検証した。これらのモデル全体で、MLP ニューロン、OV(出力・価値)ニューロン、そして重み行列の分解によって得られる特異方向を、注目すべき細粒度ユニットとして調査した。検証対象となった81の下流方向のうち68がこの法則に従い、この適合率は単一機構という主張を支えるに十分高く、同時に約16%が完全には適合しなかったという事実にも正直に向き合っている——この境界事例への誠実さが、論文の信頼性をむしろ強めている。

第二の独立した検証場として、GPT-2 Small における広く研究された間接目的語同定(IOI)回路を調査した。これは解釈可能性コミュニティが長年ベンチマーク回路として用いてきたタスクである。使用された特定の介入が到達可能な10個のアテンションヘッドのうち7個が仿射則に従い、その7個すべてがカウンターウェイトに分類された点は注目に値する。この結果は、現代の指示チューニング済みモデルによる分類設定と、古典的な小規模モデル回路の両方にわたるアーキテクチャ横断・タスク横断の一貫性を示し、仿射則が単一のモデルファミリーやタスク設計の偶然の産物ではないことを示す最も強力な証拠となっている。

業界への影響と今後の展望

解釈可能性ツールを構築する実務者にとっての実際的な意味は、自己修復がもはやアブレーション実験ごとに経験的に再測定しなければならない予測不能な交絡要因として扱われる必要がないということである。あるユニットの γ_r が重みだけから推定できるのであれば、欺瞞、拒否、事実判定といった安全性に関わる回路を監査するチームは、高コストなアブレーション走査に踏み切る前に、どの構成要素がカウンターウェイトである可能性が高いかを事前に絞り込み、仮説と検証の間のフィードバックループを引き締めることができる。これはまた方法論的なリスクも浮き彫りにする。選んだ λ がこの軸上のどこに位置するかを考慮しないアブレーション研究は、論文間で比較不能な介入を比較している可能性がある。あるモデルで未校正のアブレーション強度が、別のモデルの軸上の同じ点に対応する保証はないからである。

仿射則に適合しなかった残り16%の方向、そして到達可能だが法則に従わなかった3つの IOI ヘッドは、現在の理論の正直な境界を示している。これらは非線形的な相互作用、高次効果、あるいは固定された傾きでは捉えられない文脈依存的な役割を持つユニットである可能性が高い。この成果の上に構築される今後の解釈可能性研究は、これらの例外を平均化して消し去るのではなく、きちんと特徴づける必要がある。反例を静かに捨て去る統一理論は、著者らが正そうとした「異常をノイズとして片付ける」という同じ過ちを繰り返すことになるからだ。

Sources

FAQ

本論文が提案する仿射則とは何か。

下流ユニット r の介入強度 λ への応答は E_r(λ) = own_r + γ_r・λ に従い、own_r は基準行動、γ_r はそのユニット固有の固定傾きであり、その符号がカウンターウェイトか補強ユニットかを決定する。

どのモデルとタスクで法則が検証されたか。

Gemma、Qwen、LLaMA、Mistral の4モデルでの事実判定タスクで81方向中68方向が法則に従い、GPT-2 Small の IOI 回路では到達可能な10ヘッド中7ヘッドが法則に従い、全てカウンターウェイトに分類された。

論文はアブレーションという操作をどう再定義したか。

アブレーションは質的に特殊な独立した操作ではなく、符号付き反事実的介入強度軸λ上の未校正な一標本点として再定義された。