Chaque ablation est une dose : contrepoids et l'illusion de l'auto-réparation

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Cet article propose un mécanisme unifié pour le phénomène énigmatique d'auto-réparation dans les modèles de langage : un gain fixe déjà présent dans les poids des composants, et non une réponse adaptative à l'ablation. En formulant toute intervention causale comme un point sur un axe signé λ, les auteurs montrent que les unités en aval suivent une loi affine, E_r(λ)=own_r+γ_r·λ, dont le signe de la pente distingue les unités contrepoids des unités renforçantes. Testée sur Gemma, Qwen, LLaMA et Mistral, la loi est vérifiée pour 68 directions sur 81 ; sur le circuit IOI de GPT-2 Small, sept des dix têtes atteignables la suivent, toutes comme contrepoids.

Contexte et définition du problème

Les chercheurs en interprétabilité mécaniste ont observé à plusieurs reprises un phénomène déroutant : lorsqu'on ablate — c'est-à-dire qu'on retire chirurgicalement ou qu'on met à zéro — un composant d'un modèle de langage à transformeur, d'autres composants semblent ajuster leur comportement pour compenser la pièce manquante, comme si le réseau se réparait activement lui-même. Cet effet, baptisé « auto-réparation », a d'abord été documenté dans les études sur les têtes d'attention, puis étendu aux neurones MLP et à d'autres unités fines. L'étude la plus systématique menée jusqu'ici sur ce phénomène concluait que l'auto-réparation est bruitée, incohérente selon les contextes, et peu susceptible de partager une cause unique sous-jacente dans les nombreux cas où elle apparaît. Cette conclusion laissait le domaine sans théorie prédictive : les praticiens pouvaient observer l'effet mais ne pouvaient pas anticiper son ampleur ni sa direction avant de lancer une ablation, ce qui fragilise les travaux d'interprétabilité causale qui s'appuient sur l'ablation comme outil principal pour attribuer un comportement à des composants.

Areeb Ahmad, Pratinav Seth et Vinay Kumar Sankarapu reprennent cette énigme sous un nouvel angle : l'ablation n'est pas une opération spéciale et isolée, mais simplement un point — souvent extrême et non calibré — sur un axe continu d'intensité d'intervention contrefactuelle. Si l'effet en aval d'un composant varie déjà de façon continue selon l'intensité de la perturbation, y compris avant même son retrait complet, alors ce qui ressemble à une « réparation » après une ablation pourrait n'être que cette même réponse continue évaluée en un point particulier de cet axe. Le pari central de l'article est que l'auto-réparation repose sur un mécanisme unique et non sur plusieurs, et que ce mécanisme est une sensibilité linéaire fixe, déjà inscrite dans les poids eux-mêmes.

Cœur architectural et principes techniques

Les auteurs formalisent l'intervention contrefactuelle comme un scalaire signé λ, représentant l'intensité et la direction d'une perturbation contrastive appliquée à un composant causalement important. L'ablation conventionnelle — mettre à zéro un neurone, une tête ou une direction — est reformulée comme un échantillon non calibré sur cet axe λ, plutôt que comme une opération qualitativement distincte. Ils proposent ensuite une loi affine régissant la réponse de toute unité en aval r à grain fin : E_r(λ) = own_r + γ_r·λ. Ici, own_r capture le comportement de référence de l'unité, indépendant de l'intervention, et γ_r est un coefficient de pente fixe, propre à cette unité. Fait crucial, γ_r ne s'active pas uniquement pendant l'ablation ; c'est une propriété constante des poids existants de l'unité, qui façonne sa sortie sous n'importe quelle intensité de perturbation, y compris dans le régime ordinaire, sans ablation.

Le signe de γ_r détermine le rôle qualitatif de l'unité : une pente négative par rapport au signal retiré fait de l'unité un « contrepoids » qui résiste à la direction perturbée, produisant une apparence de compensation, tandis qu'une pente positive renforce au contraire la perturbation. Comme γ_r est fixe et dérivable à partir des poids du modèle, les auteurs montrent qu'il est possible de prédire l'ampleur de la réponse apparente d'auto-réparation d'une unité directement à partir d'une analyse statique des poids, sans avoir besoin d'exécuter l'ablation et d'observer le résultat empiriquement au préalable. Cela recadre l'auto-réparation : d'un phénomène dynamique et émergent, elle devient la simple lecture d'une structure linéaire préexistante, réduisant ce qui semblait être un mécanisme adaptatif à de l'algèbre linéaire ordinaire.

Évaluation pratique et applications

L'équipe a testé la loi affine sur une tâche de classification de verdicts factuels couvrant quatre familles de modèles aux architectures et recettes d'entraînement distinctes : Gemma, Qwen, LLaMA et Mistral. Sur ces modèles, ils ont examiné les neurones MLP, les neurones OV (output-value) et les directions singulières obtenues par décomposition des matrices de poids comme unités d'intérêt à grain fin. La loi s'est vérifiée pour 68 des 81 directions en aval testées, un taux de réussite suffisamment élevé pour soutenir l'affirmation d'un mécanisme unique, tout en restant transparent sur les environ 16 % de cas qui ne correspondaient pas parfaitement — une honnêteté sur les cas limites qui renforce plutôt qu'affaiblit la crédibilité de l'article.

Comme second banc d'essai, choisi indépendamment, ils ont examiné le circuit bien étudié d'identification indirecte de l'objet (IOI) dans GPT-2 Small, une tâche que la communauté de l'interprétabilité utilise depuis des années comme circuit de référence. Parmi les dix têtes d'attention atteignables par l'intervention spécifique utilisée, sept suivaient la loi affine, et il est notable que ces sept têtes étaient toutes classées comme contrepoids — des têtes dont la pente fixe s'oppose au signal ablaté. Cette cohérence entre architectures et entre tâches, couvrant à la fois un cadre de classification avec des modèles modernes ajustés par instructions et un circuit classique de petit modèle, constitue la preuve la plus solide avancée que la loi affine n'est pas un artefact d'une seule famille de modèles ou d'une seule conception de tâche.

Impact sur le secteur et perspectives

Pour les praticiens qui développent des outils d'interprétabilité, l'implication pratique est que l'auto-réparation n'a plus besoin d'être traitée comme un facteur de confusion imprévisible devant être mesuré empiriquement après chaque expérience d'ablation. Si le γ_r d'une unité peut être estimé à partir des seuls poids, les équipes auditant des modèles pour des circuits sensibles à la sécurité — comme ceux responsables de la tromperie, du refus ou des verdicts factuels — pourraient présélectionner les composants probablement contrepoids avant de s'engager dans des balayages d'ablation coûteux, resserrant ainsi la boucle de rétroaction entre hypothèse et test. Cela met aussi en lumière un risque méthodologique : des études d'ablation qui ne tiennent pas compte de la position de leur λ choisi sur cet axe pourraient comparer des interventions incommensurables entre articles, puisqu'une intensité d'ablation non calibrée sur un modèle ne correspond pas nécessairement au même point sur l'axe d'un autre modèle.

Les 16 % restants de directions qui ne correspondaient pas à la loi affine, ainsi que les trois têtes IOI atteignables mais non conformes, marquent la limite honnête de la théorie actuelle — vraisemblablement des candidats pour des interactions non linéaires, des effets d'ordre supérieur, ou des unités dont le rôle évolue avec le contexte d'une manière qu'une pente fixe ne peut saisir. Les futurs travaux d'interprétabilité s'appuyant sur ce résultat devront caractériser ces exceptions plutôt que de les moyenner, car une théorie unificatrice qui écarterait discrètement ses contre-exemples répéterait l'erreur même de rejet du bruit que les auteurs cherchaient à corriger.

Sources

FAQ

Quelle est la loi affine proposée dans l'article ?

La réponse d'une unité en aval r à l'intensité d'intervention λ suit E_r(λ) = own_r + γ_r·λ, où own_r est le comportement de référence et γ_r une pente fixe propre à l'unité ; le signe de γ_r indique si elle est contrepoids ou renforçante.

Sur quels modèles et tâches la loi est-elle validée ?

Sur une tâche de verdict factuel couvrant Gemma, Qwen, LLaMA et Mistral, 68 des 81 directions en aval suivaient la loi ; sur le circuit IOI de GPT-2 Small, sept des dix têtes atteignables la suivaient, toutes classées comme contrepoids.

Comment l'article redéfinit-il l'ablation ?

L'ablation est redéfinie comme un point d'échantillonnage non calibré sur un axe signé continu λ d'intensité d'intervention contrefactuelle, plutôt que comme une opération qualitativement spéciale et isolée.