모든 절제는 용량이다: 평형추와 자가 복구의 착시
이 논문은 언어 모델에서 오랫동안 수수께끼였던 '자가 복구' 현상에 통일된 설명을 제시한다. 이는 절제(ablation)에 대한 적응적 반응이 아니라 구성 요소 가중치에 이미 고정되어 있던 이득이 드러난 것이라는 주장이다. 임의의 인과적 개입을 부호가 있는 강도 축 λ 위의 한 점으로 보면, 하류 단위의 반응은 아핀 법칙 E_r(λ)=own_r+γ_r·λ를 따르며, 기울기 γ_r의 부호가 평형추 단위인지 강화 단위인지를 결정한다. Gemma, Qwen, LLaMA, Mistral 네 모델에서 81개 방향 중 68개가 이 법칙을 따랐고, GPT-2 Small의 IOI 회로에서는 도달 가능한 10개 헤드 중 7개가 법칙을 따랐으며 모두 평형추였다.
기술 배경과 문제 정의
메커니즘 해석가능성 연구자들은 트랜스포머 언어 모델의 한 구성 요소를 절제(ablation, 수술적으로 제거하거나 0으로 만드는 것)하면 다른 구성 요소들이 마치 네트워크가 스스로를 복구하는 것처럼 행동을 조정해 빠진 부분을 보상하는 듯 보이는, 당혹스러운 현상을 반복적으로 관찰해왔다. '자가 복구'라 불리는 이 현상은 처음에는 어텐션 헤드 연구에서 기록되었고, 이후 MLP 뉴런 등 더 세밀한 단위로 확장되었다. 지금까지 가장 체계적이었던 선행 연구는 자가 복구가 잡음이 많고 맥락에 따라 일관성이 없으며, 여러 사례에 걸쳐 단 하나의 근본 원인을 공유하지는 않을 것이라 결론지었다. 이 결론 때문에 이 분야는 예측 가능한 이론 없이 남겨졌다. 연구자들은 사후에 현상을 관찰할 수는 있었지만, 절제 실험을 실행하기 전에 그 크기나 방향을 미리 예측할 수는 없었고, 이는 구성 요소에 행동을 귀속시키는 핵심 도구로 절제에 의존하는 인과적 해석가능성 연구를 약화시켰다.
Areeb Ahmad, Pratinav Seth, Vinay Kumar Sankarapu 세 저자는 이 수수께끼를 새로운 관점으로 다시 바라본다. 절제는 특별하고 독립적인 연산이 아니라, 연속적인 반사실적 개입 강도 축 위의 한 점일 뿐이며, 그것도 흔히 극단적이고 보정되지 않은 점이라는 것이다. 어떤 구성 요소의 하류 효과가 완전히 제거되기 전부터 개입 강도에 따라 이미 매끄럽게 변한다면, 절제 이후 '복구'처럼 보이는 것은 그저 그 매끄러운 반응을 축 위의 특정 지점에서 평가한 값일 수 있다. 이 논문의 핵심 주장은 자가 복구에는 여러 개가 아니라 단 하나의 통일된 메커니즘이 존재하며, 그 메커니즘은 가중치 자체에 이미 고정되어 있는 선형 민감도라는 것이다.
핵심 아키텍처와 기술 원리
저자들은 반사실적 개입을 부호가 있는 스칼라 λ로 형식화하며, 이는 인과적으로 중요한 구성 요소에 가해지는 대조적 교란의 강도와 방향을 나타낸다. 뉴런, 헤드, 또는 방향을 0으로 만드는 기존의 절제 방식은 질적으로 구별되는 연산이 아니라, 이 λ 축 위의 보정되지 않은 표본점으로 재해석된다. 이어서 그들은 임의의 세밀한 하류 단위 r이 어떻게 반응하는지를 지배하는 아핀 법칙을 제시한다: E_r(λ) = own_r + γ_r·λ. 여기서 own_r은 개입과 무관한 단위의 기준 행동을 나타내고, γ_r은 그 단위에 고유한 고정 기울기 계수다. 중요한 점은 γ_r이 절제가 일어날 때만 작동하는 것이 아니라, 통상적인 비절제 상태를 포함한 모든 교란 강도에서 출력을 결정하는, 해당 단위의 기존 가중치에 내재된 상수적 속성이라는 것이다.
γ_r의 부호는 그 단위의 질적 역할을 결정한다. 제거된 신호에 대해 음의 기울기를 갖는 단위는 교란 방향에 맞서는 '평형추(counterweight)'가 되어 겉보기에 보상처럼 보이는 효과를 만들어내고, 양의 기울기를 갖는 단위는 오히려 그 교란을 강화한다. γ_r이 고정되어 있고 모델 가중치로부터 도출 가능하기 때문에, 저자들은 실제로 절제를 실행하여 결과를 경험적으로 관찰하기 전에, 정적인 가중치 분석만으로 어떤 단위의 겉보기 자가 복구 반응 크기를 예측할 수 있음을 보인다. 이는 자가 복구를 창발적이고 동적인 현상에서 이미 존재하는 선형 구조를 읽어내는 것으로 재정의하며, 적응적으로 보였던 메커니즘을 평범한 선형대수로 환원시킨다.
실전 평가와 활용
연구팀은 이 아핀 법칙을 Gemma, Qwen, LLaMA, Mistral이라는 아키텍처와 학습 방식이 서로 다른 네 모델 계열에 걸친 사실 판단 분류 과제에서 검증했다. 이들 모델 전반에서 MLP 뉴런, OV(출력-값) 뉴런, 그리고 가중치 행렬 분해로 얻은 특이 방향을 관심 있는 세밀한 단위로 조사했다. 검증된 81개 하류 방향 중 68개가 이 법칙을 따랐으며, 이 적합률은 단일 메커니즘이라는 주장을 지지할 만큼 충분히 높으면서도, 완전히 맞지 않은 약 16%의 사례에 대해서도 투명하게 밝혔다. 이러한 경계 사례에 대한 솔직함은 논문의 신뢰성을 약화시키기보다 오히려 강화한다.
두 번째로, 독립적으로 선택된 검증 무대로서 GPT-2 Small에서 널리 연구된 간접 목적어 식별(IOI) 회로를 조사했는데, 이는 해석가능성 커뮤니티가 수년간 기준 회로로 사용해온 과제다. 사용된 특정 개입으로 도달 가능한 열 개의 어텐션 헤드 중 일곱 개가 아핀 법칙을 따랐고, 특히 그 일곱 개 모두가 평형추로 분류되었다는 점이 주목할 만하다. 이는 절제된 신호에 맞서는 고정 기울기를 가진 헤드들이다. 현대의 지시 튜닝 모델을 이용한 분류 설정과 고전적인 소형 모델 회로를 모두 포괄하는 이 아키텍처 간, 과제 간 일관성은 아핀 법칙이 특정 모델 계열이나 특정 과제 설계의 우연한 산물이 아니라는 가장 강력한 증거다.
업계 영향과 향후 전개
해석가능성 도구를 구축하는 실무자들에게 실질적인 함의는, 자가 복구가 더 이상 절제 실험마다 매번 경험적으로 다시 측정해야 하는 예측 불가능한 교란 요인으로 취급될 필요가 없다는 것이다. 어떤 단위의 γ_r을 가중치만으로 추정할 수 있다면, 기만, 거부, 사실 판단을 담당하는 회로처럼 안전과 관련된 회로를 점검하는 팀은 값비싼 절제 스캔에 들어가기 전에 어떤 구성 요소가 평형추일 가능성이 높은지 사전에 선별하여, 가설과 검증 사이의 피드백 루프를 좁힐 수 있다. 이는 또한 방법론적 위험도 드러낸다. 선택한 λ가 이 축 위 어디에 위치하는지를 고려하지 않는 절제 연구는, 한 모델에서 보정되지 않은 절제 강도가 다른 모델의 축 위 같은 지점에 대응한다는 보장이 없기 때문에, 논문들 간에 통약 불가능한 개입을 비교하고 있을 수 있다.
아핀 법칙에 맞지 않은 나머지 16%의 방향들, 그리고 도달 가능했지만 법칙을 따르지 않은 세 개의 IOI 헤드는 현재 이론의 솔직한 경계를 나타낸다. 이들은 비선형 상호작용, 고차 효과, 또는 고정된 기울기로는 포착할 수 없는 맥락에 따라 역할이 바뀌는 단위일 가능성이 높은 후보들이다. 이 결과 위에 구축될 향후 해석가능성 연구는 이러한 예외를 평균내어 지워버리기보다 명확히 규명해야 한다. 반례를 조용히 버리는 통일 이론은 저자들이 바로잡고자 했던, '이상 현상을 잡음으로 치부하는' 동일한 실수를 반복하게 될 것이기 때문이다.
Sources
FAQ
논문이 제시한 아핀 법칙은 무엇인가?
하류 단위 r의 개입 강도 λ에 대한 반응은 E_r(λ) = own_r + γ_r·λ를 따르며, own_r은 기준 행동, γ_r은 해당 단위에 고유한 고정 기울기이고, γ_r의 부호가 평형추인지 강화 단위인지를 결정한다.
이 법칙은 어떤 모델과 과제에서 검증되었는가?
Gemma, Qwen, LLaMA, Mistral 네 모델에서의 사실 판단 과제에서 81개 하류 방향 중 68개가 법칙을 따랐고, GPT-2 Small의 IOI 회로에서는 도달 가능한 10개 헤드 중 7개가 법칙을 따랐으며 모두 평형추로 분류되었다.
논문은 절제(ablation)라는 개념을 어떻게 재정의했는가?
절제는 질적으로 특별하고 독립적인 연산이 아니라, 반사실적 개입 강도를 나타내는 연속적인 부호 축 λ 위의 보정되지 않은 표본점으로 재정의되었다.