GUARD: 대형 추론 모델에 '자연스러운 망각'을 가르치다
새 논문은 GUARD 기법을 제안해, 대형 추론 모델이 사고 사슬 안에서 민감 정보를 자연스럽게 잊도록 하여 급작스러운 거부나 조작된 내용 없이 전반적 추론 성능을 유지한다.
대형 추론 모델의 보급이 확대되면서, 그동안 상대적으로 덜 논의되었던 보안 문제 하나가 부상하고 있다. 이런 모델들은 최종 답변을 내놓기 전에, 단계별 추론 과정을 보여주는 눈에 보이는 사고 사슬(chain-of-thought)을 생성한다. 문제는 이 중간 추론 단계에서 민감하거나 보호받아야 할 정보가 새어 나올 수 있다는 점이다. 심지어 모델이 최종적으로 내놓는 답변 자체는 완전히 깨끗하고 문제없어 보일 때조차 그렇다. 이는 최종 답변만 검토하는 기존 방식이 추론 모델 앞에서는 뚜렷한 사각지대를 갖는다는 뜻이다. 모델은 "생각하는" 단계에서 해서는 안 될 말을 한 뒤, "답하는" 단계에서는 아무 일도 없었던 것처럼 행동할 수 있다.
Zeyu Yan, Guanghao Zhou, Minghui Qiu, Ming Gao, Cen Chen 다섯 명이 발표한 신규 논문 "GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation"(arXiv:2609.21677)는 바로 이 문제에 대한 체계적인 해법을 제시한다. 논문은 기존의 머신 언러닝(machine unlearning) 기법들이 대체로 대상 콘텐츠를 직접 억제하거나 모델 내부 표현을 변경하는 방식으로 작동하지만, 공통된 결함을 공유한다고 지적한다. 그것은 바로 무엇을 제거할지에만 초점을 맞출 뿐, 제거한 뒤 모델이 어떻게 행동해야 하는지는 다루지 않는다는 점이다. 이런 거친 개입 방식은 두 가지 부작용을 낳기 쉽다. 하나는 제거된 정보의 빈자리를 메우기 위해 모델이 새로운 내용을 지어내는 작화(confabulation)이고, 다른 하나는 출력이 불안정하거나 앞뒤가 맞지 않게 되는 현상이다.
"자연스러운 망각 궤적"이란 무엇인가
GUARD의 핵심 주장은 효과적인 언러닝이 단순히 침묵으로 끝나서는 안 된다는 것이다. 그것은 일관되고 정보를 누설하지 않는 추론 경로를 만들어내야 하며, 그 경로는 자연스럽게 일관된 거부형 응답으로 이어져야지, 갑작스럽거나 앞뒤가 맞지 않는 비답변이 되어서는 안 된다. 이를 위해 GUARD는 원래대로라면 안전하지 않은 유출 궤적이 될 것을, 안전한 "탈출 궤적"(exit trajectory)으로 변환한다. 구체적으로는 안내 토큰(guidance tokens)을 도입해 파라미터가 고정된, 변경되지 않은 모델을 이러한 안전한 출구로 유도한 다음, 그 행동을 모델 자체의 파라미터에 직접 증류한다. 그 결과 모델은 실행 시점의 개입이나 필터링 계층에 의존하지 않고도 스스로 자연스러운 망각을 나타내게 된다.
왜 실행 시 필터링이 아니라 파라미터로의 증류가 중요한가
이 설계상의 선택은 곱씹어볼 가치가 있다. 만약 언러닝이 순전히 실행 시점의 안전 필터에만 의존한다면, 그 필터 자체가 새로운 공격 표면이 되어버린다. 탈옥형 프롬프트, 조작된 추론 경로, 혹은 중간 출력에 대한 직접적인 간섭 등을 통해 이 필터링 계층을 우회하거나 제거할 수 있는 사람이라면, 이른바 "잊혀진" 콘텐츠를 다시 표면화시킬 수 있다. 반면 안전한 탈출 행동을 모델의 파라미터에 직접 증류하는 것은, 그 행동을 외부 패치가 아니라 모델 자체의 고유한 능력으로 만든다는 뜻이며, 이는 여러 형태의 적대적 추출 시도에 본질적으로 더 강건하다.
망각 이후에 일어나는 일의 품질을 측정하기 위해, 논문은 자연 망각 추론 점수(Natural Forgetting Reasoning Score)라는 새로운 지표도 도입한다. 이 지표의 의의는 유출 여부라는 한 가지 질문에서 멈추지 않는다는 데 있다. 그것은 대체 콘텐츠 자체의 품질, 즉 구조가 일관적인지, 어조가 자연스러운지, 그리고 조작이나 환각의 위험이 얼마나 남아 있는지를 추가로 평가한다. 다시 말해, 침묵을 지키는 데는 성공했지만 앞뒤가 안 맞거나 명백히 지어낸 대체 텍스트를 내놓는 모델은, 이 틀 안에서는 여전히 고품질 망각의 사례로 인정받지 못한다. 이는 기존 연구들이 언러닝을 평가할 때 유출률이라는 단일 지표에만 의존하는 경향이 있었다는 실질적인 공백을 메운다.
논문에 따르면 연구팀은 기존 벤치마크에서 GUARD를 테스트했고, 전반적인 추론 성능은 대체로 유지되면서도 유해한 정보 유출은 상당히 줄어드는 결과를 확인했다. 이 결과가 더 폭넓은 재현을 통해 뒷받침된다면, 이 접근법은 모델을 유용하게 만드는 추론 능력을 희생시키지 않으면서도 특정 지식을 모델의 행동에서 안전하게 제거하는 길을 제시하는 셈이며, 이는 더 투박한 언러닝 기법들이 그동안 달성하기 어려워했던 균형이다.
Sources
FAQ
GUARD 기법은 어떤 문제를 해결하는가?
GUARD는 추론 모델의 사고 사슬을 통한 민감 정보 유출을 해결하며, 갑작스러운 중단이나 조작된 내용 대신 자연스러운 망각과 부드러운 거부 전환을 모델에 가르친다.
안전한 행동을 파라미터에 증류하는 것이 실행 시 필터링보다 나은 이유는?
실행 시 필터는 그 자체가 우회되거나 제거되어 새로운 공격 표면이 될 수 있지만, 파라미터 증류는 안전한 탈출을 모델 고유의 능력으로 만들어 추출 공격에 더 강건하다.
자연 망각 추론 점수는 무엇을 측정하는가?
유출 여부뿐 아니라 대체 콘텐츠의 구조적 일관성, 자연스러움, 조작/환각 위험까지 평가해 기존 유출률 지표를 보완한다.