월드 모델은 무엇을 잊어야 하는가: 지속적 적응을 위한 계층적 보존
지속 학습은 이미 본 데이터에서의 성능 하락을 실패로 간주한다. 그러나 월드 모델의 예측 대상은 변화하는 환경이어서, 한때 정확했던 지식이 나중에 틀릴 수 있고 이를 버리는 것은 오히려 올바른 동작이다. 이 논문은 불변성 시간 척도에 따른 계층적 보존을 주장한다. 물리 법칙과 물체 영속성 같은 불변량은 절대 수정하지 말아야 하고, 개별 사실은 환경이 바뀌는 즉시 고쳐야 한다. 기존 망각 지표는 올바른 수정과 파국적 망각을 구분하지 못해 동결된 모델을 최상위로 평가한다. 저자들은 불변량 회귀 테스트와 수정 지연을 집계 없이 함께 보고하는 차등 보존을 제안한다.
arXiv 논문 2610.03713은 작아 보이지만 근본적인 질문을 던진다. 지속적으로 적응하는 월드 모델은 무엇을 잊어야 하는가. 저자들의 핵심 주장은 지속 학습이 오래 써 온 평가 관행이 월드 모델에는 맞지 않는다는 것이다. 먼저 범위를 밝혀 둔다. 이 글은 논문 초록만을 근거로 쓰였다. 초록에는 구체적인 수치 결과가 없으므로 숫자를 지어내지 않고, 논문이 제시하는 개념과 메커니즘, 평가 주장을 분석한다. 1. 문제의 출발점 고전적 지속 학습에서 예측 대상은 정상적이다. 고양이 사진은 오늘도 고양이이고 십 년 뒤에도 고양이다. 이 전제에서는 옛 과제의 정확도 하락이 분명한 실패 신호이며, 이를 파국적 망각이라 부른다. 평균 망각량이나 후방 전이 같은 망각 지표 대부분이 이 전제 위에 서 있다. 옛 데이터에서의 성능이 처음에 가까울수록 좋은 모델이라는 생각이다. 월드 모델은 다르다. 예측 대상이 환경 자체이고 환경은 변한다. 창고가 선반을 재배치한다. 교차로에 신호등이 새로 생긴다. 로봇 그리퍼가 닳아 동역학이 달라진다. 모델이 예전에 배운 「선반은 왼쪽에 있다」는 당시에는 맞았지만 지금은 틀렸다. 옛 답에 매달리는 모델이 진짜 결함을 가진 것이다. 이 맥락에서 망각은 결함이 아니라 필요한 동작이다. 2. 핵심 주장: 불변성 시간 척도에 따른 계층적 보존 저자들은 월드 모델 안의 지식이 균질하지 않다고 말한다. 절대 수정하면 안 되는 부류가 있다. 물리 법칙, 중력의 방향, 가려진 물체가 사라진 것이 아니라는 물체 영속성이 그렇다. 다른 부류는 개별 사실로, 어떤 방의 배치나 특정 기계의 현재 상태가 해당한다. 이쪽은 환경이 바뀌면 곧바로 다시 써야 한다. 둘 사이에는 변화 속도가 제각각인 중간 층도 있다.
이것이 「계층적 보존」의 뜻이다. 지식 층마다 불변성 시간 척도에 따라 보존 정책을 달리한다. 진짜 불변량에 가까울수록 보존 요구는 엄격하고 수정은 막아야 한다. 구체적인 개별 사실에 가까울수록 요구는 느슨하고, 수정을 장려하며 빨라야 한다. 논문은 인접 분야에 이미 비정상 진실을 다룬 연구가 있다고 짚는다. 개념 드리프트 문헌은 분포가 변하는 데이터를 다룬다. 언어 모델의 시간적 사실성 연구는 누가 어떤 직책을 맡고 있는지처럼 시간이 지나면 낡는 사실을 다룬다. 그러나 월드 모델에 대해서는 문제가 체계적으로 정식화된 적이 없다. 월드 모델에는 특별한 점이 있다. 절대 수정하면 안 되는 지식도 함께 인코딩한다는 것이다. 언어 모델은 많은 사실이 낡아도 되지만, 월드 모델은 물리적 상식이 퇴화하도록 둘 수 없다. 3. 현재 지표가 실패하는 이유 초록에는 날카로운 지적이 있다. 표준 망각 지표는 아주 다른 두 모델을 구분하지 못한다. 하나는 낡은 지식을 올바르게 수정한 모델이고, 다른 하나는 파국적 망각을 겪은 모델이다. 둘 다 옛 데이터에서 정확도가 떨어지므로 지표에는 같은 신호로 보인다. 더 나쁜 점은, 이 지표가 완전히 동결된 모델을 최상위에 놓는다는 것이다. 동결 모델은 옛 데이터에서 전혀 변하지 않기 때문이다. 환경에 한 번도 적응하지 않은 모델이 이기는 것은 평가의 목적에 어긋난다. 기존 물리 추론 벤치마크에도 비슷한 빈틈이 있다. 초록에 따르면 이들은 동결된 체크포인트만 평가한다. 한 시점의 모델을 볼 뿐, 이어지는 적응 흐름 속의 행동은 보지 않는다. 즉 지속적 적응 자체를 측정하지 않는다. 4. 차등 보존: 두 지표, 집계 없음 제안된 평가는 차등 보존(differential retention)이다. 적응 흐름 전체에 걸쳐 두 가지를 나란히 보고하도록 요구한다. 첫째는 불변량 회귀 테스트다. 각 적응 단계에서 물리 법칙과 물체 영속성 같은 불변량을 겨냥한 테스트로 아무것도 깨지지 않았는지 확인한다. 기억해야 할 것은 기억한다는 규칙을 맡는다.
둘째는 수정 지연이다. 환경이 바뀐 뒤 모델이 관련 개별 사실을 갱신하기까지 얼마나 걸리는가. 잊어야 할 것은 빨리 잊는다는 규칙을 맡는다. 핵심은 「집계하지 않는다」는 점이다. 둘을 하나의 점수로 합치면 한쪽을 희생해 다른 쪽에서 높은 점수를 얻을 수 있다. 동결 모델은 불변량에서 만점을 받고 수정 지연은 무한대가 된다. 따로 보고해야 이 거래가 드러난다. 평가 연구에서 단일 종합 점수를 경계하는 흐름과도 맞는다. 5. 개발자와 기업에 주는 영향 로보틱스, 자율주행, 디지털 트윈, 에이전트 시뮬레이션을 만드는 팀에게 이 틀은 쓸 만한 점검표가 된다. 먼저 불변량 집합을 명시하고 업데이트마다 도는 회귀 테스트로 만든다. 다음으로 통제된 환경 변화를 주입하는 실험을 설계해 수정 지연을 잰다. 그리고 지속 학습 방법을 고를 때 옛 과제의 보존율만 봐서는 안 된다. 강한 정규화로 옛 지식을 묶어 두는 방법은 옛 데이터에서는 좋아 보여도 이 프로토콜에서는 수정 지연이 높게 드러난다.
벤치마크 제작자에게는 변화가 더 크다. 평가 대상이 정적인 체크포인트에서 적응 흐름, 곧 계속 갱신되는 모델의 전체 경로로 옮겨 간다. 비용은 오른다. 통제된 변화가 담긴 환경 시퀀스를 만들고, 어떤 지식은 다시 써야 하고 어떤 지식은 안 되는지 변화마다 주석을 달아야 한다. 6. 한계와 남은 질문 첫째, 계층을 긋기가 어렵다. 어떤 지식이 진짜 불변량이고 어떤 것이 긴 시간 동안 안정적인 사실일 뿐인가. 경계가 항상 분명하지는 않다. 물리는 영원해 보이지만 모델이 가진 것은 물리의 근사이고, 근사는 수정이 필요할 수 있다. 둘째, 수정 지연을 재려면 환경이 언제 바뀌었는지에 대한 분명한 표지가 필요하다. 실제 배포에서 변화는 점진적이고 눈에 띄지 않으며, 무슨 일이 일어났는지 모델에 알려 주는 사람은 없다. 셋째, 초록이 제시하는 것은 개념적 틀과 평가 주장이며 수치는 없다. 이런 입장 논문의 가치는 문제를 다시 정의하는 데 있고, 실제 효과는 구체적인 월드 모델과 환경에서 앞으로 검증되어야 한다. 인용할 때 이 점을 유념해야 한다.
7. 앞으로의 방향 가능한 방향으로는 변화 사건에 주석이 달린 월드 모델용 적응 흐름 벤치마크가 있다. 불변량과 개별 지식을 따로 저장하는 구조, 예를 들어 서로 다른 파라미터 부분공간이나 메모리 모듈을 쓰는 방법도 있다. 수정 지연을 학습 목표로 삼는 방안도 있다. 더 나아가 모델이 어떤 지식이 낡았는지 스스로 판단해야 하며, 이는 환경이 변했음을 감지하는 것이고 개념 드리프트 탐지와 자연스럽게 이어진다. 요컨대 이 논문은 새로운 네트워크를 제안하지 않는다. 문제와 채점 규칙을 다시 정의한다. 스스로 갱신하는 모델을 평가할 때는 얼마나 잊었는가를 묻지 말고, 잊어야 할 것을 잊었고 기억해야 할 것을 아직 기억하는가를 물어야 한다고 논문은 일깨운다.