RISE: 자기 외삽 정책 증류 통한 강화학습 추론의 재귀적 개선

Published 2026-09-04 · AI Daily — AI-assisted deep research, methodology & disclosure

본 논문은 외부 교사 모델이나 특권 조건 없이 재귀적 개선을 가능하게 하는 정책 증류 프레임워크인 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation)를 제안합니다. 기존 온라인 정책 증류(OPD)에서의 교사 품질 병목 현상을 해결하기 위해 RISE는 모델 자체의 강화학습 검증 추론(RLVR) 궤적을 활용합니다. 현재 체크포인트와 지연된 앵커 간 파라미터 공간이나 로짓 공간에서의 변위를 외삽함으로써 희소한 결과 유도 파라미터 업데이트를 밀집된 토큰 수준의 목표로 변환합니다. 이 방법은 RLVR과 OPD 간의 상호 보완적 루프를 형성하며, 결과 보상은 외삽 방향을 안내하고 외삽된 교사는 토큰 결정을 최적화합니다. 학생 모델이 발전함에 따라 각 반복마다 교사 모델이 새로 고쳐져 재귀적 향상을 실현합니다. 수학 추론, STEM, 코드 생성 및 다중 턴 에이전트 작업에 대한 실험 결과, RISE는 RLVR만 사용하거나 온라인 자기 증류를 사용하는 방법보다 전반적으로 우수하며, 소형 모델의 추론 능력과 일반화 성능을 크게 향상시킴을 보여줍니다.

배경

대규모 언어 모델은 복잡한 추론 작업에서 훈련 데이터의 희소성과 감독 신호의 약점으로 인해 성능 한계에 부딪히곤 합니다. 검증 가능한 보상을 활용한 강화학습(RLVR)은 모델이 올바른 논리적 경로로 나아가도록 유도하는 강력한 메커니즘이지만, 세밀한 과정 감독의 부재로 인해 훈련 수렴이 비효율적이고 지역 최적점에 빠지기 쉬운 치명적인 한계를 지닙니다. 이는 모델이 underlying logic을 이해하지 않고 정답을 추측하는 결과를 초래합니다. 반면, 온라인 정책 증류(OPD)는 학습을 가속화할 수 있는 밀집된 토큰 수준의 감독을 제공하지만, 그 효과는 교사 모델의 품질에 크게 좌우됩니다. 외부 교사 모델은 학생 모델과의 분포 불일치 문제를 겪으며, 특권 조건에 의존하는 자기 증류 방식은 컨텍스트 학습의 한계에 부딪힙니다. 이러한 구조적 비효율성은 값비싼 외부 교사 모델 없이도 효율적인 소형 추론 모델을 개발하는 데 상당한 병목 현상을 야기합니다.

이러한 구조적 결함을 해결하기 위해 연구진은 RISE(Recursive Improvement via Self-Extrapolating Policy Distillation) 프레임워크를 제안했습니다. RISE의 주요 목표는 외부 교사 모델이나 특권 정보에 대한 의존성을 제거하여 고성능 추론 모델의 훈련을 민주화하는 것입니다. 모델 자체의 RLVR 궤적을 활용하여 RISE는 동적으로 진화하는 합성 교사 모델을 구축합니다. 이 접근법은 강화학습에서 흔히 볼 수 있는 희소한 결과 유도 파라미터 업데이트를 지도 미세 조정(SFT)에 적합한 밀집된 토큰 수준의 목표로 변환합니다. 이 프레임워크는 정적인 지식 전달에서 동적이고 자기 참조적인 개선으로의 패러디임 시프트를 나타내며, 강화학습의 탐색 능력과 지도학습의 정밀성 사이의 격차를 해소하는 것을 목표로 합니다.

심층 분석

RISE 프레임워크의 기술적 핵심은 외부 개입 없이 고품질 과정 감독을 생성하는 독창적인 '자기 외삽(self-extrapolation)' 메커니즘에 있습니다. RISE는 기존 교사의 출력을 복사하는 대신, 모델의 훈련 궤적을 분석하여 현재 모델 체크포인트와 지연된 앵커(lagged anchor) 지점 간의 변위 벡터를 계산합니다. 이 계산은 파라미터 공간 또는 출력 로짓(logit) 공간에서 수행될 수 있습니다. 이 변위를 외삽함으로써 프레임워크는 모델의 더 최적화된 버전을 나타내는 가상의 미래 상태를 예측합니다. 이렇게 외삽된 상태가 합성 교사로 작용하여 추론 체인의 모든 토큰에 대해 밀집된 대상 분포를 제공합니다. 이 수학적 변환은 RLVR의 이진 결과 기반 보상을 추론 과정의 모든 단계를 안내하는 연속적이고 세분화된 신호로 효과적으로 변환합니다.

이 메커니즘은 RLVR과 OPD 사이에 상호 보완적인 피드백 루프를 형성합니다. RLVR에서 나오는 결과 보상은 외삽 방향이 논리적 정확성과 일치하도록 보장하여 합성 교사가 환각적이거나 비논리적인 경로로 벗어나는 것을 방지합니다. 동시에 외삽된 교사는 중간 추론 단계를 최적화하는 데 필요한 세밀한 토큰 수준의 지침을 제공합니다. 결정적으로, 합성 교사가 학생의 최신 체크포인트에서 동적으로 생성되므로, 학생 모델과 함께 진화합니다. 학생이 반복을 통해 개선됨에 따라 교사 모델도 새로 고쳐져 감독 신호가 관련성을 유지하고 도전 과제를 제공함을 보장합니다. 이는 교사의 품질이 학생의 능력에 따라 자동으로 확장되는 재귀적 개선 사이클을 생성하며, 전통적인 증류 설정에서 정적이거나 지연된 교사 모델과 관련된 성능 병목 현상을 피합니다.

산업 영향

RISE 프레임워크의 함의는 오픈 소스 연구 커뮤니티와 산업 적용 모두에 걸쳐 광범위하게 미칩니다. 값비싼 대규모 외부 교사 모델에 대한 요구 사항을 제거함으로써 RISE는 고성능 추론 모델 훈련을 위한 컴퓨팅 및 재정 장벽을 크게 낮춥니다. 이는 자원 제약이 있는 연구 팀과 독립 개발자들이 이전에 훨씬 더 크고 독점적인 시스템에Reserved되었던 능력을 갖춘 소형 언어 모델을 미세 조정할 수 있게 합니다. 이 프레임워크는 고급 추론 기술에 대한 접근을 민주화하여, 대규모 데이터와 컴퓨팅 자원이 부족한 틈새 영역에서의 혁신을 가속화할 잠재력을 지닙니다. 또한, 재귀적 개선 패러디임은 모델이 정적 사전 수집 데이터셋에만 의존하는 대신 자기 진화를 통해 자체적으로 고품질 훈련 데이터를 생성할 수 있다는 새로운 이론적 기반을 제시합니다.

산업 환경에서 RISE는 강력한 다중 턴 추론 및 계획 능력이 필요한 자율 에이전트 시스템 훈련에 특히 적합합니다. 이 프레임워크의 복잡한 다단계 작업을 처리할 수 있는 능력은 자동화된 코드 생성, 과학적 발견, 대화형 고객 서비스 에이전트와 같은 애플리케이션에 이상적입니다. 작고 효율적인 모델이 큰 모델과 비교 가능한 추론 성능을 달성할 수 있게 함으로써, RISE는 엣지 디바이스와 저지연 환경에서 AI 솔루션의 배포를 용이하게 합니다. 자기 진화적이고 자원 효율적인 훈련 패러디임으로의 이러한 전환은 확장성, 비용 효율성 및 적응성이 가장 중요한 다음 세대 AI 애플리케이션에 필수적입니다. 전통적인 증류의 한계를 극복한 RISE의 성공은 AI 시스템이 단순히 훈련되는 것을 넘어 내부 재귀적 과정을 통해 지속적으로 정제되는 미래를 시사합니다.

전망

수학 추론, STEM 문제 해결, 코드 생성 및 다중 턴 에이전트 작업 등 여러 도전적인 벤치마크에 대한 실험 결과는 RISE 프레임워크의 우수한 효능을 입증합니다. 이러한 평가에서 RISE는 RLVR이나 전통적인 온라인 자기 증류에만 의존하는 베이스라인을 지속적으로 능가했습니다. 아블레이션 연구는 자기 외삽 메커니즘이 성능 향상의 주요 동력임을 확인했으며, 이는 강화학습에 내재된 희소 감독의 부족을 효과적으로 보완합니다. 교사 모델의 동적 업데이트는 증류 과정이 학생의 능력의 최신 진전을 지속적으로 포착하여 정적 증류 방법에서 흔히 볼 수 있는 정체성을 방지했음을 보장합니다. 이러한 발견들은 RISE가 소형 모델의 추론 능력과 일반화 성능을 크게 향상시킬 잠재력을 강조합니다.

앞으로 RISE 프레임워크는 자기 개선 AI 시스템에 대한 새로운 기준을 설정합니다. 산업이 더 작고 효율적인 모델로 이동함에 따라 내부에서 밀집된 고품질 감독 신호를 생성하는 능력은 점점 더 중요해질 것입니다. 향후 연구는 자기 외삽 메커니즘을 비전-언어 모델과 같은 다른 모달리티로 확장하거나 더 복잡한 강화학습 알고리즘과 통합하는 것을 탐색할 수 있습니다. RISE가 제안한 재귀적 개선 루프는 컴퓨팅 비용의 비례적 증가 없이 모델 지능을 향상시키는 확장 가능한 경로를 제공합니다. 이 접근법은 방대한 데이터 수집에서 지능적이고 자기 참조적인 정제로 초점을 이동시킴으로써 AI 훈련 및 배포 방식을 근본적으로 변화시킬 수 있습니다. RISE의 성공은 AI 추론의 다음 돌파구가 더 큰 모델이 아닌 더 스마트하고 적응력 있는 훈련 프레임워크에서 올 것임을 시사합니다.

Sources

FAQ

RISE 프레임워크는 무엇이며 어떤 문제를 해결하나요?

RISE는 외부 교사 모델 없이 소형 모델이 추론 능력을 재귀적으로 개선하도록 돕는 프레임워크입니다. 이는 희소한 보상과 외부 교사 모델에 대한 의존성 문제를 해결하여 복잡한 추론 작업의 효율성을 높입니다.

RISE 프레임워크가 왜 중요하며 어떤 영향을 미치나요?

RISE는 모델 자체의 궤적을 자기 외삽하여 희소한 결과 보상을 밀집된 토큰 수준 감독으로 변환합니다. 이는 고성능 추론 모델의 미세 조정 비용을 크게 줄여 자원이 제한된 팀도 강력한 모델을 훈련할 수 있게 합니다.

RISE 프레임워크의 미래 방향과 응용 전망은 어떻게 되나요?

RISE의 재귀적 개선 메커니즘은 모델 자체의 진화 궤적을 활용하여 고품질 데이터 및 감독 신호를 생성하는 새로운 아이디어를 제공합니다. 에이전트 시스템 훈련에 널리 적용되어 복잡한 다중 턴 작업에서 성능을 향상시킬 것으로 기대됩니다.