DASH: 추론 모델의 강화학습 최적화를 위한 발산 적응형 감독 지평선

검증 가능한 보상을 기반으로 한 강화학습(RLVR)에서 신호의 희소성 문제를 해결하기 위해, 기존 정책 자기 증류(OPSD) 방법은 교사 모델을 통해 밀집된 감독을 제공하지만 생성 과정의 시간적 구조 차이를 무시합니다. 본 논문은 DASH(Divergence-Adaptive Supervision Horizons)를 제안하며, 이는 국소 증류 신호와 시퀀스 평균 간의 격차를 매핑하여 역방향 다중 단계 집계를 제어하는 적응형 전파 게이트를 구성합니다. 이 방법은 추가 순전파 없이 생성 과정 동안 국소 발산의 진화에 따라 토큰 수준의 감독 가중치를 동적으로 조정합니다. 세 가지 수학 추론 벤치마크와 세 가지 모델 규모에 대한 실험 결과는 DASH가 모든 설정에서 표준 OPSD를 능가하여 추론 능력을 크게 향상시키고 효율적인 강화학습을 위한 새로운 패러다임을 제공함을 보여줍니다.

배경

대형 언어 모델의 추론 능력 훈련에서 검증 가능한 보상을 활용한 강화학습(RLVR)은 정답이나 코드 실행 결과와 같이 자동 검증이 가능한 신호를 통해 모델을 최적화할 수 있다는 점에서 주목받고 있습니다. 그러나 RLVR의 근본적인 한계는 이러한 신호가 희소하다는 점입니다. 모델은 전체 해결책을 생성한 후에야 이진 보상을 받으며, 생성 과정 중 간접적인 피드백이 부족합니다. 이로 인해 모델은 세밀한 전략을 학습하기 어렵고, 비효율적인 탐색과 느린 수렴을 겪게 됩니다.

이러한 신호 희소성 문제를 완화하기 위해 온라인 정책 자기 증류(OPSD)와 같은 방법이 개발되었습니다. OPSD는 학생 모델이 방문한 접두어에서 특권 교사 모델을 쿼리하여 토큰 수준의 밀집된 감독을 제공합니다. 학생의 출력 분포와 교사의 분포를 비교함으로써 중간 손실 신호를 생성하여 추론 단계를 안내합니다. 하지만 OPSD는 학생과 교사 간의 모든 국소적 발산을 동일하게 취급한다는 가정 하에 작동하며, 이는 생성 과정의 시간적 구조적 차이를 무시하여 하위 최적의 그래디언트 업데이트를 초래할 수 있습니다.

심층 분석

표준 OPSD의 핵심 한계는 발산의 시간적 문맥을 고려하지 않는 데 있습니다. 자기회귀 생성에서 학생과 교사 출력 간의 동일한 정도의 편차는 발생 시점과 이전 오류의 이력에 따라 완전히 다른 의미를 가집니다. 예를 들어, 추론 체인 초기의 발산은 수정 가능하여 유효한 해결책으로 이어질 수 있지만, 후기 발산은 회복 불가능한 근본적인 오해를 나타낼 수 있습니다. OPSD는 위치나 발산 시퀀스와 무관하게 모든 국소 발산에 동일한 계수를 할당하므로, 모델은 추론 경로의 진화하는 난이도나 유효성에 따라 학습률을 적응시킬 수 없습니다.

이를 해결하기 위해 제안된 DASH(Divergence-Adaptive Supervision Horizons)는 토큰 수준 감독 가중치를 동적으로 조정하는 메커니즘을 도입합니다. DASH는 국소 증류 신호와 시퀀스 평균 간의 격차를 매핑하여 적응형 전파 게이트를 구성합니다. 각 단계에서 학생 출력 분포와 교사 분포의 차이인 국소 증류 신호를 계산한 후, 시퀀스 전체의 평균을 기준으로 삼습니다. 각 국소 신호의 편차는 해당 단계의 상대적 발산 심각도를 반영하는 게이트 값으로 매핑됩니다.

이 게이트 값은 역전파 중 역방향 다중 단계 집계를 제어하여 추가 계산 오버헤드 없이 동적 가중치 조정을 가능하게 합니다. 발산이 크지만 최종 결과에 긍정적으로 기여하는 단계의 경우 게이트는 더 많은 그래디언트 흐름을 허용하여 올바른 추론 경로를 강화합니다. 반면, 발산이 무효한 탐색이나 오류를 나타내는 경우 게이트는 그래디언트 흐름을 억제합니다. DASH는 기존 분포를 재사용하므로 추가 순전파 없이 최소한의 계산 비용으로 이 메커니즘을 구현합니다.

산업 영향

세 가지 수학 추론 벤치마크와 세 가지 모델 규모에서 수행된 실험 결과, DASH는 모든 설정에서 표준 OPSD를 일관되게 상회하는 것을 보여줍니다. 어려운 수학 추론 작업에서 DASH는 최종 정답 정확도를 높일 뿐만 아니라 훈련 수렴에 필요한 시간을 크게 단축했습니다. 아블레이션 연구는 성능 향상이 주로 시간 구조의 적응적 활용에서 비롯됨을 확인했습니다. 적응형 게이트 메커니즘을 제거하고 고정 가중치를 사용할 때 성능이 현저히 하락하여 동적 가중치 조정의 필요성을 입증했습니다.

또한 DASH는 서로 다른 모델 크기에서 강력한 확장성을 보여줍니다. 소규모 모델이 대규모 모델과 유사한 수준의 혜택을 받음은 이 방법이 자원 제약 환경에서 특히 가치 있음을 시사합니다. 이는 계산 비용이 주요 관심사인 산업적 배포에 DASH를 매우 매력적으로 만듭니다. 감독 신호의 할당을 최적화함으로써 DASH는 목표 성능 수준에 도달하는 데 필요한 훈련 단계 수를 줄이며, 이는 탄소 발자국과 운영 비용 절감으로 이어져 지속 가능한 AI 개발 추세와 부합합니다.

오픈소스 커뮤니티에게 DASH는 세밀한 시간 분석을 통해 강화학습 신호를 최적화하는 새로운 관점을 제시합니다. 기존 RLVR 파이프라인에 대한 실용적이고 오버헤드가 낮은 업그레이드를 제공하여 연구자와 개발자가 고급 추론 기능을 구현하는 장벽을 낮춥니다. 아키텍처 변경 없이 훈련 효율성을 향상시키는 이 방법의 능력은 복잡한 추론 시나리오에서 대형 언어 모델의 강건성과 정확성을 개선하기 위해 즉시 적용 가능한 도구가 됩니다.

전망

DASH의 함의는 수학 추론을 넘어섭니다. 시간 민감성과 동적 적응 감독이라는 핵심 철학은 코드 생성이나 자연어 이해와 같은 다른 생성 작업에서도 탐구될 수 있습니다. 향후 연구는 DASH를 다른 희소 보상 처리 기술과 통합하여 복잡하고 다단계 추론 환경에서의 잠재력을 더욱 끌어내는 방법을 조사할 수 있습니다. 또한, 이 방법의 효율성은 더 크고 효율적인 추론 모델 개발을 가속화하기 위해 대규모 사전 훈련 노력과 결합될 수 있음을 시사합니다.

AI 분야가 계속 진화함에 따라 효율적이고 정밀한 훈련 방법의 필요성은 더욱 커질 것입니다. DASH는 강화학습의 오랜 문제인 신호 희소성에 대한 견고한 솔루션을 제공함으로써 이 방향으로 중요한 진전을 의미합니다. 모델이 자체 생성 과정으로부터 더 효과적으로 학습할 수 있도록 함으로써, DASH는 정확성뿐만 아니라 효율성과 지속 가능성 측면에서도 더 우수한 차세대 추론 모델의 길을 열었습니다. 이러한 방법의 채택은 대형 언어 모델 훈련 방식을 근본적으로 변화시켜 더 지능적이고 자원을 의식하는 패러다임으로 이끌 것입니다.

Sources