조향을 배우고 조향으로 본다: 학습 가능한 벡터로 밝힌 LLM RLVR의 기하와 Alpha-Stabler

Published · AI Daily — AI-assisted deep research, methodology & disclosure

이 논문은 RLVR을 활성화 공간의 개입 문제로 봅니다. 기반 모델을 고정하고 층마다 벡터 하나만 더해도 대부분의 과제에서 전체 파라미터 학습 이득의 85% 이상을 회복합니다. 유효 용량은 작지만 무한히 압축되지 않고, 제어 방향은 주성분 부분공간의 저분산 여공간에 있습니다. 이를 토대로 Alpha-Stabler는 PSI로 붕괴를 미리 알리고 역전파에서 주성분 성분을 제거해 학습을 2,000 스텝 안정시킵니다. 대상은 텍스트 전용 LLM입니다.

강화학습은 대규모 언어 모델의 추론 능력을 높이는 핵심 후학습 수단이 되었지만, 모델 내부에서 실제로 무엇이 바뀌는지는 아직 명확하지 않습니다. 파라미터 업데이트는 차원이 매우 높고, 최적화 잡음과 설정 차이가 의미 있는 변화를 가려 버립니다. USTC, Tencent Hunyuan, BUPT 연구진은 2026년 9월 28일에 제출한 논문(arXiv 2609.34344, cs.LG)에서 다른 길을 택했습니다. 파라미터 공간 대신, 검증 가능한 보상을 쓰는 강화학습(RLVR)을 활성화 공간에서의 개입 문제로 봅니다.

먼저 바로잡을 점이 있습니다. 이 기사에 딸린 배경 설명은 시각-언어 추론을 다룬다고 했지만, arXiv 공식 제목은 「Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors」입니다. 실험 대상은 텍스트 전용 LLM이며, 수학 추론, 과학 추론, 코드 생성, 지시 따르기의 네 가지 과제를 다룹니다. 멀티모달 벤치마크는 나오지 않습니다. 아래 내용은 논문 본문을 따릅니다.

핵심 방법: 학습 가능한 벡터 하나를 탐침으로 쓴다

저자들은 기반 모델을 고정하고, 선택한 층의 출력에 학습 가능한 벡터를 더합니다. h'_l = h_l + delta_l 입니다. 이 벡터는 입력과 무관하며 모든 샘플과 모든 토큰 위치에서 공유됩니다. 제어하는 층마다 늘어나는 것은 은닉 차원 d짜리 벡터 하나뿐입니다. 학습은 RL 자체가 아니라 증류로 합니다. 먼저 GRPO 또는 DAPO로 교사 모델을 학습시키고, 「고정된 기반 모델 더하기 벡터」인 학생이 교사를 따라가게 합니다. 온폴리시와 오프폴리시 증류를 모두 수행하고, 전체 파라미터 학습, LoRA, 벡터 조향의 세 가지 갱신 형태를 비교합니다.

이 설계는 막연한 생각을 검증 가능한 가설로 바꿉니다. RL의 이득이 정말 저차원이라면 적은 파라미터로도 재현되어야 하기 때문입니다. 모델은 DeepSeek-R1-Distill-Qwen 1.5B와 7B, Qwen3 4B, 8B, 14B이며, 모두 5개 LLM과 6개의 검증 가능 보상 과제를 다룹니다.

성질 1: 유효 다양체의 용량은 작지만 무한히 압축되지는 않는다

온폴리시 증류에서는 LoRA와 전체 파라미터 학습의 성능이 비슷했습니다. 그런데도 제어 층마다 벡터 하나만으로 평가한 대부분의 과제에서 전체 파라미터 학습 이득의 85% 이상을 회복합니다. 교사가 생성한 궤적을 쓰는 오프폴리시 증류에서도 평가 세트의 회복률이 비슷하게 높아, 이 압축성이 학생 자신의 생성물에 의존하지 않음을 보여 줍니다.

흥미로운 쪽은 한계입니다. 논문은 두 가지를 듭니다. 첫째는 교사와 학생의 분포 차이로, 가까우면 벡터 하나로 충분하지만 차이가 벌어지면 더 유연한 파라미터화가 필요합니다. 둘째는 삽입 깊이로, 고정 벡터는 낮은 층에서 중간 층까지는 잘 작동하고 출력에 가까울수록 나빠집니다. 비선형 분석에 따르면 이는 깊은 층에서 최적화 신호가 약해서가 아닙니다. 입력과 무관한 저차원 이동으로는 상위 층이 요구하는 입력 의존적 보정을 표현할 수 없다는 표현력 병목 때문입니다.

성질 2: 제어 다양체는 주성분 부분공간과 분리되어 있다

다음으로 저자들은 층마다 벡터 하나이던 것을 서로 직교하는 여러 벡터로 확장했습니다. 나중에 추출한 방향은 단독 성능이 떨어지지만, 여전히 단독으로 목표 행동을 뒷받침할 수 있습니다. 첫 방향이 지배적이지만 유일하게 유효한 것은 아닙니다. 같은 과제와 같은 기반 모델에서, 파라미터 공간에서는 크게 다른 학습 설정들이 압축 후에는 재현 가능한 과제 관련 방향 집합으로 수렴합니다. 과제 사이에서는 방향 벡터의 정렬 정도가 능력 전이 이득과 대응합니다.

가장 중요한 발견은 그 방향의 위치입니다. 유효한 제어 방향은 주로 활성화 주성분 부분공간의 저분산 여공간에 놓입니다. RL은 표현을 지배하는 분산 큰 방향을 미는 것이 아니라, 눈에 띄지 않는 방향을 미세하게 조정합니다. 논문은 이를 제어 다양체 분리라고 부릅니다.

Alpha-Stabler: 기하를 학습 도구로

이 결과를 바탕으로 두 모듈로 이루어진 플러그앤플레이 프레임워크 Alpha-Stabler를 제안합니다.

Predictor는 주성분 부분공간 침입(PSI)을 감시합니다. 고정된 기반 모델에서 주성분 부분공간을 한 번 추정해 두고, 학습 중 토큰 단위 활성화 차이의 에너지 가운데 그 부분공간에 들어가는 비율을 잽니다. 성공적인 학습에서는 활성화 이동이 저분산 여공간에 머물고, PSI 상승은 성능 저하와 붕괴에 동반됩니다. 그래서 붕괴의 조기 경보가 됩니다.

Controller는 역전파에서만 작동합니다. 활성화 그래디언트에서 주성분 부분공간의 성분을 제거하고 직교 여공간의 성분은 남깁니다. 학습 가능한 파라미터를 추가하지 않으며, 옵티마이저, 보상 함수, 모델 구조도 바꿀 필요가 없습니다.

결과와 비용

논문에 따르면 Alpha-Stabler는 2,000 스텝 동안 학습을 안정시키고 RL 이득을 꾸준히 높입니다. 그래디언트 클리핑이나 다른 그래디언트 투영 방식보다 보상 증가가 매끄럽습니다. 저자들은 개선이 그래디언트를 전반적으로 억누르는 데서 오는 것이 아니라 특정 부분공간의 성분을 제거하는 데서 온다고 강조합니다. 비용 면에서는, 부록의 그림이 같은 실제 시간에서 적용 전후의 점수 곡선이 거의 겹침을 보여 추가 부담이 작음을 시사합니다. 단, 확인한 자료에서는 절대 점수를 한데 모은 단일 표를 찾지 못해 이 기사는 구체적인 향상 수치를 인용하지 않습니다.

개발자와 기업에 주는 의미

가장 쉬운 활용은 모니터링입니다. PSI는 값싼 지표라 학습 대시보드에 상시 띄워 두고, 보상 곡선이 무너지기 전에 롤백이나 학습률 하향을 걸 수 있습니다. 둘째는 과제 적응으로, RL 이득을 층당 벡터 하나로 재현할 수 있다면 과제별 행동을 저장하고 바꾸는 비용이 크게 줄어듭니다. 셋째는 전이 예측으로, 방향 정렬이 전이와 상관되므로 큰 학습 전에 두 과제가 서로 도울지 대략 가늠할 수 있습니다. 코드는 GitHub(caiyuchen-ustc/On_Policy_Vector_Training)에 공개되어 있습니다.

한계와 향후 과제

저자들이 직접 한계를 밝힙니다. 이론은 경험에 기반한 가정에 의존하며 제1원리에서 유도한 것이 아닙니다. 연구 범위는 수학과 코드 같은 RLVR 과제에 한정되며, RLHF, 다중 턴 에이전트 의사결정, 개방형 생성은 검증하지 않았습니다. 앞으로는 뉴런 귀속과 인과 추적으로 가정을 완화하고, RLHF와 에이전트로 확장하며, 여공간 정규화나 PSI를 학습률과 개입 강도의 적응 신호로 쓰는 방안을 제시합니다.

종합하면 이 논문은 분석 중심입니다. 가치는 쓸 수 있는 기하학적 시각과 그 위에 만든 저비용 안정화 도구에 있습니다. 결론은 텍스트 전용 LLM에 대한 것으로 읽어야 하며, 멀티모달 모델에서도 성립하는지는 논문이 답하지 않습니다.

Sources