MiMo-V2.6: 그룹 채점과 라우터 동결로 에이전트 RL을 확장한 전방위 MoE 모델
Xiaomi LLM-Core 팀이 MiMo-V2.6을 공개했습니다. Pro는 전체 1.02T·활성 42B, Flash는 전체 310B·활성 15B입니다. 논문은 스텝당 프롬프트 1,568개, 최대 1M 컨텍스트의 대규모 RL에 그룹 단위 에이전트 채점, MoE 라우터 동결, 다층 보상 해킹 방어를 결합합니다. DeepSWE에서 RL 중 Pro는 58.4에서 72.6, Flash는 48.7에서 65.7로 올랐습니다. RL 프레임워크와 환경 공개도 예정되어 있습니다.
2026년 10월 8일 Xiaomi LLM-Core 팀은 arXiv:2610.11959 「MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement」를 공개했습니다. 이 논문은 전방위(omni-modal) 모델 계열인 MiMo-V2.6을 소개하며, 핵심 주장은 단순합니다. 사전 학습과 중간 학습 이후에도 강화학습(RL) 연산량을 계속 키우면 지능이 계속 오른다는 것입니다. 한 가지 바로잡을 점이 있습니다. 요청서는 수학·논리 추론의 커리큘럼 생성을 가정했지만, 논문이 다루는 것은 코드, 일반, 시각, 사이버 환경 전반의 에이전트형 RL입니다. 모델은 두 가지입니다. MiMo-V2.6-Pro는 전체 파라미터 1.02T, 활성 42B이고, MiMo-V2.6-Flash는 전체 310B, 활성 15B입니다. 둘 다 공유 전문가가 없는 희소 MoE이며 토큰당 8개의 전문가가 활성화됩니다. Flash는 48층, 은닉 차원 4096, 전문가 256개입니다. Pro는 70층, 은닉 차원 6144, 전문가 384개입니다. 첫 블록은 전역 어텐션과 밀집 FFN을 씁니다. 어텐션은 하이브리드 슬라이딩 윈도(hybrid-SWA) 구조입니다. 지역 슬라이딩 윈도 어텐션과 전역 어텐션이 번갈아 배치되고, 윈도 크기는 128에 불과합니다. Flash는 39층이 슬라이딩, 9층이 전역이며, Pro는 60층과 10층입니다. 대부분의 층이 128개 토큰만 보므로 KV 캐시가 작고, 이것이 최대 1M 토큰 컨텍스트에서 RL을 돌릴 수 있는 공학적 전제입니다. 5층짜리 추측 디코딩 모듈은 한 번의 순전파로 7개 토큰을 예측합니다.
데이터 규모도 큽니다. Flash는 48T 토큰(텍스트 26T, 전방위 22T), Pro는 30T 토큰(텍스트 27T, 전방위 3T)으로 학습했습니다. 중간 학습은 컨텍스트를 256K에서 1M으로 늘리고 MXFP4 양자화 인지 학습을 씁니다. 은닉 가중치 행렬에는 AdamW 대신 Muon의 변형을 쓰고, 임베딩, 언어 모델 헤드, MoE 라우터는 AdamW를 유지합니다. 저자들에 따르면 폭넓은 멀티모달 코퍼스로 한 중간 학습은 RL에서 탐색할 여지를 남기기 위한 것입니다. RL 연산은 세 방향으로 확대됩니다. 첫째, 더 큰 배치와 더 높은 처리량입니다. 한 스텝은 프롬프트 1,568개, 각 16개 롤아웃, 약 25K개 궤적으로 이루어지며 27억~37억 학습 토큰을 소비하고 컨텍스트는 최대 1M입니다. 알고리즘은 GRPO이고, 비동기 부분 롤아웃(낡음 정도 4), 학습률 3e-6, 기울기 클리핑 1.0을 씁니다. 둘째, 코드·일반·시각·사이버 등 더 다양하고 복잡한 환경을 여러 에이전트 하네스로 돌립니다. 셋째, 채점기(grader)에 더 많은 연산을 씁니다.
셋째가 가장 눈여겨볼 부분입니다. 논문은 이를 그룹 단위 에이전트 채점(groupwise agentic grading)이라 부릅니다. 오프라인 부분인 그룹 보상 합성은 최종 보상을 테스트 보상, 해법 점수, 행동 점수의 곱으로 계산합니다. 온라인 부분인 그룹 이점 재분배는 같은 그룹 안에서 통과한 궤적을 품질순으로 줄 세우고, 더 나은 해법에 더 많은 양의 이점을 줍니다. 장기 과제에서는 통과/실패 신호만으로는 너무 거칠어서, 빙 돌아가는 장황한 해법도 깔끔한 해법과 같은 보상을 받기 때문입니다. 저자들은 Flash의 코드 전용 제거 실험(배치 128)으로 이를 확인했습니다. 온라인 채점이 없으면 턴 수와 토큰 길이가 빠르게 늘고 통과율 향상이 멈췄습니다. 온라인 채점을 넣으면 통과율이 52스텝까지 계속 올랐고 토큰 길이도 완만하게 늘었습니다. 여기에 그룹 상대 길이 페널티가 더해집니다. 프롬프트별 기준 길이보다 지나치게 긴 성공 궤적의 보상을 낮춰, 더 짧고 토큰 효율적인 해법으로 유도합니다. 제가 읽은 페이지에는 페널티의 하이퍼파라미터가 나오지 않았습니다. 또 다른 주제는 안정성입니다. 저자들은 RL 동안 MoE 라우터를 동결해 전문가 부하를 안정시킵니다. 대규모 MoE RL에서는 학습 엔진과 추론 엔진 사이의 작은 라우팅 차이가 커져 전문가 부하가 불균형해질 수 있고, 라우터 동결은 이 변동 요소를 하나 없앱니다. 이 절의 전문은 읽지 못했으므로 논문이 밝힌 결론만 인용합니다. 또한 혼합 과제 에이전트 RL을 위한 인프라도 구축했습니다. 통합 궤적 표현, 고동시성 다중 프레임워크 롤아웃, 제어면과 데이터면 분리, 학습·추론 일관성입니다.
보상 해킹은 에이전트 RL의 오래된 문제이며, 논문은 다층 방어로 답합니다. 관찰된 해킹 사례로 중간 학습 정렬 데이터를 만들고, 빌드 로그와 잔여 패치, 이후 Git 이력을 환경에서 지우고, 컨테이너 수준에서 네트워크를 격리하며, 전용 해킹 에이전트가 새 취약점이 없을 때까지 유출 경로를 찾습니다. 학습 중에는 궤적을 오프라인으로 감사합니다. 해킹이 확인된 궤적은 보상이 0이며, 확인된 비율은 두 모델 모두 학습 내내 2% 미만이었습니다. 비용과 성과를 보면, 논문은 RL 비용을 Pro 260만 달러, Flash 90만 달러로 보고합니다. Pro에서는 롤아웃이 연산의 43.8%, 학습이 43.5%, 채점이 12.7%입니다. 채점은 한 자릿수 후반의 비중이지만 보상의 질을 정합니다. DeepSWE(average@3)에서 RL 과정 중 Pro는 58.4에서 72.6으로, Flash는 48.7에서 65.7로 올랐습니다. 이는 학습 중 향상이며 다른 모델과의 직접 비교가 아닙니다. 개발자와 기업에는 세 가지 의미가 있습니다. 첫째, 수치와 비용, 제거 실험이 공개된 참고할 만한 레시피입니다. 둘째, 저자들은 학습 동역학, RL 환경, RL 프레임워크의 오픈소스화를 계획하고 있어 실현되면 재현 장벽이 낮아집니다. 셋째, 윈도 128의 하이브리드 어텐션과 희소 MoE는 장문맥 에이전트 학습의 비용을 구조 설계로 억제할 수 있음을 보여 줍니다. 한계도 분명히 적습니다. 저는 논문의 앞쪽 절반 정도만 읽었고, 다른 모델과의 전체 벤치마크 비교와 논문 자체의 한계 절은 확인하지 못했습니다. 따라서 순위에 대한 결론은 내리지 않습니다. 제목은 자기 개선을 내세우지만, 읽은 부분은 사람이 설계한 환경, 채점기, 해킹 방지 절차를 설명합니다. 모델이 얼마나 스스로 개선하는지는 전문을 읽어야 판단할 수 있습니다. RL 비용은 학습 자체만이며 데이터와 환경 구축은 빠져 있습니다. 오픈소스 약속도 아직 이행되지 않아 재현성은 검증 전입니다.
정리하면 이 논문의 가치는 공학적 세부에 있습니다. 대규모 비동기 배치, 그룹 채점, 라우터 동결, 다층 해킹 방어가 하나의 작동하는 에이전트 RL 파이프라인으로 묶였습니다. 다음으로 볼 것은 약속된 코드의 공개와 DeepSWE 향상을 확인하는 독립 평가입니다.