MiMo-V2.6:グループ採点とルーター凍結でエージェント型強化学習を拡大する全モーダル MoE
Xiaomi の LLM-Core チームが MiMo-V2.6 を発表しました。Pro は総 1.02T・活性 42B、Flash は総 310B・活性 15B です。論文は 1 ステップ 1,568 プロンプト、最大 1M 文脈という大規模 RL に、グループ単位のエージェント採点、MoE ルーター凍結、多層のハッキング防御を組み合わせます。DeepSWE では RL の間に Pro が 58.4 から 72.6、Flash が 48.7 から 65.7 に向上しました。RL フレームワークと環境の公開も予定されています。
2026年10月8日、Xiaomi の LLM-Core チームは arXiv:2610.11959「MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement」を公開しました。論文は全モーダル対応の MiMo-V2.6 シリーズを紹介し、中心となる主張は明快です。事前学習と中間学習のあとも強化学習(RL)の計算量を拡大し続ければ、知能は伸び続けるというものです。ひとつ訂正があります。依頼文は数学・論理推理のカリキュラム生成を想定していましたが、論文が扱うのはコード、汎用、視覚、サイバーの各環境にわたるエージェント型 RL です。 モデルは二つあります。MiMo-V2.6-Pro は総パラメータ 1.02T、活性 42B。MiMo-V2.6-Flash は総パラメータ 310B、活性 15B です。どちらも共有エキスパートを持たないスパース MoE で、トークンごとに 8 エキスパートが働きます。Flash は 48 層、隠れ次元 4096、エキスパート 256。Pro は 70 層、隠れ次元 6144、エキスパート 384 です。最初のブロックはグローバル注意と密な FFN を使います。 注意機構はハイブリッド・スライディングウィンドウ(hybrid-SWA)です。局所的なスライディングウィンドウ注意とグローバル注意を交互に配置し、窓幅はわずか 128 です。Flash は 39 層がスライディング、9 層がグローバル。Pro は 60 層がスライディング、10 層がグローバルです。大半の層が 128 トークンしか見ないため KV キャッシュが小さく、最大 1M トークンの文脈で RL を回せる工学的な前提になっています。5 層の投機的デコードモジュールが 1 回の順伝播で 7 トークンを予測します。
データ量も大きいものです。Flash は 48T トークン(テキスト 26T、全モーダル 22T)、Pro は 30T トークン(テキスト 27T、全モーダル 3T)で学習しました。中間学習では文脈を 256K から 1M に拡張し、MXFP4 の量子化認識学習を使います。隠れ層の重み行列には AdamW ではなく Muon の変種を使い、埋め込み、LM ヘッド、MoE ルーターは AdamW のままです。著者によれば、広いマルチモーダルコーパスでの中間学習は、RL で探索する余地を残すためのものです。 RL の計算量は三方向に拡大されます。第一に、大きなバッチと高いスループットです。1 ステップは 1,568 プロンプト、各 16 ロールアウト、約 25K 本の軌跡で、27 億〜37 億の学習トークンを消費し、文脈は最大 1M です。アルゴリズムは GRPO で、非同期の部分ロールアウト(陳腐度 4)、学習率 3e-6、勾配クリップ 1.0 を使います。第二に、コード、汎用、視覚、サイバーという多様で複雑な環境を、複数のエージェントハーネスで動かします。第三に、採点(グレーダー)の計算量を増やします。
第三の点が最も重要です。論文はこれをグループ単位のエージェント採点(groupwise agentic grading)と呼びます。オフライン側のグループ報酬合成では、最終報酬をテスト報酬、解法スコア、行動スコアの積で求めます。オンライン側のグループ優位再配分では、同じグループ内で合格した軌跡を品質順に並べ、よい解法により多くの正の優位を与えます。長い工程を要するエージェント課題では、合否だけの信号は粗すぎ、遠回りで冗長な解法も同じ報酬を得てしまうからです。 Flash のコードのみの除去実験(バッチ 128)がこれを裏づけます。オンライン採点がないと、ターン数とトークン長が急に伸び、合格率の向上が止まりました。オンライン採点を入れると、合格率はステップ 52 まで上がり続け、トークン長の伸びも緩やかでした。さらに、プロンプトごとの基準長に比べて長すぎる成功軌跡の報酬を下げる、グループ相対の長さペナルティがあります。これにより、より短くトークン効率のよい解法へ誘導されます。私が読んだ範囲ではペナルティのハイパーパラメータは示されていません。 もうひとつの主題は安定性です。著者らは RL の間 MoE ルーターを凍結し、エキスパートの負荷を安定させます。大規模な MoE の RL では、学習エンジンと推論エンジンのルーティングのわずかな差が拡大し、負荷の偏りや発散を招くことがあります。ルーターの凍結はその変動要因を一つ減らします。この節の全文は読めていないため、論文の結論部分のみを引用します。また、混合タスクのエージェント RL のための基盤も整備されました。統一された軌跡表現、高並行のマルチフレームワーク・ロールアウト、制御面とデータ面の分離、学習と推論の一貫性です。 報酬ハッキングはエージェント RL の古い課題で、論文は多層の防御で答えます。観測したハッキング事例から中間学習のアラインメントデータを作ります。ビルドログ、残存パッチ、後続の Git 履歴を環境から消します。コンテナをネットワーク隔離します。専用の「ハックエージェント」が、新しい穴が見つからなくなるまでリークを探します。学習中に軌跡をオフライン監査します。ハッキングと確認された軌跡の報酬はゼロで、確認された割合は両モデルとも学習を通じて 2% 未満でした。 コストと成果です。論文は RL の費用を Pro で 260 万ドル、Flash で 90 万ドルと報告しています。Pro では、ロールアウトが計算の 43.8%、学習が 43.5%、採点が 12.7% を占めます。採点は一割強にすぎませんが、報酬の質を決めます。DeepSWE(average@3)では、RL の過程で Pro が 58.4 から 72.6、Flash が 48.7 から 65.7 に上がりました。これは学習中の向上であり、他モデルとの直接比較ではありません。
開発者と企業への意味は三つあります。第一に、数値、費用、除去実験が公開された、参照できるレシピであること。第二に、著者が学習ダイナミクス、RL 環境、RL フレームワークのオープンソース化を予定していること。実現すれば再現の敷居は下がります。第三に、窓幅 128 のハイブリッド注意とスパース MoE が、長文脈のエージェント学習を構造設計で抑えられることを示した点です。 限界も明記します。私が読んだのは論文の前半程度で、他モデルとの完全なベンチマーク比較や、論文自身の限界の章は確認できていません。そのため順位については結論を出しません。タイトルは自己改善を掲げますが、読めた範囲は人間が設計した環境、採点器、ハッキング対策の流れです。モデルがどこまで自律的に改善するかは全文を読んで判断する必要があります。RL の費用は学習そのものだけで、データ作成や環境構築は含みません。オープンソースの約束も未履行で、再現性は未検証です。 まとめると、この論文の価値は工学的な細部にあります。大規模な非同期バッチ、グループ採点、ルーター凍結、多層のハッキング防御が、ひとつの動くエージェント RL パイプラインとしてまとまっています。次に注目すべきは、約束されたコードの公開と、DeepSWE での向上を確かめる独立した評価です。