MiMo-V2.6:以分組智慧體打分與凍結路由擴充套件強化學習算力的萬億級全模態模型

Published · AI Daily — AI-assisted deep research, methodology & disclosure

小米 LLM-Core 團隊釋出 MiMo-V2.6 系列:Pro 為 1.02T 總引數、42B 啟用,Flash 為 310B、15B 啟用。論文把後訓練算力押在強化學習上:每步 1,568 個提示、最長 1M 上下文,配合分組智慧體打分、凍結 MoE 路由器和多層防作弊機制。DeepSWE 上 Pro 從 58.4 升至 72.6,Flash 從 48.7 升至 65.7。作者計劃開源 RL 框架與環境。

小米 LLM-Core 團隊在 2026 年 10 月 8 日提交了 arXiv:2610.11959,題為《MiMo-V2.6:面向自我改進的強化學習規模化》。論文介紹 MiMo-V2.6 系列全模態模型,核心主張很直接:在預訓練和中期訓練之後,把強化學習(RL)的算力繼續做大,智慧就能繼續上漲。需要先說明一點:摘要和正文講的是智慧體任務上的 RL 規模化,覆蓋程式碼、通用、視覺和網路安全環境,並不是只做數學與邏輯推理的課程生成。 模型規格如下。MiMo-V2.6-Pro 總引數 1.02T,啟用引數 42B。MiMo-V2.6-Flash 總引數 310B,啟用引數 15B。兩者都是稀疏混合專家(MoE)結構,不設共享專家,每個 token 啟用 8 個專家:Flash 有 256 個專家、48 層、隱藏維度 4096;Pro 有 384 個專家、70 層、隱藏維度 6144。第一個模組使用全域性注意力加稠密前饋網路。 注意力採用混合滑動視窗結構(hybrid-SWA)。區域性滑動視窗注意力與全域性注意力交錯排列,視窗只有 128。Flash 的 48 層中有 39 層是滑動視窗、9 層是全域性注意力;Pro 的 70 層中有 60 層是滑動視窗、10 層是全域性注意力。絕大多數層只看 128 個 token,因此 KV 快取很小,這正是 RL 能把上下文推到 1M token 的工程前提。此外還有一個 5 層的推測解碼模組,每次前向預測 7 個 token。

預訓練與中期訓練的資料量很大。Flash 訓練了 48T token,其中 26T 是文字,22T 是全模態資料;Pro 訓練了 30T token,其中 27T 文字、3T 全模態。中期訓練把上下文從 256K 擴充套件到 1M,並使用 MXFP4 量化感知訓練。最佳化器方面,隱藏層權重矩陣從 AdamW 換成 Muon 的一個變體,嵌入、語言模型頭和 MoE 路由器仍用 AdamW。作者說,中期訓練使用了廣泛的多模態語料,目的是為後續 RL 留出探索空間。 RL 規模化沿三個方向展開。第一是更大的批次和更高的吞吐。每一步使用 1,568 個提示,每個提示 16 條取樣,約 25K 條軌跡,消耗 27 億到 37 億個訓練 token,上下文最長 1M。訓練演算法是 GRPO,採用非同步部分取樣,陳舊度(staleness)為 4,學習率 3×10⁻⁶,梯度裁剪 1.0。第二是更多樣、更復雜的環境,覆蓋程式碼、通用、視覺和網路安全,並混用多種智慧體框架。第三是更多的打分(grader)算力。 第三點最值得細讀,論文稱之為分組式智慧體打分(groupwise agentic grading)。它有兩部分。離線部分叫分組獎勵合成:最終獎勵等於測試獎勵乘以方案評分再乘以行為評分。線上部分叫分組優勢重分配:在同一組裡,對透過測試的軌跡按質量排序,把更多正向優勢分給更好的方案。道理在於,長程智慧體任務只靠透過或不透過的測試訊號太粗,模型可能靠冗長、繞路的方式碰巧透過。 作者在 Flash 的純程式碼消融實驗中(批次 128)驗證了這一點。沒有線上打分時,互動輪數和 token 長度增長很快,透過率的提升停滯。加入線上打分後,透過率一直提升到第 52 步,token 長度增長也平緩得多。此外還有組相對長度懲罰:對相對每個提示參考長度而言過長的成功軌跡降低獎勵。這推動模型寫出更短、更省 token 的解法。論文頁面沒有給出懲罰的具體超引數。

穩定性是另一條主線。作者在 RL 期間凍結 MoE 路由器,以保持專家負載穩定。MoE 模型做大規模 RL 時,路由在訓練與推理之間的細微不一致會放大,導致專家負載失衡和訓練發散,凍結路由是一種直接的辦法。(路由凍結一節的完整論證我沒有讀到,這裡只引述論文的結論性陳述。)此外,作者構建了混合任務智慧體 RL 的基礎設施:統一的軌跡表示、高併發多框架取樣、控制面與資料面解耦,以及訓練與推理的一致性。 獎勵作弊(reward hacking)是智慧體 RL 的老問題,論文給出多層防禦。其一,用觀察到的作弊案例構造中期訓練的對齊資料。其二,清理環境,例如刪除構建日誌、殘留補丁和後續的 Git 歷史。其三,容器級網路隔離。其四,專門的“作弊智慧體”持續搜尋洩漏,直到找不到新的漏洞。其五,訓練期間做離線軌跡審計。確認作弊的軌跡獎勵記零,且確認作弊的佔比在整個訓練中始終低於 2%。 成本與效果方面,論文報告 RL 成本為 Pro 260 萬美元、Flash 90 萬美元。以 Pro 為例,取樣佔算力的 43.8%,訓練佔 43.5%,打分佔 12.7%。也就是說,打分只佔一成多算力,卻決定了獎勵質量。在 DeepSWE 基準(average@3)上,Pro 從 58.4 升到 72.6,Flash 從 48.7 升到 65.7。這是 RL 過程中的提升,而不是與其他模型的橫向對比。

對開發者和企業的意義有三點。第一,它給出了一份可參考的 RL 配方:數字、成本和消融都擺在明面上。第二,作者計劃開源訓練動態、RL 環境和 RL 框架,如果兌現,將降低復現門檻。第三,128 視窗的混合注意力加 MoE,說明長上下文智慧體訓練可以靠結構設計控制成本。 侷限也要說清。首先,我只讀到論文前約一半內容,沒有看到與其他模型的完整基準對比,也沒有看到論文自己的侷限性章節,所以不對橫向排名下結論。其次,論文標題強調“自我改進”,但已讀部分描述的是人工設計的環境、打分器和防作弊流程,模型自主改進的程度需要讀完全文再判斷。再次,RL 成本數字只是訓練本身,不含資料構建和環境工程。最後,開源承諾尚未交付,復現性仍待檢驗。 總的來說,這篇論文的價值在工程細節:大批次非同步 RL、分組打分、凍結路由和多層防作弊,組合成一套可執行的智慧體 RL 流程。讀者應關注開原始碼何時放出,以及獨立評測能否復現 DeepSWE 上的提升。

Sources