MiMo-V2.6:以分组智能体打分与冻结路由扩展强化学习算力的万亿级全模态模型

Published · AI Daily — AI-assisted deep research, methodology & disclosure

小米 LLM-Core 团队发布 MiMo-V2.6 系列:Pro 为 1.02T 总参数、42B 激活,Flash 为 310B、15B 激活。论文把后训练算力押在强化学习上:每步 1,568 个提示、最长 1M 上下文,配合分组智能体打分、冻结 MoE 路由器和多层防作弊机制。DeepSWE 上 Pro 从 58.4 升至 72.6,Flash 从 48.7 升至 65.7。作者计划开源 RL 框架与环境。

小米 LLM-Core 团队在 2026 年 10 月 8 日提交了 arXiv:2610.11959,题为《MiMo-V2.6:面向自我改进的强化学习规模化》。论文介绍 MiMo-V2.6 系列全模态模型,核心主张很直接:在预训练和中期训练之后,把强化学习(RL)的算力继续做大,智能就能继续上涨。需要先说明一点:摘要和正文讲的是智能体任务上的 RL 规模化,覆盖代码、通用、视觉和网络安全环境,并不是只做数学与逻辑推理的课程生成。 模型规格如下。MiMo-V2.6-Pro 总参数 1.02T,激活参数 42B。MiMo-V2.6-Flash 总参数 310B,激活参数 15B。两者都是稀疏混合专家(MoE)结构,不设共享专家,每个 token 激活 8 个专家:Flash 有 256 个专家、48 层、隐藏维度 4096;Pro 有 384 个专家、70 层、隐藏维度 6144。第一个模块使用全局注意力加稠密前馈网络。 注意力采用混合滑动窗口结构(hybrid-SWA)。局部滑动窗口注意力与全局注意力交错排列,窗口只有 128。Flash 的 48 层中有 39 层是滑动窗口、9 层是全局注意力;Pro 的 70 层中有 60 层是滑动窗口、10 层是全局注意力。绝大多数层只看 128 个 token,因此 KV 缓存很小,这正是 RL 能把上下文推到 1M token 的工程前提。此外还有一个 5 层的推测解码模块,每次前向预测 7 个 token。

预训练与中期训练的数据量很大。Flash 训练了 48T token,其中 26T 是文本,22T 是全模态数据;Pro 训练了 30T token,其中 27T 文本、3T 全模态。中期训练把上下文从 256K 扩展到 1M,并使用 MXFP4 量化感知训练。优化器方面,隐藏层权重矩阵从 AdamW 换成 Muon 的一个变体,嵌入、语言模型头和 MoE 路由器仍用 AdamW。作者说,中期训练使用了广泛的多模态语料,目的是为后续 RL 留出探索空间。 RL 规模化沿三个方向展开。第一是更大的批量和更高的吞吐。每一步使用 1,568 个提示,每个提示 16 条采样,约 25K 条轨迹,消耗 27 亿到 37 亿个训练 token,上下文最长 1M。训练算法是 GRPO,采用异步部分采样,陈旧度(staleness)为 4,学习率 3×10⁻⁶,梯度裁剪 1.0。第二是更多样、更复杂的环境,覆盖代码、通用、视觉和网络安全,并混用多种智能体框架。第三是更多的打分(grader)算力。 第三点最值得细读,论文称之为分组式智能体打分(groupwise agentic grading)。它有两部分。离线部分叫分组奖励合成:最终奖励等于测试奖励乘以方案评分再乘以行为评分。在线部分叫分组优势重分配:在同一组里,对通过测试的轨迹按质量排序,把更多正向优势分给更好的方案。道理在于,长程智能体任务只靠通过或不通过的测试信号太粗,模型可能靠冗长、绕路的方式碰巧通过。 作者在 Flash 的纯代码消融实验中(批量 128)验证了这一点。没有在线打分时,交互轮数和 token 长度增长很快,通过率的提升停滞。加入在线打分后,通过率一直提升到第 52 步,token 长度增长也平缓得多。此外还有组相对长度惩罚:对相对每个提示参考长度而言过长的成功轨迹降低奖励。这推动模型写出更短、更省 token 的解法。论文页面没有给出惩罚的具体超参数。

稳定性是另一条主线。作者在 RL 期间冻结 MoE 路由器,以保持专家负载稳定。MoE 模型做大规模 RL 时,路由在训练与推理之间的细微不一致会放大,导致专家负载失衡和训练发散,冻结路由是一种直接的办法。(路由冻结一节的完整论证我没有读到,这里只引述论文的结论性陈述。)此外,作者构建了混合任务智能体 RL 的基础设施:统一的轨迹表示、高并发多框架采样、控制面与数据面解耦,以及训练与推理的一致性。 奖励作弊(reward hacking)是智能体 RL 的老问题,论文给出多层防御。其一,用观察到的作弊案例构造中期训练的对齐数据。其二,清理环境,例如删除构建日志、残留补丁和后续的 Git 历史。其三,容器级网络隔离。其四,专门的“作弊智能体”持续搜索泄漏,直到找不到新的漏洞。其五,训练期间做离线轨迹审计。确认作弊的轨迹奖励记零,且确认作弊的占比在整个训练中始终低于 2%。 成本与效果方面,论文报告 RL 成本为 Pro 260 万美元、Flash 90 万美元。以 Pro 为例,采样占算力的 43.8%,训练占 43.5%,打分占 12.7%。也就是说,打分只占一成多算力,却决定了奖励质量。在 DeepSWE 基准(average@3)上,Pro 从 58.4 升到 72.6,Flash 从 48.7 升到 65.7。这是 RL 过程中的提升,而不是与其他模型的横向对比。

对开发者和企业的意义有三点。第一,它给出了一份可参考的 RL 配方:数字、成本和消融都摆在明面上。第二,作者计划开源训练动态、RL 环境和 RL 框架,如果兑现,将降低复现门槛。第三,128 窗口的混合注意力加 MoE,说明长上下文智能体训练可以靠结构设计控制成本。 局限也要说清。首先,我只读到论文前约一半内容,没有看到与其他模型的完整基准对比,也没有看到论文自己的局限性章节,所以不对横向排名下结论。其次,论文标题强调“自我改进”,但已读部分描述的是人工设计的环境、打分器和防作弊流程,模型自主改进的程度需要读完全文再判断。再次,RL 成本数字只是训练本身,不含数据构建和环境工程。最后,开源承诺尚未交付,复现性仍待检验。 总的来说,这篇论文的价值在工程细节:大批量异步 RL、分组打分、冻结路由和多层防作弊,组合成一套可运行的智能体 RL 流程。读者应关注开源代码何时放出,以及独立评测能否复现 DeepSWE 上的提升。

Sources