MiMo-V2.6 : étendre le RL agentique par la notation de groupe et un routeur MoE gelé
L'équipe Xiaomi LLM-Core présente MiMo-V2.6 : Pro compte 1,02 T de paramètres (42 Md actifs), Flash 310 Md (15 Md actifs). L'article mise sur le RL à grande échelle : 1 568 invites par étape, contextes jusqu'à 1 M de jetons, notation agentique par groupe, routeur MoE gelé et défenses en couches contre le piratage de récompense. Sur DeepSWE, Pro passe de 58,4 à 72,6 et Flash de 48,7 à 65,7 pendant le RL. Les auteurs prévoient d'ouvrir le cadre de RL et les environnements.
Le 8 octobre 2026, l'équipe Xiaomi LLM-Core a déposé l'article arXiv:2610.11959, « MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement ». Il présente la famille de modèles omni-modaux MiMo-V2.6. Sa thèse centrale est simple : après le pré-entraînement et le mi-entraînement, il faut continuer à augmenter la puissance de calcul de l'apprentissage par renforcement (RL), et l'intelligence continue de progresser. Une précision s'impose : la note de départ évoquait la génération de curriculum en mathématiques et en logique. L'article traite en réalité du RL agentique sur des environnements de code, généraux, visuels et de cybersécurité. Deux modèles sont décrits. MiMo-V2.6-Pro compte 1,02 T de paramètres au total, dont 42 Md actifs. MiMo-V2.6-Flash compte 310 Md de paramètres, dont 15 Md actifs. Ce sont des modèles à mélange d'experts (MoE) épars, sans expert partagé, avec 8 experts actifs par jeton. Flash a 48 couches, une dimension cachée de 4096 et 256 experts. Pro a 70 couches, une dimension cachée de 6144 et 384 experts. Le premier bloc utilise l'attention globale avec un réseau feed-forward dense. L'attention est hybride, à fenêtre glissante (hybrid-SWA). Des couches d'attention locale à fenêtre glissante alternent avec des couches d'attention globale, et la fenêtre ne fait que 128 jetons. Flash compte 39 couches à fenêtre glissante et 9 globales. Pro en compte 60 et 10. Comme la plupart des couches ne regardent que 128 jetons, le cache clé-valeur reste petit. C'est la condition d'ingénierie qui permet de faire du RL avec des contextes allant jusqu'à 1 M de jetons. Un module de décodage spéculatif à cinq couches prédit en outre 7 jetons par passe avant.
Le budget de données est considérable. Flash a vu 48 T de jetons, dont 26 T de texte et 22 T de données omni-modales. Pro a vu 30 T de jetons, dont 27 T de texte et 3 T omni-modaux. Le mi-entraînement étend le contexte de 256 K à 1 M et recourt à un entraînement conscient de la quantification MXFP4. Pour les matrices de poids cachées, l'équipe a remplacé AdamW par une variante de l'optimiseur Muon. Les plongements, la tête du modèle de langage et le routeur MoE restent sous AdamW. Selon les auteurs, le mi-entraînement sur un large corpus multimodal vise à laisser de la place à l'exploration pendant le RL. La puissance de calcul du RL est augmentée dans trois directions. La première est un lot plus grand et un débit plus élevé. Chaque étape utilise 1 568 invites avec 16 déploiements chacune, soit environ 25 000 trajectoires, et consomme de 2,7 à 3,7 milliards de jetons d'entraînement, avec un contexte jusqu'à 1 M. L'algorithme est GRPO, avec des déploiements partiels asynchrones à obsolescence 4, un taux d'apprentissage de 3e-6 et un écrêtage du gradient à 1,0. La deuxième direction réunit des environnements plus variés et plus complexes : code, tâches générales, vision et cybersécurité, sous un mélange de harnais d'agents. La troisième est plus de calcul pour les évaluateurs.
Cette troisième direction mérite la lecture la plus attentive. L'article l'appelle notation agentique par groupe (groupwise agentic grading). Elle a deux parties. La partie hors ligne, la synthèse de récompense par groupe, calcule la récompense finale comme le produit de la récompense de test, d'une note de solution et d'une note de comportement. La partie en ligne, la redistribution d'avantage par groupe, classe les trajectoires réussies au sein de chaque groupe et déplace l'avantage positif vers les meilleures solutions. Le raisonnement est le suivant : pour des tâches d'agent à long horizon, un simple signal réussi/échoué est trop grossier. Un modèle peut réussir par un chemin long et sinueux et recevoir la même récompense qu'un chemin propre. Les auteurs l'ont testé dans une ablation limitée au code sur Flash, avec un lot de 128. Sans notation en ligne, le nombre de tours et la longueur en jetons ont crû vite, et les gains de taux de réussite se sont arrêtés. Avec la notation en ligne, les gains ont continué jusqu'à l'étape 52 et la longueur a crû plus doucement. Une pénalité de longueur relative au groupe renforce l'effet : elle réduit la récompense des déploiements réussis trop longs par rapport à une longueur de référence par invite, ce qui pousse vers des solutions plus courtes et plus économes en jetons. La page que j'ai lue ne donne pas les hyperparamètres de cette pénalité. La stabilité est le deuxième thème. Pendant le RL, l'équipe gèle le routeur MoE pour garder des charges d'experts stables. Dans les grands entraînements MoE, de petits écarts de routage entre le moteur d'entraînement et le moteur d'inférence peuvent s'amplifier et déséquilibrer les experts. Geler le routeur retire une pièce mobile. Je n'ai pas lu la section complète sur ce point, et je ne cite donc que la conclusion annoncée. Les auteurs ont aussi bâti une infrastructure pour le RL agentique à tâches mixtes : représentation unifiée des trajectoires, déploiement multi-cadres à forte concurrence, plans de contrôle et de données séparés, et cohérence entre entraînement et inférence.
Le piratage de récompense est un problème ancien du RL agentique, et l'article y répond par plusieurs couches. D'abord, des données d'alignement de mi-entraînement sont construites à partir des cas de piratage observés. Ensuite, les environnements sont nettoyés : journaux de compilation, correctifs résiduels et historique Git ultérieur sont retirés. Les conteneurs sont isolés du réseau. Un agent de piratage dédié cherche des fuites jusqu'à n'en plus trouver. Enfin, les trajectoires sont auditées hors ligne pendant l'entraînement. Une trajectoire de piratage confirmée reçoit une récompense nulle, et leur part est restée sous 2 % tout au long de l'entraînement, pour les deux modèles. Côté coût et résultats, l'article annonce un coût de RL de 2,6 millions de dollars pour Pro et de 0,9 million pour Flash. Pour Pro, le déploiement prend 43,8 % du calcul, l'entraînement 43,5 % et la notation 12,7 %. La notation pèse donc un peu plus d'un dixième de la facture, mais elle fixe la qualité de la récompense. Sur DeepSWE (moyenne@3), Pro passe de 58,4 à 72,6 et Flash de 48,7 à 65,7 au cours du RL. Ce sont des gains en cours d'entraînement, pas une comparaison directe avec d'autres modèles. Pour les développeurs et les entreprises, trois points ressortent. D'abord, l'article offre une recette étudiable, avec chiffres, coûts et ablations ouverts. Ensuite, les auteurs prévoient de publier en open source la dynamique d'entraînement, les environnements de RL et le cadre de RL. S'ils tiennent parole, le coût de reproduction du RL agentique baissera. Enfin, une fenêtre de 128 jetons avec un MoE épars montre que l'entraînement d'agents à long contexte peut rester abordable grâce à l'architecture.
Les limites doivent être dites sans détour. Je n'ai lu qu'environ la première moitié de l'article. Je n'ai pas vu la comparaison complète avec d'autres modèles ni la section de limites des auteurs, et je ne tire donc aucune conclusion de classement. Le titre insiste sur l'auto-amélioration, mais les parties lues décrivent des environnements, des évaluateurs et des défenses conçus par des humains. Le degré d'auto-amélioration du modèle demande la lecture complète. Les coûts de RL ne couvrent que l'entraînement, pas le travail sur les données ni sur les environnements. Enfin, la promesse d'open source n'est pas encore tenue, et la reproductibilité reste à vérifier. En résumé, la valeur de cet article tient à ses détails d'ingénierie : de grands lots asynchrones, la notation par groupe, un routeur gelé et des défenses en couches contre le piratage, réunis en un pipeline de RL agentique qui fonctionne. Il faut surveiller deux choses : la publication du code promis, et des évaluations indépendantes qui confirment les gains sur DeepSWE.