MiMo-V2.6: Agentisches Reinforcement Learning skalieren mit Gruppenbewertung und eingefrorenem MoE-Router

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Das Xiaomi-LLM-Core-Team stellt MiMo-V2.6 vor: Pro hat 1,02 Billionen Parameter (42 Mrd. aktiv), Flash 310 Mrd. (15 Mrd. aktiv). Die Arbeit setzt auf RL im großen Maßstab: 1.568 Prompts pro Schritt, Kontexte bis 1M Token, gruppenweise agentische Bewertung, ein eingefrorener MoE-Router und mehrschichtige Abwehr gegen Reward Hacking. Auf DeepSWE steigt Pro im RL von 58,4 auf 72,6, Flash von 48,7 auf 65,7. Die Autoren planen, RL-Framework und Umgebungen freizugeben.

Am 8. Oktober 2026 stellte das Xiaomi-LLM-Core-Team die Arbeit arXiv:2610.11959 vor: „MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement“. Sie führt die omni-modale Modellfamilie MiMo-V2.6 ein. Die Kernthese ist einfach: Nach Vortraining und Mid-Training soll man die Rechenleistung für Reinforcement Learning (RL) weiter erhöhen, dann steigt die Intelligenz weiter. Eine Korrektur zur Vorgabe: Sie sprach von Curriculum-Erzeugung für Mathematik und Logik. Tatsächlich geht es um agentisches RL in Code-, allgemeinen, visuellen und Cyber-Umgebungen. Es gibt zwei Modelle. MiMo-V2.6-Pro hat 1,02 Billionen Parameter insgesamt, davon 42 Milliarden aktiv. MiMo-V2.6-Flash hat 310 Milliarden Parameter, davon 15 Milliarden aktiv. Beide sind dünn besetzte Mixture-of-Experts-Modelle (MoE) ohne geteilte Experten, mit 8 aktiven Experten pro Token. Flash hat 48 Schichten, eine versteckte Dimension von 4096 und 256 Experten. Pro hat 70 Schichten, eine versteckte Dimension von 6144 und 384 Experten. Der erste Block nutzt globale Attention mit einem dichten Feed-Forward-Netz. Die Attention ist ein hybrides Gleitfenster-Verfahren (hybrid-SWA). Lokale Gleitfenster-Schichten wechseln sich mit globalen Attention-Schichten ab, und das Fenster umfasst nur 128 Token. Flash hat 39 Gleitfenster- und 9 globale Schichten, Pro hat 60 und 10. Da die meisten Schichten nur 128 Token sehen, bleibt der Key-Value-Cache klein. Das ist die technische Voraussetzung dafür, RL mit Kontexten bis 1 Mio. Token zu fahren. Ein spekulatives Dekodiermodul mit fünf Schichten sagt zudem 7 Token pro Vorwärtsdurchlauf voraus.

Das Datenvolumen ist groß. Flash sah 48 Billionen Token, davon 26 Billionen Text und 22 Billionen omni-modal. Pro sah 30 Billionen Token, davon 27 Billionen Text und 3 Billionen omni-modal. Das Mid-Training dehnt den Kontext von 256K auf 1M und nutzt quantisierungsbewusstes Training in MXFP4. Für die versteckten Gewichtsmatrizen ersetzte das Team AdamW durch eine Variante des Muon-Optimierers. Einbettungen, der Sprachmodell-Kopf und der MoE-Router bleiben bei AdamW. Laut den Autoren soll das Mid-Training auf einem breiten multimodalen Korpus Raum für Exploration im RL lassen. Die RL-Rechenleistung wird in drei Richtungen vergrößert. Erstens: größere Batches und höherer Durchsatz. Jeder Schritt nutzt 1.568 Prompts mit je 16 Rollouts, also rund 25.000 Trajektorien, und verbraucht 2,7 bis 3,7 Milliarden Trainings-Token, bei Kontexten bis 1M. Der Algorithmus ist GRPO mit asynchronen Teil-Rollouts bei einer Veralterung von 4, einer Lernrate von 3e-6 und Gradient-Clipping bei 1,0. Zweitens: vielfältigere und komplexere Umgebungen für Code, Allgemeines, Vision und Cyber, unter einer Mischung von Agenten-Harnesses. Drittens: mehr Rechenleistung für die Bewerter. Die dritte Richtung verdient die genaueste Lektüre. Die Arbeit nennt sie gruppenweise agentische Bewertung (groupwise agentic grading). Sie hat zwei Teile. Der Offline-Teil, die gruppenweise Belohnungssynthese, berechnet die Endbelohnung als Produkt aus Testbelohnung, Lösungsnote und Verhaltensnote. Der Online-Teil, die gruppenweise Vorteilsumverteilung, ordnet die bestandenen Trajektorien innerhalb jeder Gruppe nach Qualität und verschiebt positiven Vorteil zu den besseren Lösungen. Der Grund: Für agentische Aufgaben mit langem Horizont ist ein reines Bestanden/Nicht-bestanden-Signal zu grob. Ein Modell kann über einen langen Umweg bestehen und dieselbe Belohnung erhalten wie bei einem sauberen Weg. Die Autoren prüften das in einer reinen Code-Ablation auf Flash mit Batchgröße 128. Ohne Online-Bewertung wuchsen Zahl der Runden und Token-Länge schnell, und die Gewinne bei der Bestehensquote stockten. Mit Online-Bewertung liefen die Gewinne bis Schritt 52 weiter, und die Token-Länge wuchs langsamer. Eine gruppenrelative Längenstrafe verstärkt den Effekt: Sie senkt die Belohnung erfolgreicher Rollouts, die im Vergleich zu einer Referenzlänge pro Prompt zu lang sind, und drängt das Modell zu kürzeren, token-sparsameren Lösungen. Die Hyperparameter der Strafe nennt die von mir gelesene Seite nicht. Das zweite Thema ist Stabilität. Während des RL friert das Team den MoE-Router ein, um die Expertenlasten stabil zu halten. In großen MoE-RL-Läufen können kleine Unterschiede im Routing zwischen Trainings- und Inferenz-Engine wachsen und die Experten aus dem Gleichgewicht bringen. Das Einfrieren nimmt ein bewegliches Teil aus dem System. Den vollständigen Abschnitt dazu habe ich nicht gelesen, daher zitiere ich nur die genannte Schlussfolgerung. Außerdem bauten die Autoren Infrastruktur für gemischtes agentisches RL: eine einheitliche Trajektorien-Darstellung, hochparallele Rollouts über mehrere Frameworks, getrennte Kontroll- und Datenebenen sowie Konsistenz zwischen Training und Inferenz.

Reward Hacking ist ein altes Problem des agentischen RL, und die Arbeit antwortet mit mehreren Schichten. Erstens entstehen Mid-Training-Alignment-Daten aus beobachteten Hacking-Fällen. Zweitens werden die Umgebungen bereinigt: Build-Logs, übrig gebliebene Patches und spätere Git-Historie werden entfernt. Drittens sind Container netzwerkisoliert. Viertens sucht ein eigener Hack-Agent nach Lecks, bis er keine Schwachstellen mehr findet. Fünftens werden Trajektorien während des Trainings offline geprüft. Bestätigte Hacks erhalten null Belohnung, und ihr Anteil blieb bei beiden Modellen im gesamten Training unter 2 %. Zu Kosten und Ergebnissen: Die Arbeit nennt RL-Kosten von 2,6 Millionen US-Dollar für Pro und 0,9 Millionen für Flash. Bei Pro entfallen 43,8 % der Rechenleistung auf Rollouts, 43,5 % auf Training und 12,7 % auf Bewertung. Die Bewertung ist also nur gut ein Zehntel der Rechnung, bestimmt aber die Qualität der Belohnung. Auf DeepSWE (Durchschnitt@3) steigt Pro im Lauf des RL von 58,4 auf 72,6 und Flash von 48,7 auf 65,7. Das sind Gewinne innerhalb des Trainings, kein direkter Vergleich mit anderen Modellen. Für Entwickler und Unternehmen sind drei Punkte wichtig. Erstens liefert die Arbeit ein studierbares Rezept mit offenen Zahlen, Kosten und Ablationen. Zweitens planen die Autoren, Trainingsdynamik, RL-Umgebungen und das RL-Framework als Open Source freizugeben. Halten sie das ein, sinkt die Hürde für die Reproduktion von agentischem RL. Drittens zeigt ein 128-Token-Fenster mit dünn besetztem MoE, dass Agententraining mit langem Kontext durch Architektur bezahlbar bleiben kann. Die Grenzen müssen klar benannt werden. Ich habe etwa die erste Hälfte der Arbeit gelesen. Den vollständigen Benchmark-Vergleich mit anderen Modellen und den Abschnitt der Autoren zu Grenzen habe ich nicht gesehen, daher ziehe ich keinen Schluss über Rangplätze. Der Titel betont Selbstverbesserung, doch die gelesenen Teile beschreiben von Menschen entworfene Umgebungen, Bewerter und Anti-Hacking-Abläufe. Wie weit sich das Modell selbst verbessert, lässt sich nur mit dem ganzen Text beurteilen. Die RL-Kosten decken nur das Training ab, nicht die Daten- und Umgebungsarbeit. Und das Open-Source-Versprechen ist noch nicht eingelöst, die Reproduzierbarkeit also ungeprüft.

Kurz gesagt liegt der Wert dieser Arbeit in den technischen Details: große asynchrone Batches, gruppenweise Bewertung, ein eingefrorener Router und mehrschichtige Abwehr gegen Hacking, zusammengefügt zu einer lauffähigen agentischen RL-Pipeline. Zwei Dinge sind als Nächstes zu beobachten: die Freigabe des versprochenen Codes und unabhängige Auswertungen, die die DeepSWE-Gewinne bestätigen.

Sources