Gemini Robotics ER 2: Videoverständnis, Aufgabenorchestrierung und Multi-Roboter-Zusammenarbeit als übergeordnetes Robotergehirn

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind hat Gemini Robotics ER 2 vorgestellt, nach eigenen Angaben das bislang leistungsfähigste Modell für verkörpertes Schlussfolgern. Es soll als übergeordnetes Gehirn eines Roboters dienen: Es spricht mit Menschen, versteht die physische Welt, plant mehrstufige Aufgaben und übergibt die Motorsteuerung an ein untergeordnetes Vision-Language-Action-Modell (VLA). Über kontinuierliche Videoströme verfolgt der Roboter seinen Fortschritt, korrigiert Fehler und erkennt, wann der nächste Schritt beginnt. Neu ist die Zusammenarbeit mehrerer Roboter. Entwickler nutzen das Modell über die Gemini API und Google AI Studio, als private Vorschau auch auf der Gemini Enterprise Agent Platform.

Google DeepMind hat Gemini Robotics ER 2 vorgestellt, nach eigener Darstellung das bislang leistungsfähigste Modell für verkörpertes Schlussfolgern in der Robotik. Der Ankündigungsbeitrag stammt von Steven Hansen und Peng Xu und trägt das Datum 30. Juli 2026. Die Einordnung ist eindeutig: Es ist kein Modell, das Motoren direkt ansteuert, sondern das übergeordnete Gehirn des Roboters. Was angekündigt wurde Laut Google kann ein Roboter mit Gemini Robotics ER 2 mit Menschen sprechen, die physische Welt verstehen und mehrstufige Aufgaben planen. Die eigentliche Motorsteuerung übergibt er an ein beliebiges untergeordnetes Vision-Language-Action-Modell (VLA). Das Modell kann zudem Werkzeuge wie die Google-Suche nativ aufrufen, um Informationen zu finden, ebenso benutzerdefinierte Funktionen. Google nennt es ein deutliches Upgrade gegenüber Gemini Robotics ER 1.6. Drei Themen stehen im Vordergrund: kontinuierliches Videoverständnis, die Orchestrierung von Werkzeugen und Aufgaben sowie, erstmals, die Zusammenarbeit mehrerer Roboter.

Zur Verfügbarkeit: Das Modell steht Entwicklern öffentlich über die Gemini API und Google AI Studio bereit, auf der Gemini Enterprise Agent Platform als private Vorschau. Google teilt außerdem Beispiele, wie sich das Modell konfigurieren und für nützlichere physische KI-Aufgaben ansprechen lässt. Funktionsweise: Denken oben, Steuern unten Google argumentiert, dass präzises räumliches Schlussfolgern für Roboter im Alltag nicht genügt. Ein Roboter muss auch schnell denken und seine Entscheidungen im Tempo der physischen Welt treffen. Deshalb ist ER 2 so ausgelegt, dass ein Roboter über den nächsten Schritt nachdenken kann, während er noch die aktuelle Aktion ausführt. Für Entwickler ergibt sich ein agentisches Setup. Man deklariert Steuerungsschnittstellen niedriger Ebene, etwa VLA-Modelle oder Navigations-APIs, als Werkzeuge. Anschließend streamt man multimodales Video, Audio oder Text direkt in das Modell. ER 2 entscheidet, welches Werkzeug mit welchen Argumenten aufgerufen wird und was als Nächstes zu tun ist, abhängig davon, was es sieht. Das entspricht dem Funktionsaufruf-Muster, das Software-Agenten schon nutzen. Der Unterschied: Das Werkzeug ist jetzt ein physisches System, das sich bewegt und greift. Google erwähnt zudem, dass ER 2 in die Gemini Live API integriert ist. Der uns vorliegende Quellenauszug bricht an dieser Stelle ab, Details stehen daher nur in der vollständigen Dokumentation.

Die Schichtung hat einen praktischen Vorteil. Das Denkmodell und die Steuerungspolitik lassen sich unabhängig verbessern. Ein Roboterhersteller kann bessere Planung erhalten, ohne sein Bewegungsmodell neu zu trainieren, und den Low-Level-Controller austauschen, ohne die übergeordnete Logik umzuschreiben. Die Video-Rückkopplung Eine klassische Pipeline aus Planen und Ausführen nimmt oft an, dass ein Befehl nach dem Senden erfolgreich war. ER 2 beobachtet dagegen kontinuierliche Videoströme. Damit kann ein Roboter seinen eigenen Fortschritt verfolgen, sich anpassen, wenn etwas schiefgeht, und genau wissen, wann der nächste Schritt beginnt. In der physischen Welt ist das wichtig: Ein Gegenstand kann abrutschen, eine Tür angelehnt bleiben oder eine Person das Ziel verschieben. Nur ein übergeordnetes Modell, das das Ergebnis sieht, kann solche Abweichungen bemerken und korrigieren. Wie die Orchestrierung bewertet wurde Google erklärt, das Modell lasse sich mit Robotern in der Simulation, mit realer Robotersteuerung und sogar gekoppelt an einen Menschen bewerten, der den Roboter fernsteuert. Das genannte Ergebnis: ER 2 übertrifft ER 1.6 bei der Werkzeugorchestrierung durchgängig in drei Steuerungsmodi, nämlich reales VLA, simuliertes VLA und menschliche Teleoperation. Der Genauigkeit halber: Der geprüfte Auszug enthält keine numerischen Benchmarkwerte, keine Latenzangaben und keine Preise. Das Ausmaß der Verbesserung lässt sich daher nicht beziffern. Zusammenarbeit mehrerer Roboter ER 2 führt die Zusammenarbeit mehrerer Roboter ein. Roboter können in gemeinsam genutzten Räumen kooperieren und komplexe Arbeitsabläufe erledigen, die ein einzelner Roboter nicht allein bewältigen könnte. Im Prinzip kann ein übergeordnetes Modell eine Aufgabe aufteilen, Rollen zuweisen und mehrere Roboter nacheinander oder parallel koordinieren. Für Lager, Fabriken und Laborautomatisierung ist das ein Schritt von Einzelroboter-Demos hin zu koordinierten Arbeitszellen. Der Auszug beschreibt weder den Koordinationsmechanismus noch eine Obergrenze der Flottengröße. Entwickler müssen das selbst testen.

Bedeutung für Entwickler und Unternehmen Für Entwickler sinkt die Einstiegshürde. Über die Gemini API erreichen sie einen Planer, der Video versteht und Werkzeuge aufruft, ohne einen vollständigen Stack für verkörpertes Schlussfolgern selbst zu bauen. Für Unternehmen bietet die private Vorschau einen kontrollierten Weg, Sicherheit, Compliance und Integrationskosten zu prüfen. Für das Ökosystem fördert die Entkopplung von übergeordnetem Denken und untergeordneter Steuerung eine klarere Arbeitsteilung: Modellanbieter liefern ein allgemeines Gehirn, Roboterhersteller und VLA-Forscher konzentrieren sich auf Bewegung und Manipulation. Herausforderungen und Ausblick Mehrere Fragen bleiben offen. Zuerst die Latenz: Ein übergeordnetes Modell, das über eine Cloud-API erreicht wird, muss zeigen, dass es auch Aufgaben mit sehr schnellen Reaktionszeiten bedienen kann. Dann Zuverlässigkeit und Sicherheit: Liegt die Videobewertung falsch, kann ein Roboter auf einer falschen Annahme weiterarbeiten, weshalb Sicherheitsgrenzen in der Hardware und menschliche Aufsicht unverzichtbar bleiben. Auch Kosten und Skalierung zählen, denn Mehrroboter-Aufbauten vervielfachen die Inferenzaufrufe, und Preise sowie Kontingente bestimmen die Wirtschaftlichkeit. Schließlich braucht das Feld offene, reproduzierbare Benchmarks, um Modelle für verkörpertes Schlussfolgern zu vergleichen.

Insgesamt bündelt Gemini Robotics ER 2 Planung, Überwachung und Zusammenarbeit von Robotern als aufrufbaren Dienst. Ob es auf unordentlichen realen Einsatzorten hält, was es verspricht, hängt von unabhängigen Tests und den Erfahrungen früher Kunden ab.

Sources