Gemini Robotics ER 2 : compréhension vidéo, orchestration de tâches et collaboration multi-robots pour un cerveau de haut niveau
Google DeepMind lance Gemini Robotics ER 2, présenté comme son modèle de raisonnement incarné le plus capable. Il joue le rôle de cerveau de haut niveau : il dialogue avec les humains, comprend le monde physique, planifie des tâches en plusieurs étapes et confie l'exécution motrice à un modèle vision-langage-action (VLA) de bas niveau. Grâce au flux vidéo continu, le robot suit sa progression, corrige ses erreurs et sait quand passer à l'étape suivante. La collaboration entre plusieurs robots fait son entrée. Le modèle est disponible via l'API Gemini et Google AI Studio, et en préversion privée sur la Gemini Enterprise Agent Platform.
Google DeepMind lance Gemini Robotics ER 2, qu'il présente comme son modèle de raisonnement incarné le plus capable pour la robotique. L'article d'annonce est signé Steven Hansen et Peng Xu et porte la date du 30 juillet 2026. Le positionnement est net : il ne s'agit pas d'un modèle qui pilote directement les moteurs, mais du cerveau de haut niveau du robot. Ce qui a été annoncé Selon Google, Gemini Robotics ER 2 permet à un robot de dialoguer avec les personnes, de comprendre le monde physique et de planifier des tâches en plusieurs étapes. Il confie ensuite l'exécution motrice à un modèle vision-langage-action (VLA) de niveau inférieur, quel qu'il soit. Le modèle peut aussi appeler nativement des outils comme Google Search pour chercher des informations, ainsi que toute fonction définie par l'utilisateur. Google parle d'une mise à niveau importante par rapport à Gemini Robotics ER 1.6. Trois axes ressortent : la compréhension vidéo continue, l'orchestration d'outils et de tâches, et, pour la première fois, la collaboration entre plusieurs robots.
Côté disponibilité, le modèle est accessible au public des développeurs via l'API Gemini et Google AI Studio, et en préversion privée sur la Gemini Enterprise Agent Platform. Google partage aussi des exemples de configuration et de prompts pour des tâches d'IA physique plus utiles. Fonctionnement : raisonnement en haut, contrôle en bas Google soutient qu'un raisonnement spatial précis ne suffit pas pour des robots qui doivent aider les gens au quotidien. Le robot doit aussi réfléchir vite et caler ses décisions sur le rythme réel du monde physique. C'est pourquoi ER 2 est conçu pour que le robot puisse réfléchir à la suite pendant qu'il exécute encore son action en cours. Pour les développeurs, la recette est une architecture d'agent. On déclare des interfaces de contrôle de bas niveau, comme des modèles VLA ou des API de navigation, en tant qu'outils. On envoie ensuite de la vidéo, de l'audio ou du texte multimodaux en flux direct au modèle. ER 2 choisit l'outil à appeler, avec quels arguments, et décide de la suite d'après ce qu'il voit. C'est le même schéma d'appel de fonctions que celui des agents logiciels, à ceci près que l'outil est désormais un système physique qui se déplace et saisit des objets. Google indique aussi qu'ER 2 s'intègre à l'API Gemini Live. L'extrait source que nous avons consulté s'interrompt à cette phrase : il faut donc se reporter à la documentation complète pour les détails.
Cette séparation a un avantage pratique. Le modèle de raisonnement et la politique de contrôle peuvent progresser indépendamment. Un fabricant peut obtenir une meilleure planification sans réentraîner son modèle de mouvement, et changer le contrôleur de bas niveau sans réécrire la logique de haut niveau. La boucle de retour vidéo Un pipeline classique de type planifier puis agir suppose souvent qu'une commande a réussi dès qu'elle est envoyée. ER 2 observe au contraire des flux vidéo continus. Le robot peut ainsi suivre sa propre progression, s'adapter si quelque chose tourne mal et savoir précisément quand passer à l'étape suivante. C'est essentiel dans le monde physique, où un objet peut glisser, une porte rester entrouverte ou une personne déplacer la cible. Seul un modèle de haut niveau qui voit le résultat a une chance de repérer ces écarts et de les corriger. Comment l'orchestration a été évaluée Google indique que le modèle peut être évalué avec des robots en simulation, avec un contrôle de robot réel, et même associé à un humain qui téléopère le robot. Son résultat annoncé : ER 2 surpasse systématiquement ER 1.6 pour l'orchestration d'outils dans trois modes de contrôle, à savoir VLA réel, VLA simulé et téléopération humaine. Par souci d'exactitude, l'extrait consulté ne contient ni scores chiffrés, ni latence, ni tarifs. Nous ne pouvons donc pas quantifier l'ampleur du gain. Collaboration multi-robots ER 2 introduit la collaboration multi-robots. Les robots peuvent travailler ensemble dans des espaces partagés et mener à bien des flux de travail complexes qu'un seul robot ne pourrait pas réaliser. En principe, un même modèle de haut niveau peut découper un travail, attribuer des rôles et coordonner plusieurs robots, en séquence ou en parallèle. Pour les entrepôts, les usines et l'automatisation de laboratoire, c'est un pas de la démonstration à un seul robot vers des cellules de travail coordonnées. L'extrait ne décrit ni le mécanisme de coordination ni une limite de taille de flotte : aux développeurs de les tester.
Ce que cela change pour les développeurs et les entreprises Pour les développeurs, la barrière baisse. Via l'API Gemini, ils accèdent à un planificateur qui comprend la vidéo et appelle des outils, sans construire toute une pile de raisonnement incarné. Pour les entreprises, la préversion privée offre un cadre contrôlé pour évaluer la sécurité, la conformité et le coût d'intégration. Pour l'écosystème, la séparation entre raisonnement de haut niveau et contrôle de bas niveau favorise une répartition plus claire : les éditeurs de modèles fournissent un cerveau généraliste, tandis que les fabricants de robots et les chercheurs en VLA se concentrent sur le mouvement et la manipulation. Défis et perspectives Plusieurs questions restent ouvertes. D'abord la latence : un modèle de haut niveau appelé via une API cloud doit prouver qu'il peut servir des tâches exigeant des réactions très rapides. Ensuite la fiabilité et la sécurité : si le jugement vidéo est faux, le robot peut continuer d'agir sur une croyance erronée, ce qui maintient le besoin de limites de sécurité matérielles et d'une supervision humaine. Le coût et l'échelle comptent aussi, car les configurations multi-robots multiplient les appels d'inférence et les tarifs comme les quotas conditionneront la viabilité commerciale. Enfin, le domaine a besoin de benchmarks ouverts et reproductibles pour comparer les modèles de raisonnement incarné.
En somme, Gemini Robotics ER 2 propose la planification, la supervision et la collaboration des robots sous forme de service appelable. Sa capacité à tenir ses promesses sur des sites réels et désordonnés dépendra d'évaluations indépendantes et des retours des premiers clients.