DeepMind dévoile Gemini Robotics 2 : l'intelligence dynamique du corps entier pour les robots

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind a dévoilé Gemini Robotics 2 (GR-2), un modèle d'IA incarnée combinant le raisonnement multimodal vision-langage-action (VLA) et le contrôle dynamique de couple du corps entier. Les robots humanoïdes et les manipulateurs mobiles à deux bras peuvent désormais exécuter des suites de tâches physiques complexes dans des environnements réels non structurés, sans nécessiter de réentraînement spécifique pour chaque geste.

Contexte

L'intelligence artificielle incarnée a longtemps été freinée par une scission fondamentale dans son architecture de commande. D'un côté, les modèles vision-langage de haut niveau raisonnaient à basse fréquence (de 1 à 5 Hz) pour produire des instructions abstraites ; de l'autre, les systèmes mécaniques nécessitaient des régulateurs de dynamique fonctionnant à plus de 100 Hz pour garantir l'équilibre et compenser les frottements. Cette séparation rigide rendait les robots extrêmement maladroits face aux imprévus du monde physique, obligeant les ingénieurs à calibrer manuellement chaque nouveau mouvement par téléopération. Pour surmonter cet obstacle historique, Google DeepMind a développé Gemini Robotics 2 (GR-2), une avancée majeure vers l'autonomie physique universelle.

GR-2 supprime la frontière entre perception cognitive et motricité fine. En unifiant dans un même cadre d'apprentissage un modèle de fondation vision-langage-action et un espace d'action en couple dynamique continu, le système offre une véritable intelligence physique du corps entier. Les humanoïdes et manipulateurs mobiles dotés de GR-2 peuvent opérer dans des entrepôts chaotiques et des ateliers sans aucun réentraînement préalable, enchaînant des dizaines d'actions physiques fluides et ininterrompues.

Analyse approfondie

Sur le plan conceptuel, Gemini Robotics 2 repose sur une architecture hiérarchique à diffusion d'intentions continues. Au sommet, une dorsale multimodale dérivée de Gemini 2.5 analyse la scène spatiale à 10 Hz et génère des jetons d'intention physique latente. Ces représentations capturent non seulement les trajectoires spatiales des objets ciblés, mais également les forces de contact attendues et les contraintes de friction nécessaires à la stabilité.

Ces intentions sont immédiatement traitées par un décodeur d'action à très haute fréquence opérant à plus de 200 Hz. Ce module associe les instructions cognitives aux données proprioceptives instantanées des capteurs d'articulation, des centrales inertielles et des capteurs d'effort sous les pieds du robot. Le modèle délivre directement des consignes de couple moteur, conférant aux membres une souplesse biomécanique semblable à celle des muscles humains. Lorsqu'un impact imprévu survient, le robot absorbe la perturbation mécaniquement tout en maintenant son équilibre postural.

L'apprentissage de ce modèle titanesque a conjugué des milliers d'heures de données réelles et des milliards de trajectoires générées au sein de simulateurs physiques parallélisés. Soumis à des sols glissants, des charges asymétriques et des poussées soudaines, GR-2 a développé des réflexes d'autorégulation comparables à ceux du cervelet humain.

Impact sur l'industrie

L'arrivée de GR-2 bouleverse le secteur de la robotique industrielle et logistique. Auparavant, l'intégration d'un robot nécessitait des semaines de programmation rigide dans des environnements ultra-sécurisés. Désormais, un robot humanoïde standard équipé de GR-2 comprend des instructions verbales simples pour décharger des palettes hétérogènes, adaptant en temps réel l'ouverture de ses bras et la flexion de ses jambes selon la masse du colis manipulé.

Dans les applications médicales et l'assistance à domicile, la sécurité intrinsèque apportée par le contrôle continu de couple est déterminante. Dès qu'une personne frôle le bras du robot, le système décèle une résistance minime en quelques millisecondes et relâche sa force instantanément, éliminant tout risque de choc traumatique.

Perspectives

Plusieurs défis techniques restent à résoudre pour une adoption généralisée. Le calcul continu de réseaux neuronaux profonds à 200 Hz impose une consommation énergétique élevée, affectant l'autonomie des batteries embarquées. L'optimisation des puces de calcul neural pour les processeurs de bord constitue donc un axe de développement prioritaire.

Par ailleurs, la manipulation d'objets déformables et les assemblages de haute précision nécessiteront l'intégration native de capteurs tactiles denses pour compléter le guidage visuel. DeepMind poursuit ses recherches pour enrichir GR-2 de retours haptiques directs, ouvrant la voie à des machines capables d'accomplir avec aisance les gestes manuels les plus minutieux.

Sources

FAQ

Quel progrès majeur apporte Gemini Robotics 2 ?

Le modèle associe nativement le raisonnement visuel et textuel à un contrôle dynamique du couple moteur à plus de 200 Hz pour tout le corps.

Quel est l'atout du contrôle dynamique en couple ?

Il confère aux articulations une souplesse musculaire, absorbant les chocs imprévus et préservant l'équilibre physique avec une grande réactivité.

Quels défis freinent le déploiement massif ?

Les obstacles majeurs concernent la consommation énergétique des processeurs embarqués et l'intégration de capteurs haptiques haute résolution.