EyeRobot 2.0 : le regard actif permet une manipulation précise sans caméras de poignet

Published · AI Daily — AI-assisted deep research, methodology & disclosure

EyeRobot 2.0 n'utilise qu'une caméra stéréo et fait pivoter deux points de vue « oculaires » vers un point de fixation 3D, comme le ferait un humain. Il alloue plus de jetons visuels au centre de l'image. Un apprentissage par renforcement hiérarchique pilote le regard, et les actions de la pince sont exprimées dans un repère SE(3) relatif à la fixation. Avec la seule stéréo passive, le succès réel tombe de 52 % à 27 %. EyeRobot 2.0 la dépasse de 40 % en réel et de 20 % en simulation. Il égale ego plus poignet quand les vues sont dégagées (69 % contre 64 %) et fait plus du double sous occlusion (48 % contre 22 %).

Contexte : pourquoi un robot doit choisir où regarder

En manipulation bimanuelle fine, la façon dont une politique reçoit l'image fixe son plafond de performance. La recette courante associe une caméra de tête (ego) et une caméra sur chaque poignet. Les caméras de poignet sont proches de la pince et montrent les détails de la saisie et de l'insertion. Elles ont aussi un coût : du matériel en plus, des câbles, de la calibration, et un problème plus difficile. L'objet saisi bouche souvent la vue du poignet.

EyeRobot 2.0 prend un autre chemin. Inspiré de la vision humaine, il n'utilise qu'une seule caméra stéréo et laisse le robot fixer un point 3D de la scène, comme le ferait une personne. L'article nomme ce mécanisme la fixation visuelle active (Active Visual Fixation, AVF). Le pari est simple : au lieu d'ajouter des caméras pour couvrir tous les angles, on oriente une seule paire de caméras vers l'endroit le plus important à chaque instant.

Architecture centrale : trois éléments qui coopèrent

Fixation physique. Le système choisit un point de fixation 3D, puis fait pivoter les deux points de vue « oculaires » pour que les deux lignes de visée convergent vers lui. C'est une vraie rotation mécanique, pas un recadrage d'image.

Traitement fovéal. Les images entrent dans le réseau avec plus de jetons visuels au centre et moins en périphérie. Cela reproduit la fovéa humaine, haute résolution au milieu, basse résolution sur les bords. Le calcul se concentre sur les éléments utiles à la tâche.

Contrôle hiérarchique du regard. Le regard ne peut pas bouger au hasard. Il doit suivre la tâche. L'article emploie deux niveaux. Le niveau bas est une politique d'asservissement du regard, conditionnée par un objet cible, qui oriente les yeux vers lui. Le niveau haut est un sélecteur de cible, qui émet le prochain objectif de fixation selon l'avancement de la tâche.

Entraînement : apprentissage par renforcement sur données réelles

La politique d'asservissement est entraînée par apprentissage par renforcement avec une récompense géométrique dense. La récompense mesure l'alignement entre le regard et la cible. Le signal est dense, ce qui convient à l'apprentissage sur un vrai robot.

Le sélecteur de cible est la pièce la plus intéressante. Il est entraîné conjointement avec la politique de pince par clonage de comportement (BC). Aucune étiquette humaine n'indique où regarder. Le sélecteur découvre des séquences de fixation pendant qu'il est optimisé avec la politique de pince. Les auteurs indiquent que ces séquences peuvent ressembler à celles d'un humain qui réalise la même tâche. Le comportement du regard peut donc émerger du seul objectif de réussite de la tâche.

Représentation d'action : un repère SE(3) relatif à la fixation

EyeRobot 2.0 se sert aussi du point de fixation pour simplifier l'apprentissage des actions. Il exprime les informations de la pince dans un repère SE(3) relatif à la fixation. La pose de la pince n'est plus donnée par rapport à la base du robot, mais par rapport au point de fixation courant.

Cela réduit la distribution d'actions à apprendre. La plage des positions et des orientations se resserre, et la politique l'ajuste plus facilement. Pour des jeux de données de téléopération de taille limitée, cette compression a une vraie valeur.

Expériences et résultats clés

Les auteurs ont collecté des données de téléopération pour 7 tâches réelles et 6 tâches simulées. Ils ont mené plus de 1000 essais physiques et 1800 essais simulés. Les références sont une politique stéréo passive et une politique ego plus caméras de poignet, entraînées sur les mêmes données. Résultats principaux : - Retirer les caméras de poignet coûte cher aux politiques classiques. Avec la seule stéréo passive, le taux de réussite réel passe de 52 % à 27 %.

  • EyeRobot 2.0 comble cet écart avec la seule stéréo. Il dépasse la stéréo passive de 40 % en réel et de 20 % en simulation.
  • Quand les vues de poignet sont dégagées, il égale les politiques ego plus poignet : 69 % contre 64 %.
  • Quand l'objet saisi masque les caméras de poignet, il atteint 48 %, contre 22 % pour les politiques ego plus poignet. C'est plus du double.

Le dernier résultat est le plus parlant. L'échec d'une caméra de poignet sous occlusion est une limite physique. Une caméra à regard actif reste hors de l'objet et peut surveiller la zone de contact sous un bon angle.

Compromis de coût et de latence

Côté matériel, le système retire les caméras de poignet et garde une paire stéréo. Il ajoute un mécanisme qui fait pivoter les deux points de vue. On échange un nombre de caméras contre des degrés de liberté mécaniques.

Côté calcul, l'allocation fovéale concentre le calcul au centre de l'image, ce qui réduit en principe le coût de la périphérie. Le résumé ne donne aucun chiffre de latence ou de calcul : ces gains sont à vérifier dans l'article complet. L'asservissement du regard doit aussi tourner en continu pendant la tâche, ce qui complique la boucle de contrôle.

Ce que cela change pour les développeurs et l'industrie

Pour les équipes de robotique, ce travail propose une façon réaliste de simplifier les capteurs. Câbles, calibration, maintenance et occlusion des caméras de poignet sont de vrais coûts en production de série et en déploiement long. Si une paire stéréo mobile atteint un taux de réussite égal ou meilleur, la nomenclature se raccourcit.

Pour les méthodes d'apprentissage, l'article montre l'intérêt de traiter la perception comme une action. Le regard n'est plus une entrée passive : c'est une décision qu'on peut apprendre et optimiser. La représentation d'action relative à la fixation peut aussi servir à d'autres cadres d'apprentissage par imitation.

Limites et perspectives

Plusieurs points demandent de la prudence. D'abord, la tête du robot doit porter un mécanisme oculaire mobile, ce qui n'est pas prêt à l'emploi sur les plateformes actuelles. Ensuite, 7 tâches réelles forment un ensemble solide mais encore à l'échelle du laboratoire ; la généralisation à des environnements ouverts reste à prouver. Troisièmement, le sélecteur de cible dépend de l'entraînement conjoint avec la politique BC, donc la qualité des données influence celle des séquences de fixation. Enfin, la gestion de l'instabilité visuelle brève pendant les changements de regard est un détail à vérifier dans l'article complet.

Les pistes futures incluent l'association du regard actif à de grands modèles vision-langage-action, pour que des instructions en langage naturel pilotent la cible de fixation, ainsi que des tests sur des tâches plus longues et en manipulation mobile, et des mécanismes oculaires plus légers. Au total, EyeRobot 2.0 défend une thèse claire : apprendre à un robot où regarder peut remplacer l'ajout de caméras.

Sources