EyeRobot 2.0 : regard actif pour une manipulation précise, sans caméras au poignet
EyeRobot 2.0, un framework décrit dans un preprint arXiv (2610.03710), propose de remplacer les caméras de poignet des robots bimanuels par une seule caméra stéréo mobile qui imite le regard humain. Le système pivote physiquement deux points de vue « yeux » pour centrer leur regard sur un point de fixation 3D de la scène. Les images sont ensuite traitées de façon fovéale : davantage de tokens visuels sont alloués au centre de l'image, ce qui concentre le calcul sur les éléments utiles à la tâche. Les auteurs ont collecté des données de téléopération pour 7 tâches réelles et 6 tâches simulées, puis mené plus de 1000 essais physiques et 1800 essais en simulation. Ils comparent leur approche à des politiques à stéréo passive et à des politiques « ego + caméras de poignet », entraînées sur les mêmes données. Sans caméras de poignet, une politique standard à stéréo passive voit son taux de succès réel chuter de 52 % à 27 %. EyeRobot 2.0 comble cet écart avec la seule stéréo : +40 % face à la stéréo passive en réel et +20 % en simulation. Il atteint 69 % contre 64 % pour les politiques à caméras de poignet lorsque leurs vues sont dégagées, et 48 % contre 22 % lorsque l'objet saisi occulte ces caméras.
Ces résultats touchent un choix de conception très répandu en manipulation par apprentissage : les caméras de poignet sont devenues quasi systématiques pour obtenir de la précision en saisie fine, au prix de câblage, de fragilité, d'occlusions et de coûts de calibration. Montrer qu'un regard actif peut les remplacer, et même les surpasser quand la pince masque la vue, simplifie potentiellement le matériel et réduit les pannes sur des cellules robotisées. Le résultat suggère aussi que la contrainte principale n'est pas la résolution mais l'allocation de l'attention visuelle. Il faut toutefois rester prudent : il s'agit d'un preprint, sans déploiement industriel, sur 7 tâches de laboratoire avec des données de téléopération, et les gains relatifs sont à lire avec les taux absolus, qui restent modestes (69 % au mieux).
Techniquement, la coordination du regard est hiérarchique. Une politique de bas niveau d'asservissement du regard, conditionnée par un objet cible, est entraînée par apprentissage par renforcement (RL) sur données réelles avec une récompense géométrique dense. Un sélecteur de cibles, qui émet les points de fixation selon l'avancement de la tâche, est co-entraîné avec la politique de pince en clonage comportemental (BC). Il découvre ainsi des séquences de fixation proches de celles d'un humain. Le système exprime aussi les informations de pince dans un repère SE(3) relatif à la fixation, ce qui réduit la taille de la distribution d'actions à apprendre. Cette approche prolonge les travaux de vision active et de têtes robotiques fovéales, et se positionne face aux politiques VLA multi-caméras qui s'appuient sur des vues de poignet. Aucune échéance de déploiement n'est annoncée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




