Aller au contenu principal
RecherchearXiv cs.RO 

EyeRobot 2.0 : regard actif pour une manipulation précise, sans caméras au poignet

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

EyeRobot 2.0, un framework décrit dans un preprint arXiv (2610.03710), propose de remplacer les caméras de poignet des robots bimanuels par une seule caméra stéréo mobile qui imite le regard humain. Le système pivote physiquement deux points de vue « yeux » pour centrer leur regard sur un point de fixation 3D de la scène. Les images sont ensuite traitées de façon fovéale : davantage de tokens visuels sont alloués au centre de l'image, ce qui concentre le calcul sur les éléments utiles à la tâche. Les auteurs ont collecté des données de téléopération pour 7 tâches réelles et 6 tâches simulées, puis mené plus de 1000 essais physiques et 1800 essais en simulation. Ils comparent leur approche à des politiques à stéréo passive et à des politiques « ego + caméras de poignet », entraînées sur les mêmes données. Sans caméras de poignet, une politique standard à stéréo passive voit son taux de succès réel chuter de 52 % à 27 %. EyeRobot 2.0 comble cet écart avec la seule stéréo : +40 % face à la stéréo passive en réel et +20 % en simulation. Il atteint 69 % contre 64 % pour les politiques à caméras de poignet lorsque leurs vues sont dégagées, et 48 % contre 22 % lorsque l'objet saisi occulte ces caméras.

Ces résultats touchent un choix de conception très répandu en manipulation par apprentissage : les caméras de poignet sont devenues quasi systématiques pour obtenir de la précision en saisie fine, au prix de câblage, de fragilité, d'occlusions et de coûts de calibration. Montrer qu'un regard actif peut les remplacer, et même les surpasser quand la pince masque la vue, simplifie potentiellement le matériel et réduit les pannes sur des cellules robotisées. Le résultat suggère aussi que la contrainte principale n'est pas la résolution mais l'allocation de l'attention visuelle. Il faut toutefois rester prudent : il s'agit d'un preprint, sans déploiement industriel, sur 7 tâches de laboratoire avec des données de téléopération, et les gains relatifs sont à lire avec les taux absolus, qui restent modestes (69 % au mieux).

Techniquement, la coordination du regard est hiérarchique. Une politique de bas niveau d'asservissement du regard, conditionnée par un objet cible, est entraînée par apprentissage par renforcement (RL) sur données réelles avec une récompense géométrique dense. Un sélecteur de cibles, qui émet les points de fixation selon l'avancement de la tâche, est co-entraîné avec la politique de pince en clonage comportemental (BC). Il découvre ainsi des séquences de fixation proches de celles d'un humain. Le système exprime aussi les informations de pince dans un repère SE(3) relatif à la fixation, ce qui réduit la taille de la distribution d'actions à apprendre. Cette approche prolonge les travaux de vision active et de têtes robotiques fovéales, et se positionne face aux politiques VLA multi-caméras qui s'appuient sur des vues de poignet. Aucune échéance de déploiement n'est annoncée.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Agir en mètres : apprentissage des interactions métriques pour une manipulation robotique précise
1arXiv cs.RO 

Agir en mètres : apprentissage des interactions métriques pour une manipulation robotique précise

Des chercheurs publient sur arXiv (article 2609.18243, soumis en septembre 2026) un nouveau cadre baptisé "metric interaction framework", conçu pour améliorer la précision des modèles de manipulation robotique conditionnés par le langage, qu'il s'agisse de Vision-Language-Action models (VLA) ou de World-Action Models (WAM). Le système repose sur deux composants : les Interaction-Centric Tokens (ICT), qui représentent explicitement la trajectoire de pose de l'effecteur terminal par rapport aux objets manipulés et sont débruités conjointement avec les actions, et le Metric Action Interaction Field (MAIF), qui fait attention aux caractéristiques métriques du nuage de points de la scène pour générer des corrections d'action conditionnées par la géométrie. Ajouté à des modèles VLA et WAM existants via une adaptation en deux étapes, avec peu de paramètres et d'étapes d'entraînement supplémentaires, le framework produit des gains de taux de réussite de 0,80 point sur le benchmark LIBERO, 3,59 points sur RoboTwin 2.0, 6,80 points sur des tâches réelles et 7,45 points sur leurs variantes hors distribution. Ce travail s'attaque à un angle mort récurrent des VLA actuels : ces modèles excellent souvent à comprendre sémantiquement une consigne mais laissent implicites les relations métriques précises entre le geste, l'objet et la géométrie de la scène, ce qui limite leur fiabilité dès que la configuration spatiale change. En ancrant explicitement les actions dans un espace cartésien partagé à l'échelle métrique, les auteurs cherchent à combler l'écart entre démonstration en environnement contrôlé et robustesse en conditions réelles, un point sensible pour les intégrateurs industriels qui reprochent aux VLA génériques leur fragilité hors distribution. Le fait que la méthode s'ajoute, sans refonte lourde, à des baselines existantes en fait potentiellement un module d'amélioration incrémentale plutôt qu'une architecture concurrente, ce qui est notable dans un secteur où chaque nouveau papier revendique une rupture complète. Le papier s'inscrit dans la lignée des travaux cherchant à doter les modèles de manipulation robotique d'un raisonnement spatial plus explicite, en réponse aux limites documentées des architectures VLA purement sémantiques face à des tâches exigeant du contact précis avec des objets. Les résultats restent validés sur des benchmarks de simulation standards (LIBERO, RoboTwin 2.0) et un nombre limité de tâches réelles, sans indication de partenaire industriel, de déploiement commercial ni de calendrier de suite ; il s'agit à ce stade d'une contribution académique destinée à être reprise et testée par d'autres équipes de recherche en robotique manipulative.

RecherchePaper
1 source
RoboSeg : reconstruction sémantique en ligne au niveau des pièces pour la manipulation robotique via une seule caméra montée sur pince
2arXiv cs.RO 

RoboSeg : reconstruction sémantique en ligne au niveau des pièces pour la manipulation robotique via une seule caméra montée sur pince

RoboSeg est un système de perception robotique présenté dans un article déposé sur arXiv (arXiv:2608.09778v1) qui vise à reconnaître non pas des objets entiers mais leurs parties actionnables : poignées, bords, gâchettes, embouts d'outils. Le système interroge un modèle vision-langage (VLM) sur une première image RGB pour identifier des invites de parties fonctionnelles, puis combine deux flux asynchrones : un thread géométrique haute fréquence pour l'odométrie RGB-D et la fusion TSDF, et un thread sémantique déclenché par images clés utilisant SAM3 pour segmenter les parties. Les masques projetés sont fusionnés par vote temporel au niveau voxel pour construire une carte de points étiquetée, persistante, sans nécessiter de modèle CAD ni de maillage pré-scanné. Cette carte sert ensuite à assigner les candidats de prise à 6 degrés de liberté générés par AnyGrasp à la partie sémantique pertinente pour la tâche demandée. Les résultats rapportés atteignent 83,4% de mIoU (intersection sur union moyenne) sur des objets annotés manuellement, et lors d'un pilote physique de 24 essais couvrant quatre objets et huit tâches, la prise sélectionnée a touché la partie demandée dans tous les essais, pour 21 réussites sur 24 au total. L'intérêt de ce travail pour les intégrateurs et chercheurs en robotique tient au fait qu'il traite un angle mort classique des pipelines de manipulation : la plupart des systèmes de préhension raisonnent au niveau de l'objet entier, sans distinguer la partie fonctionnellement pertinente pour une tâche donnée. En s'appuyant uniquement sur une caméra montée sur l'effecteur (eye-in-hand) et sur des modèles de fondation existants plutôt que sur des CAO préalables, RoboSeg propose une couche d'indexation sémantique généralisable à des environnements non structurés. Le papier reste toutefois prudent sur la portée de la validation : le pilote physique ne couvre que quatre objets et 24 essais, un échantillon restreint qui limite la généralisation des taux de réussite annoncés. Ce travail s'inscrit dans la tendance actuelle combinant modèles vision-langage et générateurs de prises pré-entraînés plutôt que de réentraîner des systèmes de bout en bout. Les auteurs positionnent explicitement RoboSeg comme une couche complémentaire à AnyGrasp, conservé comme générateur de propositions de préhension, et non comme un remplacement. Il s'agit d'un article de recherche académique récemment publié, sans mention d'un déploiement industriel ni d'un partenaire commercial ; les prochaines étapes concernant une éventuelle extension à davantage d'objets, de tâches ou de plateformes robotiques ne sont pas précisées dans le résumé.

RecherchePaper
1 source
Fisheye-VLA : découpler couverture et acuité pour la manipulation avec une seule caméra fisheye
3arXiv cs.RO 

Fisheye-VLA : découpler couverture et acuité pour la manipulation avec une seule caméra fisheye

Des chercheurs présentent sur arXiv (2609.25750v1) Fisheye-VLA, un système de perception qui remplace la paire caméra frontale plus caméra de poignet, standard en manipulation robotique, par une unique caméra fisheye passive. Une vue globale de cette caméra conserve l'ensemble de l'espace de travail, tandis que des recadrages en perspective, extraits de la même image, fournissent le détail local nécessaire au contact. Une étude contrôlée de re-rendu, comparant plusieurs directions de recadrage sur les mêmes séquences enregistrées, montre que des vues centrées sur l'organe terminal captent l'essentiel du bénéfice d'un espace de candidats bien plus vaste, ce qui justifie de concentrer le budget visuel autour des deux mains. Le suivi combine projection calibrée de la position de l'effecteur, anticipation du mouvement et un encodage de rayons partagé qui garde la cohérence spatiale des recadrages en mouvement. Associé à un modèle vision-language-action pré-entraîné, le système atteint 84% et 82% de réussite sur deux zones de table étendues où certaines cibles sortent du champ d'une caméra frontale classique, et gère aussi des tâches sur étagère et sur convoyeur. Pour l'industrie, l'enjeu est matériel autant qu'algorithmique : supprimer la caméra de poignet physique réduit le câblage, les points de défaillance mécanique et les coûts de calibration sur les bras manipulateurs, un argument concret pour les intégrateurs qui cherchent à déployer des VLA hors des démonstrations contrôlées. Les ablations montrent que les recadrages locaux et leur orientation gagnent en importance à mesure que l'espace de travail s'agrandit, preuve que le gain n'est pas cosmétique : il devient déterminant dès que les cibles s'éloignent du centre de la scène, précisément là où les rigs à caméra frontale unique échouent. Le travail s'inscrit dans la tendance des modèles vision-language-action, qui reposent presque tous sur des rigs multi-caméras dédiés, coûteux à calibrer et à entretenir sur des bras industriels. En montrant qu'une seule caméra fisheye passive, correctement traitée, peut remplacer ce montage sans perte mesurable de performance, l'étude ouvre la voie à des architectures de perception plus légères pour de futurs déploiements en logistique et en entrepôt. Elle reste toutefois, à ce stade, une validation en environnement de recherche contrôlé, sans indication d'un déploiement commercial ni d'un partenaire industriel identifié.

RechercheActu
1 source
ActGaze : apprendre un regard ancré dans l'action via des interventions visuelles contrefactuelles pour une manipulation de haute précision
4arXiv cs.RO 

ActGaze : apprendre un regard ancré dans l'action via des interventions visuelles contrefactuelles pour une manipulation de haute précision

Des chercheurs ont mis en ligne le 25 septembre 2026 sur arXiv (arXiv:2609.28955) une méthode baptisée ActGaze, destinée à améliorer la précision des modèles vision-langage-action (VLA) utilisés en manipulation robotique. Le constat de départ est que les VLA actuels échouent souvent sur les tâches fines parce que leur attention visuelle se disperse sur des zones de l'image sans rapport avec la tâche à accomplir. ActGaze entraîne la politique VLA à concentrer son regard sur les régions pertinentes, à l'image d'un humain qui fixe les indices visuels critiques lors d'un geste précis. Contrairement aux approches antérieures qui s'appuient sur des annotations externes de regard fournies manuellement, ActGaze dérive sa supervision spatiale directement de l'objectif d'action du modèle lui-même, en utilisant des interventions visuelles contrefactuelles pour identifier quelles régions de l'image sont réellement déterminantes dans la prédiction du geste. Les auteurs rapportent des expériences menées sur robot réel, et non en simulation, portant sur quatre tâches de manipulation à haute précision; le résumé ne précise ni payload, ni degrés de liberté, ni temps de cycle des plateformes testées. Pour l'industrie robotique, ce travail s'attaque à un point de friction précis: l'écart entre les démonstrations spectaculaires de VLA généralistes et leur fiabilité réelle sur des gestes fins comme l'insertion de précision ou la préhension d'objets fragiles, un écart souvent pointé par les intégrateurs comme le principal obstacle à la mise en production. En montrant qu'un signal d'attention utile peut être extrait de l'objectif d'action lui-même plutôt que d'annotations humaines coûteuses, ActGaze propose une piste pour fiabiliser les politiques VLA sans alourdir les pipelines de collecte de données, un enjeu direct pour tout acteur cherchant à déployer ces modèles au-delà du laboratoire. Ce papier s'inscrit dans la vague de recherche récente sur les modèles VLA (dans la lignée de familles comme Pi-0 ou GR00T N2, largement discutées dans le secteur), où la robustesse de la perception reste un sujet ouvert malgré les progrès sur l'échelle des données et des modèles. L'article ne mentionne ni partenaire industriel, ni plateforme robotique commerciale précise, ni calendrier de transfert vers un produit: il s'agit d'une contribution méthodologique publiée en preprint, dont la reproductibilité et l'adoption par d'autres équipes de recherche resteront à observer dans les mois suivant sa publication.

RechercheActu
1 source