GuidedAttention : attention visuelle interprétable et corrigeable pour une manipulation robotique robuste hors distribution par apprentissage par imitation
Voici l'article traduit et résumé :
Une équipe de recherche présente GuidedAttention, un framework d'apprentissage par imitation visuomoteur qui rend l'attention visuelle d'une politique robotique interprétable et corrigible par l'utilisateur. Contrairement aux approches end-to-end classiques, où l'opérateur ne peut ni voir ni ajuster ce que le robot "regarde" pour agir, GuidedAttention introduit une représentation intermédiaire explicite : des points-clés d'attention pertinents pour la tâche sont prédits à partir des images caméra, puis conditionnent une politique d'action basée sur un modèle de diffusion. L'utilisateur peut inspecter ces points-clés et les corriger une seule fois, au début de l'exécution (rollout initialization) ; un module de suivi (tracking) propage ensuite automatiquement cette correction tout au long de la tâche. Les auteurs rapportent des expériences en simulation et en conditions réelles montrant des gains de performance en manipulation robotique, particulièrement marqués dans des scénarios hors distribution (OOD), qu'il s'agisse de changements de position des objets ou de leur apparence.
L'enjeu dépasse la simple amélioration de score en benchmark. La fragilité face aux conditions hors distribution reste l'un des principaux obstacles au déploiement industriel de robots manipulateurs entraînés par imitation : une politique qui fonctionne en démonstration mais échoue dès qu'un objet change de couleur, de position ou d'éclairage a peu de valeur en usine ou en entrepôt. En rendant l'attention du modèle visible et modifiable par un humain, GuidedAttention s'attaque directement au problème de confiance et de débogage des politiques visuomotrices apprises par imitation, une boîte noire jusqu'ici difficile à corriger sans réentraînement complet. Pour les intégrateurs et ingénieurs robotique, cela ouvre la voie à un contrôle qualité plus fin des politiques déployées, avec une intervention humaine ciblée et peu coûteuse plutôt qu'une reprise de collecte de données.
Ce travail s'inscrit dans la lignée des recherches récentes sur les architectures VLA (vision-language-action) et les politiques de diffusion, où l'un des débats centraux porte justement sur l'écart entre performance en démonstration et robustesse réelle en conditions variables. En intégrant un mécanisme de correction humaine explicite plutôt qu'une simple amélioration architecturale passive, GuidedAttention se positionne comme une alternative aux approches purement bout-en-bout. L'article, disponible sur arXiv (2607.21049v1), ouvre des pistes pour des évaluations plus poussées sur des tâches de manipulation plus complexes et des déploiements en conditions industrielles réelles.
Dans nos dossiers




