Preuves d'interaction ancrées sur l'instance : ancrer les plans du robot dans les gestes de désignation et de manipulation humains
Des chercheurs proposent l'« instance-anchored interaction évidence » (IAE), une méthode qui permet à un robot d'agir sur ce qu'une personne a montré plutôt que dit : quel carton, parmi plusieurs identiques, a été désigné du doigt, ou quelle boîte a été manipulée. Le défaut à corriger est que le plan s'exécute à partir de la scène finale, alors que l'indice survient plus tôt, parfois sur des objets qui ont bougé depuis. L'IAE associe chaque objet de la scène finale à un identifiant public, conserve son identité tout au long de la vidéo par propagation arrière de masques, puis décrit chaque image par la géométrie entre mains, avant-bras et instances. Un réseau d'évidence, entraîné uniquement à partir des résultats des tâches, note les instances. Pour le pointage, un programme dynamique contraint par une grammaire, entraîné avec une perte structurée, décode des programmes objet-destination. Des programmes symboliques, sans apprentissage, traitent la désambiguïsation des références et les tâches épisodiques. Sur 1 255 requêtes du benchmark WatchAct, évaluées par exécution symbolique, l'IAE atteint 64,2 % de succès de plan sur les tâches à intention implicite, contre 27,5 % pour un modèle vision-langage de 32 milliards de paramètres (succès strict : 49,7 % contre 15,4 %). Sur la restauration, l'inversion et l'imitation, sans entraînement spécifique, elle obtient 46,4 % contre 27,0 %.
Ces chiffres montrent que l'écart ne vient pas d'une meilleure perception brute, mais de la manière dont l'information est structurée. Les auteurs ont testé des contrôles avec les mêmes surcouches de perception, les mêmes 32 images, un suivi vers l'avant, ou un modèle de relations entraîné sur les mêmes étiquettes. Aucun n'explique le gain. Lorsque le même modèle de langage reçoit l'évidence de l'IAE sous forme de texte, avec sa signification expliquée, il monte à 57,4 %. L'essentiel du bénéfice vient donc de l'ancrage des preuves sur les instances, et les programmes explicites ajoutent 6,8 points à un coût bien moindre. Pour les intégrateurs et les équipes qui déploient des robots d'assistance en logistique ou en collaboration homme-robot, c'est un argument en faveur d'architectures hybrides (perception structurée plus exécution symbolique) plutôt que d'un grand modèle généraliste alimenté par des images brutes. Le pointage reste toutefois le cas le plus difficile, avec seulement 16,9 % de succès strict, ce qui rend la méthode inadaptée à un déploiement sans supervision pour ce type d'interaction. Il s'agit en outre d'un résultat de benchmark en laboratoire, et non d'un déploiement réel.
Ce travail s'inscrit dans l'effort de rendre les modèles vision-langage-action et les planificateurs fondés sur des VLM capables de comprendre l'intention humaine dans des scènes encombrées, où l'identité des objets se perd quand ils sont déplacés. Les modèles généralistes de 32 milliards de paramètres restent la référence comparée ici, et leur faiblesse sur les objets identiques est mise en évidence. La publication est un preprint arXiv (v1), non évalué par des pairs, et le code est disponible sur GitHub (WeiZhou96/iae-watchact). Aucun calendrier de pilote industriel n'est annoncé. Les prochaines étapes probables concernent l'amélioration du pointage et la validation sur des robots réels, au-delà de l'évaluation par exécution symbolique.
Dans nos dossiers




