Traduction pipeline hybride d'estimation de l'attention pour une IHR adaptative avec une tête robotique expressive
Une équipe de recherche présente dans un article arXiv (soumis fin juillet 2026, référence 2608.00284) un pipeline hybride d'estimation de l'attention visuelle pour l'interaction homme-robot, testé sur une tête robotique expressive basée sur l'écosystème open source InMoov. Le système combine deux couches de perception indépendantes: une couche géométrique rapide qui suit en haute fréquence la position du visage et l'orientation de la tête pour la régulation temporelle, et une couche sémantique s'appuyant sur un modèle vision-langage (VLM) qui analyse les images brutes de la caméra égocentrique du robot pour produire des étiquettes contextuelles (attention portée au robot, usage du téléphone, regard ailleurs). Ces deux flux sont fusionnés par une machine à états finis qui pilote le comportement adaptatif du robot: activation, mise en attente, reprise d'interaction et retour au repos. Le dispositif a été évalué avec 10 participants sur 40 essais, répartis entre une condition de référence et une condition d'interaction adaptative avec distraction.
Cette démonstration illustre une tendance de fond dans la robotique sociale: le passage d'une perception purement géométrique, rapide mais limitée au suivi de pose, vers des architectures hybrides qui ajoutent une couche de compréhension contextuelle via VLM sans sacrifier la réactivité temps réel nécessaire à une interaction fluide. Pour les intégrateurs travaillant sur des robots d'accueil, d'assistance ou éducatifs, l'apport principal est méthodologique plutôt que spectaculaire: les auteurs montrent que les signaux géométriques et sémantiques apportent une information non redondante, ce qui justifie l'architecture à deux couches plutôt qu'un unique modèle VLM plus lourd et plus lent. Le résultat reste toutefois un prototype de recherche à faible échelle, avec des essais contrôlés en laboratoire et non un déploiement en conditions réelles.
InMoov, plateforme de tête et de main robotiques open source lancée par le designer français Gaël Langevin il y a plus d'une décennie, sert ici de base matérielle low-cost pour prototyper des comportements d'interaction adaptative habituellement réservés à des plateformes commerciales fermées. L'article s'inscrit dans la lignée des travaux combinant perception classique et modèles de fondation multimodaux pour l'HRI, un axe de recherche actif face à des systèmes concurrents intégrant directement la compréhension de scène dans des architectures VLA plus larges. Les auteurs ne mentionnent pas de suite commerciale ou de partenariat industriel annoncé à ce stade.
Impact indirect: la plateforme materielle InMoov utilisee dans l'etude a ete creee par le designer francais Gael Langevin, mais aucune institution ou entreprise francaise n'est impliquee dans cette recherche.
Dans nos dossiers




