STARS : de la dynamique spatiotemporelle aux représentations sociales dans l'interaction homme-robot
Des chercheurs ont publié sur arXiv (2609.40245) SocialNav-SUB, le Social Navigation Scene Understanding Benchmark, un jeu de données et un banc d'essai de questions-réponses visuelles (VQA) conçu pour mesurer la compréhension de scène des modèles vision-langage (VLM) en navigation sociale. Les questions couvrent trois niveaux de raisonnement : spatial, spatio-temporel (relations entre agents au fil du temps) et social (intentions humaines). Elles s'appuient sur des scénarios réels de robots évoluant parmi des humains. Les VLM de pointe testés sont comparés à deux références : un consensus d'annotateurs humains et une approche simple à base de règles. Le résultat principal est que le meilleur VLM atteint une probabilité d'accord avec les réponses humaines jugée encourageante, mais reste en dessous de la méthode à règles et du consensus humain. Le résumé ne donne ni scores chiffrés, ni noms de modèles, ni taille du jeu de données. Le code et les données sont publiés sur le site du projet (larg.github.io/socialnav-sub).
L'enjeu est la validation d'une hypothèse très répandue : puisque les VLM savent reconnaître des objets, raisonner par bon sens et saisir le contexte, ils devraient convenir aux décisions de navigation « socialement conformes » d'un robot dans un hall, un couloir ou un entrepôt partagé avec des personnes. Cette étude suggère qu'il y a un écart entre ces capacités génériques et la compréhension fine d'une scène dynamique, qui conditionne la sécurité. Le fait qu'une heuristique à règles batte le meilleur modèle est un signal pour les intégrateurs. Avant de confier une décision de navigation à un VLM, il faut mesurer ses perceptions sociales de base et ne pas se fier aux démonstrations. Le benchmark offre aussi une méthode d'évaluation reproductible, qui manquait : aucune évaluation systématique de ces conditions n'existait jusqu'ici, selon les auteurs. Il faut toutefois rester prudent. Sans les chiffres détaillés, l'ampleur de l'écart reste difficile à jauger, et un test en VQA n'équivaut pas à une navigation en boucle fermée sur un robot.
Ce travail s'inscrit dans la multiplication d'usages des modèles de fondation en robotique, des VLA (vision-langage-action) aux planificateurs pilotés par VLM, souvent évalués sur des tâches de manipulation ou de navigation sans dimension sociale. La navigation sociale, jusqu'ici dominée par des méthodes classiques (modèles de forces sociales, apprentissage par renforcement, règles de distance et de priorité), voit arriver des approches à base de VLM, dont la fiabilité n'avait pas été comparée de façon systématique. Les auteurs présentent leur benchmark comme une base pour adapter ces modèles, par exemple par ajustement fin ou par couplage avec des modules à règles. Les prochaines étapes probables sont l'évaluation de nouveaux VLM, l'ajout de données et le passage de la compréhension de scène à des tests de navigation sur robot réel.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



