Aller au contenu principal
RecherchearXiv cs.RO 

STARS : de la dynamique spatiotemporelle aux représentations sociales dans l'interaction homme-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2609.40245) SocialNav-SUB, le Social Navigation Scene Understanding Benchmark, un jeu de données et un banc d'essai de questions-réponses visuelles (VQA) conçu pour mesurer la compréhension de scène des modèles vision-langage (VLM) en navigation sociale. Les questions couvrent trois niveaux de raisonnement : spatial, spatio-temporel (relations entre agents au fil du temps) et social (intentions humaines). Elles s'appuient sur des scénarios réels de robots évoluant parmi des humains. Les VLM de pointe testés sont comparés à deux références : un consensus d'annotateurs humains et une approche simple à base de règles. Le résultat principal est que le meilleur VLM atteint une probabilité d'accord avec les réponses humaines jugée encourageante, mais reste en dessous de la méthode à règles et du consensus humain. Le résumé ne donne ni scores chiffrés, ni noms de modèles, ni taille du jeu de données. Le code et les données sont publiés sur le site du projet (larg.github.io/socialnav-sub).

L'enjeu est la validation d'une hypothèse très répandue : puisque les VLM savent reconnaître des objets, raisonner par bon sens et saisir le contexte, ils devraient convenir aux décisions de navigation « socialement conformes » d'un robot dans un hall, un couloir ou un entrepôt partagé avec des personnes. Cette étude suggère qu'il y a un écart entre ces capacités génériques et la compréhension fine d'une scène dynamique, qui conditionne la sécurité. Le fait qu'une heuristique à règles batte le meilleur modèle est un signal pour les intégrateurs. Avant de confier une décision de navigation à un VLM, il faut mesurer ses perceptions sociales de base et ne pas se fier aux démonstrations. Le benchmark offre aussi une méthode d'évaluation reproductible, qui manquait : aucune évaluation systématique de ces conditions n'existait jusqu'ici, selon les auteurs. Il faut toutefois rester prudent. Sans les chiffres détaillés, l'ampleur de l'écart reste difficile à jauger, et un test en VQA n'équivaut pas à une navigation en boucle fermée sur un robot.

Ce travail s'inscrit dans la multiplication d'usages des modèles de fondation en robotique, des VLA (vision-langage-action) aux planificateurs pilotés par VLM, souvent évalués sur des tâches de manipulation ou de navigation sans dimension sociale. La navigation sociale, jusqu'ici dominée par des méthodes classiques (modèles de forces sociales, apprentissage par renforcement, règles de distance et de priorité), voit arriver des approches à base de VLM, dont la fiabilité n'avait pas été comparée de façon systématique. Les auteurs présentent leur benchmark comme une base pour adapter ces modèles, par exemple par ajustement fin ou par couplage avec des modules à règles. Les prochaines étapes probables sont l'évaluation de nouveaux VLM, l'ajout de données et le passage de la compréhension de scène à des tests de navigation sur robot réel.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

M2R2 : représentation robotique multimodale pour la segmentation temporelle des actions
1arXiv cs.RO 

M2R2 : représentation robotique multimodale pour la segmentation temporelle des actions

Des chercheurs ont publié fin avril 2025 sur arXiv (2504.18662) un extracteur de représentations multimodal baptisé M2R2 (MultiModal Robotic Representation for Robotic TAS), conçu pour la segmentation temporelle d'actions (TAS) en robotique. L'approche combine des informations proprioceptives (encodeurs, capteurs force-couple, état des articulations) et extéroceptives (caméras RGB) dans un extracteur de features commun, accompagné d'une stratégie d'entraînement inédite permettant la réutilisation de ces représentations sur plusieurs architectures de segmentation indépendantes. Les résultats annoncés positionnent M2R2 à l'état de l'art sur trois jeux de données de référence en robotique : REASSEMBLE (assemblage de composants), (Im)PerfectPour (versage de liquide) et JIGSAWS (chirurgie robotique laparoscopique simulée). Une étude d'ablation extensive quantifie la contribution respective de chaque modalité. L'intérêt principal de M2R2 réside dans la modularité de son extracteur : les approches multimodales existantes en robotique fusionnaient les modalités directement à l'intérieur du modèle de segmentation, rendant les features non réutilisables entre architectures. Ici, le découplage extracteur/modèle de TAS ouvre la voie à une bibliothèque de représentations partageable, ce qui réduit le coût de réentraînement lors du changement de tâche ou de robot. Sur les scénarios à faible visibilité d'objet, les extracteurs purement visuels issus du computer vision chutent en performance, là où l'ajout de la proprioception maintient la robustesse. C'est un résultat concret sur la fragilité des approches vision-seule dans des environnements industriels ou chirurgicaux réels, où occlusions et éclairage variable sont la norme. La segmentation temporelle d'actions est un verrou historique pour l'autonomie des robots manipulateurs : sans identifier les frontières entre skills (saisir, aligner, visser...), il est impossible de planifier, corriger ou réutiliser des séquences de gestes. En chirurgie robotique, JIGSAWS est le benchmark de référence depuis 2016, utilisé notamment dans les travaux autour des plateformes da Vinci (Intuitive Surgical). En robotique industrielle, des acteurs comme Wandercraft ou les équipes de manipulation de Boston Dynamics s'appuient sur des approches similaires pour les transitions de phases motrices. M2R2 reste à ce stade une contribution de recherche académique sans déploiement industriel annoncé, mais son extracteur réutilisable représente un candidat sérieux pour des pipelines d'imitation learning dans lesquels labelliser chaque skill manuellement est le principal goulot d'étranglement.

UEL'extracteur modulaire M2R2 pourrait bénéficier aux équipes de manipulation françaises (notamment Wandercraft) en réduisant le coût de labellisation dans les pipelines d'imitation learning, mais reste une contribution académique sans déploiement industriel annoncé.

RecherchePaper
1 source
2arXiv cs.RO 

Repenser la lisibilité de l'intention des robots sociaux dans les couloirs : effets de sa représentation et de la distraction humaine

Une équipe de recherche du Fluent Robotics Lab publie sur arXiv (2609.40158) une étude sur la « lisibilité » du mouvement des robots mobiles dans les couloirs. Le travail compare plusieurs façons de représenter l'intention du robot, toutes implémentées dans un même cadre de commande prédictive (MPC, en pratique une variante MPPI), afin d'isoler l'effet de la représentation elle-même. Deux expériences contrôlées, chacune avec 45 participants, ont été menées. La première compare une lisibilité fondée sur le côté de passage, soit fixe, soit mise à jour de façon adaptative, à une lisibilité fondée sur la destination et à une base de référence non lisible. La seconde fait varier le niveau d'attention du piéton, dont la distraction. Les résultats indiquent que la lisibilité par côté de passage, surtout lorsqu'elle est actualisée en continu, produit des trajectoires humaines plus fluides. Elle est aussi jugée plus compétente et moins exigeante mentalement et physiquement. En cas de distraction, la fluidité du mouvement humain se maintient, mais les évaluations subjectives ne suivent pas toujours. Le code est publié en open source sur GitHub (Legible_MPPI). L'intérêt dépasse la recherche académique. Les AMR, robots de livraison et futurs humanoïdes qui évoluent dans des espaces partagés (hôpitaux, entrepôts, bureaux) rencontrent le même problème dans les couloirs étroits : deux agents doivent se croiser sans se bloquer ni se heurter. L'étude suggère qu'indiquer à l'humain de quel côté le robot va passer coordonne mieux l'interaction que lui signaler la destination finale, information peu exploitable à quelques mètres. Elle montre aussi que la lisibilité conserve une partie de son effet quand le piéton regarde son téléphone, ce qui compte pour la sécurité en conditions réelles. Le décalage entre mesures objectives et ressenti rappelle toutefois que la perception de confiance et la performance de coordination ne se confondent pas. Pour un intégrateur, cela plaide pour évaluer la navigation sociale sur des mesures de mouvement et pas seulement sur des questionnaires. Il faut relativiser la portée des résultats. Il s'agit d'une étude préliminaire sur arXiv, avec un échantillon modeste et un scénario unique, le couloir. Aucun produit commercial, déploiement ni chiffre de performance industrielle n'est annoncé. Les travaux sur la lisibilité remontent aux cadres posés pour des observateurs statiques, notamment en manipulation. Leur transposition à la navigation dynamique restait peu explorée. Cette étude s'inscrit dans un courant plus large de navigation sociale où se croisent apprentissage par renforcement, modèles VLA et commande prédictive. La suite logique serait d'étendre les tests à des environnements plus denses, à des groupes de piétons et à des robots non holonomes ou à pattes, puis de les valider sur des sites réels comme des hôpitaux ou des entrepôts.

RecherchePaper
1 source
Tac4Loco : représentations spatiotemporelles de pression plantaire pour la locomotion des robots humanoïdes
3arXiv cs.RO 

Tac4Loco : représentations spatiotemporelles de pression plantaire pour la locomotion des robots humanoïdes

Des chercheurs présentent Tac4Loco, un framework d'apprentissage intégrant la pression plantaire multi-capteurs comme retour direct pour la locomotion des robots humanoïdes, décrit dans un article publie sur arXiv (référence 2608.15766v1). Le système repose sur une représentation ordinale préservant la topologie spatiale de la pression sous le pied, capable de faire correspondre les signaux simules et les signaux physiques dans un même espace d'observation. Un encodeur a deux branches extrait séparément les caractéristiques spatiales et temporelles de ces signaux tactiles, qui sont ensuite combinées a une proprioception augmentée incluant des indices d'estimation du terrain, avant d'être transmises a une architecture actor-critic asymétrique pour l'apprentissage de la politique de marche. Les expériences, menées a la fois en simulation et sur robot réel, portent sur des terrains inclines, a appui partiel, asymétrique ou changeant, et le système est également teste en zero-shot sur des surfaces non structurées et compliantes inédites, notamment une plateforme en mousse et une route de gravier. Les auteurs annoncent la publication en open source du code et des configurations expérimentales, sans préciser de calendrier. Ce travail cible un angle mort connu des politiques de locomotion actuelles: la plupart des humanoïdes s'appuient soit sur la seule proprioception, qui ne donne qu'une preuve indirecte de l'appui réel au sol, soit sur une perception extéroceptive du terrain qui anticipe le contact avant la pose du pied mais ne peut pas observer en temps réel l'appui effectivement réalisé. Les rares travaux intégrant des capteurs de pression plantaire se contentaient jusqu'ici de statistiques résumées comme la force totale ou le centre de pression, en ignorant la topologie spatiale complète du signal, pourtant plus informative sur l'état de contact réel. Pour un intégrateur ou un ingénieur robotique, l'enjeu est concret: la robustesse sur terrain non prépare reste l'un des principaux freins au déploiement des humanoïdes hors des environnements d'usine contrôles, et une meilleure exploitation du retour tactile plantaire pourrait réduire les chutes et les échecs d'équilibre sans dépendre uniquement de la vision du terrain. Le papier s'inscrit dans une tendance plus large de la recherche en locomotion humanoïde, ou l'apprentissage par renforcement en simulation domine l'écriture des contrôleurs de marche, le transfert sim-to-real restant le principal goulot d'étranglement, en particulier pour des capteurs tactiles dont le comportement physique est difficile a modéliser fidèlement en simulation. C'est précisément ce que vise la représentation ordinale proposée par les auteurs, censée réduire l'écart entre signaux simules et signaux de capteurs réels. L'article ne précise ni la plateforme robotique utilisée pour les essais, ni l'affiliation institutionnelle des auteurs au-delà de la référence arXiv, et reste a ce stade une contribution de recherche plutôt qu'un produit déployé chez un client. Les prochaines étapes annoncées se limitent a la publication du code source, sans mention de partenariat industriel ou de pilote sur site.

RecherchePaper
1 source
Apprendre aux robots à interpréter les interactions sociales via l'apprentissage sur graphes dynamiques guidé par le lexique
4arXiv cs.RO 

Apprendre aux robots à interpréter les interactions sociales via l'apprentissage sur graphes dynamiques guidé par le lexique

Une équipe de chercheurs publie SocialLDG (Social Lexically-guided Dynamic Graph learning), un cadre d'apprentissage multi-tâches destiné à doter les robots d'intelligence sociale. Déposé sur arXiv (2604.10895v2), le travail vise un problème central de l'interaction humain-robot : inférer les états internes d'un utilisateur (émotions, intentions, états cognitifs non directement observables), prédire ses comportements futurs et y répondre de façon adaptée. Le cadre modélise six tâches distinctes représentant la relation dynamique entre états latents et actions observables, en intégrant un modèle de langage pour introduire des priors lexicaux par tâche, et un apprentissage par graphe dynamique pour suivre l'évolution temporelle des affinités entre tâches. Les auteurs rapportent des performances état de l'art sur deux jeux de données publics d'interaction sociale humain-robot, sans que le résumé disponible précise les benchmarks ni les marges de gain exactes. L'apport le plus concret pour les équipes de R&D en robotique sociale est la résistance au catastrophic forgetting : SocialLDG intègre de nouvelles tâches comportementales sans dégrader les capacités acquises, une propriété critique pour des déploiements réels où l'étendue des interactions croît progressivement. L'usage de priors linguistiques pour structurer le raisonnement sur graphe est également original : il permet d'exploiter la sémantique du langage naturel comme contrainte sur la modélisation sociale du robot, ouvrant la voie à une adaptation sans réentraînement complet. La lisibilité des affinités entre tâches offre en outre un levier d'interprétabilité utile pour le debug et la validation industrielle. La compréhension sociale en robotique est un chantier actif de longue date, avec des contributions notables de CMU, du MIT, et des travaux sur OpenFace ou EMOTIC. SocialLDG se distingue des approches actuelles qui traitent séparément reconnaissance d'émotion, détection d'intention et prédiction de geste, en proposant un cadre unifié inspiré des sciences cognitives. Les travaux récents sur les vision-language agents et les VLA adressent partiellement ce champ, mais restent centrés sur la manipulation physique plutôt que sur la dynamique socio-cognitive. En tant que prépublication non encore évaluée par les pairs, les performances annoncées restent à confirmer indépendamment avant toute intégration.

RecherchePaper
1 source