Aller au contenu principal
RecherchearXiv cs.RO 

Repenser la lisibilité de l'intention des robots sociaux dans les couloirs : effets de sa représentation et de la distraction humaine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche du Fluent Robotics Lab publie sur arXiv (2609.40158) une étude sur la « lisibilité » du mouvement des robots mobiles dans les couloirs. Le travail compare plusieurs façons de représenter l'intention du robot, toutes implémentées dans un même cadre de commande prédictive (MPC, en pratique une variante MPPI), afin d'isoler l'effet de la représentation elle-même. Deux expériences contrôlées, chacune avec 45 participants, ont été menées. La première compare une lisibilité fondée sur le côté de passage, soit fixe, soit mise à jour de façon adaptative, à une lisibilité fondée sur la destination et à une base de référence non lisible. La seconde fait varier le niveau d'attention du piéton, dont la distraction. Les résultats indiquent que la lisibilité par côté de passage, surtout lorsqu'elle est actualisée en continu, produit des trajectoires humaines plus fluides. Elle est aussi jugée plus compétente et moins exigeante mentalement et physiquement. En cas de distraction, la fluidité du mouvement humain se maintient, mais les évaluations subjectives ne suivent pas toujours. Le code est publié en open source sur GitHub (Legible_MPPI).

L'intérêt dépasse la recherche académique. Les AMR, robots de livraison et futurs humanoïdes qui évoluent dans des espaces partagés (hôpitaux, entrepôts, bureaux) rencontrent le même problème dans les couloirs étroits : deux agents doivent se croiser sans se bloquer ni se heurter. L'étude suggère qu'indiquer à l'humain de quel côté le robot va passer coordonne mieux l'interaction que lui signaler la destination finale, information peu exploitable à quelques mètres. Elle montre aussi que la lisibilité conserve une partie de son effet quand le piéton regarde son téléphone, ce qui compte pour la sécurité en conditions réelles. Le décalage entre mesures objectives et ressenti rappelle toutefois que la perception de confiance et la performance de coordination ne se confondent pas. Pour un intégrateur, cela plaide pour évaluer la navigation sociale sur des mesures de mouvement et pas seulement sur des questionnaires.

Il faut relativiser la portée des résultats. Il s'agit d'une étude préliminaire sur arXiv, avec un échantillon modeste et un scénario unique, le couloir. Aucun produit commercial, déploiement ni chiffre de performance industrielle n'est annoncé. Les travaux sur la lisibilité remontent aux cadres posés pour des observateurs statiques, notamment en manipulation. Leur transposition à la navigation dynamique restait peu explorée. Cette étude s'inscrit dans un courant plus large de navigation sociale où se croisent apprentissage par renforcement, modèles VLA et commande prédictive. La suite logique serait d'étendre les tests à des environnements plus denses, à des groupes de piétons et à des robots non holonomes ou à pattes, puis de les valider sur des sites réels comme des hôpitaux ou des entrepôts.

Dans nos dossiers

À lire aussi

1arXiv cs.RO 

STARS : de la dynamique spatiotemporelle aux représentations sociales dans l'interaction homme-robot

Des chercheurs ont publié sur arXiv (2609.40245) SocialNav-SUB, le Social Navigation Scene Understanding Benchmark, un jeu de données et un banc d'essai de questions-réponses visuelles (VQA) conçu pour mesurer la compréhension de scène des modèles vision-langage (VLM) en navigation sociale. Les questions couvrent trois niveaux de raisonnement : spatial, spatio-temporel (relations entre agents au fil du temps) et social (intentions humaines). Elles s'appuient sur des scénarios réels de robots évoluant parmi des humains. Les VLM de pointe testés sont comparés à deux références : un consensus d'annotateurs humains et une approche simple à base de règles. Le résultat principal est que le meilleur VLM atteint une probabilité d'accord avec les réponses humaines jugée encourageante, mais reste en dessous de la méthode à règles et du consensus humain. Le résumé ne donne ni scores chiffrés, ni noms de modèles, ni taille du jeu de données. Le code et les données sont publiés sur le site du projet (larg.github.io/socialnav-sub). L'enjeu est la validation d'une hypothèse très répandue : puisque les VLM savent reconnaître des objets, raisonner par bon sens et saisir le contexte, ils devraient convenir aux décisions de navigation « socialement conformes » d'un robot dans un hall, un couloir ou un entrepôt partagé avec des personnes. Cette étude suggère qu'il y a un écart entre ces capacités génériques et la compréhension fine d'une scène dynamique, qui conditionne la sécurité. Le fait qu'une heuristique à règles batte le meilleur modèle est un signal pour les intégrateurs. Avant de confier une décision de navigation à un VLM, il faut mesurer ses perceptions sociales de base et ne pas se fier aux démonstrations. Le benchmark offre aussi une méthode d'évaluation reproductible, qui manquait : aucune évaluation systématique de ces conditions n'existait jusqu'ici, selon les auteurs. Il faut toutefois rester prudent. Sans les chiffres détaillés, l'ampleur de l'écart reste difficile à jauger, et un test en VQA n'équivaut pas à une navigation en boucle fermée sur un robot. Ce travail s'inscrit dans la multiplication d'usages des modèles de fondation en robotique, des VLA (vision-langage-action) aux planificateurs pilotés par VLM, souvent évalués sur des tâches de manipulation ou de navigation sans dimension sociale. La navigation sociale, jusqu'ici dominée par des méthodes classiques (modèles de forces sociales, apprentissage par renforcement, règles de distance et de priorité), voit arriver des approches à base de VLM, dont la fiabilité n'avait pas été comparée de façon systématique. Les auteurs présentent leur benchmark comme une base pour adapter ces modèles, par exemple par ajustement fin ou par couplage avec des modules à règles. Les prochaines étapes probables sont l'évaluation de nouveaux VLM, l'ajout de données et le passage de la compréhension de scène à des tests de navigation sur robot réel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Stabilité et confort dans les interactions entre robots mobiles et piétons
2arXiv cs.RO 

Stabilité et confort dans les interactions entre robots mobiles et piétons

Voici l'article rédigé selon les consignes. Des chercheurs ont développé et validé expérimentalement des algorithmes de navigation socialement adaptés pour robots mobiles non-holonomes (NMR), une catégorie de robots majoritaire dans les applications industrielles et de service mais historiquement sous-étudiée par rapport aux plateformes holonomes. Le cadre proposé s'appuie sur le Social Force Model (SFM) et sur une variante appelée TSFM (projected Time-to-collision Social Force Model), qui modélise explicitement les interactions entre le robot, les piétons et les obstacles statiques. Les auteurs démontrent mathématiquement la stabilité du système sous l'hypothèse de piétons "boundedly nonpassive" (dont le comportement reste dans des limites prévisibles), puis calibrent leurs modèles en simulation via une fonction de coût hybride combinant confort et vitesse de déplacement. Des expérimentations réelles impliquant des interactions robot-piéton comparent SFM et TSFM à deux références télécommandées manuellement, avec recueil du confort perçu par les marcheurs via questionnaires, analysés statistiquement. Cette étude comble un vide méthodologique important pour l'industrie robotique: la plupart des algorithmes de navigation classiques traitent les piétons comme de simples obstacles dynamiques, sans modéliser les facteurs humains subjectifs qui déterminent l'acceptabilité sociale d'un robot en espace partagé. Pour les intégrateurs déployant des AMR (robots mobiles autonomes) en entrepôt, hôpital ou espace public, ce résultat est directement actionnable puisque la majorité des plateformes commerciales sont non-holonomes et non les robots holonomes omnidirectionnels généralement privilégiés dans la littérature académique sur la navigation sociale. La preuve de stabilité formelle, plutôt qu'une simple validation empirique, renforce la crédibilité du système pour un déploiement en conditions réelles où la sécurité et la prévisibilité du comportement robotique sont critiques. Le travail s'inscrit dans le champ de la navigation socialement consciente ("social navigation"), qui cherche depuis plusieurs années à dépasser les approches purement géométriques d'évitement d'obstacles. Le Social Force Model, initialement conçu pour modéliser les dynamiques de foules humaines, sert ici de brique de base étendue avec une composante de temps avant collision (time-to-collision) pour mieux anticiper les trajectoires. Les auteurs comparent leurs résultats à des études antérieures pour établir un avantage sur les métriques de confort et de performance, sans toutefois préciser de partenaire industriel ni de calendrier de déploiement commercial concret, ce travail relevant à ce stade de la recherche académique plutôt que d'un produit prêt à être industrialisé.

RecherchePaper
1 source
PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots
3arXiv cs.RO 

PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots

La recherche présentée dans l'article arXiv:2609.18125v1 (déposé fin septembre 2026) porte sur un système baptisé PRISM, pour Predictive Representation of Interaction Style and Motion, conçu pour améliorer la navigation des robots dans les foules humaines. Concrètement, PRISM utilise un encodeur transformer entraîné avec une fonction de perte dite Rank-N-Contrast pour transformer les trajectoires observées de piétons en un espace latent continu et ordonné, qui capture le style d'interaction de chaque personne plutôt que sa seule position géométrique. Le système associe à chaque trait inféré un score de stabilité temporelle, transmis ensuite à la politique de navigation du robot. Les auteurs rapportent des résultats obtenus dans des simulations de foules randomisées : une réduction du taux de collisions par rapport à une référence qui ne modélise que l'état géométrique des piétons, ainsi que des gains marginaux sur le temps de trajet et la longueur du chemin parcouru. L'enjeu dépasse la seule performance chiffrée. La plupart des politiques de navigation sociale actuelles traitent les piétons comme de simples obstacles mobiles décrits par leur position et leur vitesse, ignorant que deux personnes se comportent différemment face à un robot selon leur style d'interaction propre. En inférant ce style de façon passive, sans capteurs additionnels ni interaction explicite, PRISM ouvre une piste pour des robots de livraison, des AMR ou des plateformes d'assistance appelés à circuler dans des environnements humains denses, où la sécurité perçue dépend autant du comportement social du robot que de sa seule évitement de collision. Le travail s'inscrit dans la lignée des recherches en navigation sociale robotique qui cherchent à dépasser les modèles purement géométriques hérités de la planification de trajectoire classique. Il reste toutefois à un stade de validation en simulation uniquement : aucun essai sur robot physique ni déploiement réel n'est mentionné, et les gains rapportés sur le temps de trajet et la distance parcourue sont qualifiés eux-mêmes de modestes par les auteurs. La suite logique, non annoncée à ce stade, serait un transfert vers des plateformes réelles pour vérifier si l'amélioration observée en simulation résiste au bruit des capteurs et à la variabilité humaine réelle.

RecherchePaper
1 source
Diminution des retours de l'intelligence : la relation non linéaire entre l'échelle des LLM et la perception utilisateur dans les interactions sociales humain-robot ouvertes de courte durée
4arXiv cs.RO 

Diminution des retours de l'intelligence : la relation non linéaire entre l'échelle des LLM et la perception utilisateur dans les interactions sociales humain-robot ouvertes de courte durée

Une étude publiée sur arXiv début août 2026 interroge une hypothèse répandue dans la robotique sociale : plus un grand modèle de langage compte de paramètres, meilleure serait l'expérience utilisateur. Dix-neuf participants ont testé, dans un protocole intra-sujets, un visage robotique piloté par trois variantes du modèle vision-langage Qwen3-VL d'Alibaba, comptant respectivement 4, 8 et 30 milliards de paramètres. Chaque interaction, courte et sans script, a été notée sur quatre critères : intelligence perçue, naturel, plaisir ressenti et humour. Résultat principal : aucune préférence significative ne ressort pour le modèle à 30 milliards de paramètres, y compris face à la version 4B, sur les dimensions du naturel et de l'intelligence perçue. Ce résultat va à l'encontre d'une hypothèse implicite du secteur, selon laquelle la course à l'échelle des modèles se traduirait mécaniquement par une meilleure interaction homme robot. Pour les intégrateurs et concepteurs d'interfaces sociales robotiques, la conclusion est concrète : un modèle 4B ou 8B, moins coûteux à faire tourner, plus rapide en latence et plus facile à déployer en local ou en périphérie, peut suffire pour des échanges brefs et ouverts, où la fluidité conversationnelle et la réactivité comptent autant que le nombre brut de paramètres. Fait notable, les utilisateurs les plus familiers de l'IA conversationnelle se montrent plus sensibles aux écarts de capacité du modèle 30B, ce qui suggère que les gains de l'échelle ne se révèlent qu'à des utilisateurs expérimentés, pas au grand public. Ce travail s'inscrit dans un champ distinct de la course aux robots humanoïdes commerciaux type Figure ou Optimus : il porte sur les agents conversationnels incarnés, ces interfaces à visage robotique utilisées pour l'accueil, l'assistance ou la démonstration, où le rendu social prime sur la manipulation physique. Le choix de Qwen3-VL, famille de modèles multimodaux ouverts d'Alibaba, illustre une tendance à tester des LLM open source plutôt que des API propriétaires pour ce type d'usage. Les auteurs reconnaissent eux-mêmes les limites de l'étude, à commencer par un échantillon réduit à 19 participants et des interactions brèves, et précisent qu'il s'agit d'une prépublication arXiv non encore relue par les pairs. Le signal rejoint néanmoins d'autres travaux sur l'écart entre démonstration et usage réel, invitant la recherche en interaction homme-robot à prioriser la latence et le comportement social plutôt que la seule taille du modèle.

RecherchePaper
1 source