Aller au contenu principal
Point de vue : comment la perspective influence la sociabilité perçue des robots
RecherchearXiv cs.RO 

Point de vue : comment la perspective influence la sociabilité perçue des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2603.28272v2) une étude expérimentale portant sur la perception de la sociabilité des robots de navigation selon le point de vue de l'observateur. L'équipe a conçu un protocole en réalité virtuelle immersive permettant de soumettre des trajectoires robotiques identiques à trois types de perspectives : allocentrique (vue aérienne, type supervision), égocentrique-proximale (première personne, robot proche) et égocentrique-distale (première personne, robot loin). Deux politiques de navigation distinctes ont été testées pour vérifier si les résultats sont généralisables au-delà d'un seul type de trajectoire. Une variable additionnelle a été introduite : la présence ou l'absence d'un geste de hochement de tête du robot au moment du croisement.

Le résultat central contredit une hypothèse largement répandue dans la communauté : les trajectoires jugées sociables en vue aérienne sont perçues comme significativement plus dérangeantes lorsqu'on les expérimente en première personne et à proximité immédiate. Ce décalage perceptif a des implications directes pour les équipes qui valident des algorithmes de navigation sociale (SFM, ORCA, politiques VLA embarquées) uniquement via simulation ou supervision vidéo. Les benchmarks actuels, qui s'appuient massivement sur des métriques calculées depuis une vue de dessus, risquent de valider des comportements qui resteraient inconfortables sur le terrain réel. L'étude montre également que la distance de dépassement influence le niveau de perturbation ressenti, mais que des signaux sociaux communicatifs, comme le hochement de tête, compensent partiellement cet effet en améliorant la sociabilité perçue, ce qui ouvre une piste concrète pour les robots humanoïdes ou à tête expressive.

Ce travail s'inscrit dans le champ de la navigation socialement consciente (socially aware navigation), actif depuis plus d'une décennie avec des travaux fondateurs sur la proxémique robotique et les espaces personnels. La validation humanoïde en environnement partagé est un enjeu croissant pour des acteurs comme Boston Dynamics, Agility Robotics ou Unitree, dont les robots opèrent déjà dans des entrepôts et espaces semi-publics. Côté européen, des initiatives comme Enchanted Tools (Mirokaï) ou les travaux de l'INRIA sur la navigation sociale font face au même verrou méthodologique pointé ici. La prochaine étape logique serait de valider ces résultats sur du matériel physique en conditions réelles, et d'intégrer des métriques égocentrique dans les pipelines de test standard des politiques de navigation.

Impact France/UE

INRIA et Enchanted Tools (Mirokaï) sont directement exposés au verrou méthodologique identifié : leurs pipelines de validation de navigation sociale reposent sur des métriques allocentriques qui risquent de valider des comportements inconfortables en conditions réelles.

À lire aussi

Dans quelle mesure le niveau d'obésité perçu des robots humanoïdes influence-t-il la confiance que leur accordent les personnes ?
1arXiv cs.RO 

Dans quelle mesure le niveau d'obésité perçu des robots humanoïdes influence-t-il la confiance que leur accordent les personnes ?

Une étude publiée sur arXiv (version 2, remplaçant une préversion antérieure) s'attaque à une question inédite en interaction humain-robot: l'influence du niveau d'obésité perçu d'un robot humanoïde sur la confiance qu'on lui accorde. Les chercheurs soulignent d'abord un problème méthodologique: l'indice de masse corporelle (IMC), outil standard pour mesurer l'obésité chez l'humain, n'a aucun sens appliqué à un robot. Ils ont donc conçu une étude intra-sujets où des participants répondaient à un questionnaire en ligne préalablement validé tout en visualisant deux images de robots humanoïdes, l'un présentant une corpulence standard, l'autre une corpulence perçue comme élevée. Résultat principal: les robots perçus comme moins "obèses" recueillent une confiance significativement plus élevée que leurs équivalents à corpulence perçue plus forte. Pour l'industrie robotique, ce travail ajoute une variable de design largement ignorée jusqu'ici. Les travaux antérieurs en HRI avaient déjà établi que la taille ou la hauteur d'un robot modifient la confiance perçue, mais jamais la silhouette ou la corpulence n'avait été isolée comme facteur. Pour les fabricants de robots humanoïdes destinés à l'entrepôt, au domicile ou aux services d'accueil, ce résultat suggère que les choix esthétiques de carrosserie et de proportions corporelles pèsent sur l'acceptation utilisateur au même titre que des spécifications fonctionnelles comme la charge utile ou le nombre de degrés de liberté. Cela invite aussi à développer des échelles perceptuelles spécifiques aux robots, puisque les métriques humaines classiques comme l'IMC ne se transposent pas. Sur le plan méthodologique, l'étude s'appuie sur une comparaison contrôlée de deux images plutôt que sur une interaction avec des robots physiques, une approche peu coûteuse pour un premier tri de morphologies mais qui laisse ouvertes des questions de réplication en conditions réelles, de biais culturels dans la perception de la corpulence, et d'effets à long terme lors d'interactions répétées. Elle s'inscrit dans une littérature HRI encore jeune sur les déterminants visuels de la confiance envers les robots, aux côtés des travaux sur la taille, le genre perçu ou le degré d'anthropomorphisme, et ouvre la voie à des études de suivi sur des prototypes physiques plutôt que des images statiques.

RecherchePaper
1 source
Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots
2arXiv cs.RO 

Raisonnement sans coût d'inférence : échafaudage sémantique latent pour les politiques VLA de robots

Une équipe de recherche a publié sur arXiv (arXiv:2609.04893v1, soumis début septembre 2026) une méthode nommée Latent Semantic Scaffolding (LSS), conçue pour les modèles vision-langage-action (VLA) qui pilotent des robots manipulateurs. Le constat de départ : les VLA actuels apprennent par imitation à partir de démonstrations humaines et retiennent quelle action exécuter, mais pas pourquoi ; ajouter un raisonnement causal améliore la manipulation, mais les méthodes existantes le paient cher à l'inférence, en générant des tokens de raisonnement ou en simulant des états futurs à chaque pas de contrôle, un surcoût qui s'accumule sur les séquences longues. LSS introduit à la place une perte auxiliaire appliquée uniquement pendant le pré-entraînement sur démonstrations humaines : une petite tête de projection aligne les représentations des tokens d'action du VLA avec des embeddings textuels de justifications physiques du geste. Cette tête est ensuite supprimée à l'inférence, laissant la politique de base intacte et donc sans coût additionnel au déploiement. La découverte centrale concerne la granularité de cet alignement : une version « Dense », qui relie chaque token d'action au raisonnement propre à sa phase de manipulation, transfère nettement mieux vers des tâches inédites qu'une version « Pooled » fondée sur un embedding unique pour tout l'épisode, laquelle se sur-spécialise à la tâche d'entraînement. Une sonde représentationnelle montre que Dense LSS induit environ deux fois plus de séparabilité par phase dans le réseau de base. Le résultat intéresse directement les concepteurs de politiques VLA de type Pi-0, GR00T N2 ou Helix, confrontés à un arbitrage classique entre qualité du raisonnement et fréquence de contrôle en temps réel. En déplaçant le bénéfice du raisonnement causal vers la phase d'entraînement, LSS suggère qu'il est possible d'obtenir un gain de généralisation sans dégrader le temps de cycle ni la charge de calcul embarquée, un point critique pour les intégrateurs qui évaluent le ROI de bras manipulateurs ou d'humanoïdes en production. Il faut toutefois noter qu'il s'agit d'un article de recherche non encore relu par les pairs, avec des résultats obtenus sur un jeu de tâches et d'architectures limité, pas d'une validation à grande échelle industrielle. Ces travaux s'inscrivent dans la lignée des VLA de type fondation qui dominent la robotique de manipulation depuis l'essor de modèles comme RT-2, Pi-0 ou GR00T N2, et dans le prolongement d'une autre famille de méthodes qui injectent du raisonnement explicite via chaînes de pensée ou modèles du monde, au prix d'un calcul supplémentaire à chaque étape. LSS se positionne comme une alternative à ce compromis en traitant l'alignement sémantique comme un mécanisme d'entraînement jetable plutôt que comme un module permanent. L'abstract ne mentionne ni laboratoire ni entreprise nommément, ni acteur français ou européen ; les auteurs annoncent vouloir approfondir l'effet de la granularité de l'alignement sur d'autres tâches et vérifier si Dense LSS se généralise à des architectures VLA de plus grande échelle.

RechercheActu
1 source
Un aperçu de la coexistence physique à long terme avec des robots intelligents
3arXiv cs.RO 

Un aperçu de la coexistence physique à long terme avec des robots intelligents

PHILIA est un système agent multi-robots présenté dans un article publié sur arXiv (2607.11377, soumission nouvelle) et conçu pour la coexistence physique de longue durée entre humains et robots au domicile. Son architecture repose sur une abstraction appelée « robot gateway », qui expose de façon unifiée les runtimes locaux de chaque robot, la perception embarquée, la navigation, la synthèse vocale et les politiques de contrôle, tout en conservant l'écosystème d'interaction et d'outils d'OpenClaw, un framework agent existant dont PHILIA hérite les capacités conversationnelles. Le système a été validé sur des robots Astribot S1, plateforme de manipulation humanoïde développée par la startup chinoise Astribot, et le contrat de la gateway a été pensé pour accueillir à terme d'autres plateformes robotiques hétérogènes via une interface commune couvrant observation, exécution de tâches, navigation, lecture vocale, supervision d'état et annulation de tâche. Les auteurs présentent des scénarios domestiques allant du simple rangement d'objets à des tâches longues et dextres comme remplir un sac à dos ou soulever un sac poubelle. L'intérêt de cette architecture tient à sa séparation explicite entre le raisonnement agent, peu fréquent et fortement sémantique, et l'exécution robotique bas niveau, à haute fréquence. Cette séparation rend l'expérience utilisateur compositionnelle: une amélioration de l'interface, de l'embodiment robotique, de la politique de contrôle ou de l'algorithme de navigation peut profiter au système sans le redessiner entièrement. C'est une réponse directe à un problème récurrent du secteur des robots humanoïdes domestiques, où les démonstrations spectaculaires reposent souvent sur des pipelines figés et peu réutilisables. En intégrant une mémoire longue durée des préférences utilisateur et une confirmation humaine en boucle pendant l'exécution, PHILIA cible aussi l'écart de confiance entre politiques de contrôle performantes en laboratoire et fiabilité réelle attendue en environnement domestique. Le travail s'inscrit dans la vague de recherche sur les agents robotiques généralistes combinant modèles de langage et politiques vision-langage-action, aux côtés d'efforts comme Gemini Robotics ou Helix. Il reste à ce stade une contribution de recherche à l'état d'article, testée sur une seule plateforme matérielle, sans annonce de déploiement commercial ni de partenaire industriel identifié.

RecherchePaper
1 source
VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact
4arXiv cs.RO 

VibeAct : la vibration comme signal pour la dextérité réactive des robots en contact

Des chercheurs ont présenté VibeAct, un cadre de manipulation dextère publié sur arXiv en juin 2026, qui intègre des microphones piézoélectriques miniatures dans les doigts d'une main robotique pour détecter les événements de contact et de glissement. La méthode repose sur trois étapes : collecter des données vibro-acoustiques par téléopération, rejouer ces enregistrements dans un jumeau numérique calibré pour étiqueter automatiquement le contact et l'amplitude de glissement par doigt, puis entraîner un estimateur tactile sur les signaux microphone réels. En parallèle, les politiques de manipulation sont entraînées en simulation sur cette même représentation abstraite, et non sur l'audio brut. Le système a été évalué sur cinq tâches riches en contact : re-saisie, réorientation en main et insertion. L'enjeu central est le fossé simulation-réalité qui frappe la manipulation dextère : les événements de contact sont rapides, locaux et souvent masqués visuellement, ce qui rend leur simulation acoustique fidèle quasiment impossible. En découplant l'estimateur tactile, entraîné sur des données réelles, de la politique de contrôle, entraînée en simulation sur la représentation abstraite, le cadre contourne ce verrou sans avoir à modéliser l'audio. Le canal de glissement continu s'avère l'observation la plus informative pour le contrôle réactif soutenu. Sur les cinq tâches, VibeAct surpasse une baseline proprioception et nuage de points, avec les gains les plus nets sur les tâches nécessitant un ajustement continu de la prise. Les politiques apprises se transfèrent à une plateforme physique bras-main dextère, avec une amélioration mesurable des taux de succès. Ce travail s'inscrit dans une compétition dense entre modalités tactiles. Les capteurs à base de caméra comme GelSight ou DIGIT, développé par Meta, offrent une richesse spatiale supérieure mais restent encombrants et coûteux ; les microphones piézoélectriques sont compacts, bon marché et à haute bande passante, mais leur signal est difficile à simuler, d'où l'intérêt du découplage proposé. D'autres travaux exploitent la randomisation de domaine ou des simulations acoustiques approximatives pour tenter de franchir ce seuil. Aucun partenaire industriel ni déploiement commercial n'est annoncé : il s'agit à ce stade de recherche académique. Les prochaines étapes naturelles concernent la généralisation à des objets hors distribution et l'extension à des mains avec davantage de degrés de liberté.

RecherchePaper
1 source