Aller au contenu principal
Vers un banc d'essai extensible pour le dialogue oral avec les robots sociaux
RecherchearXiv cs.RO 

Vers un banc d'essai extensible pour le dialogue oral avec les robots sociaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un banc d'essai ouvert, destiné à toute la communauté, pour évaluer le dialogue oral entre humains et robots sociaux. Publié sur arXiv (2610.08733, première version), le travail part d'un constat : les modèles de langage offrent une interface « plug-and-play » entre l'humain et la machine, mais les difficultés réapparaissent dès que la parole, le rythme de l'échange et la collaboration entrent en jeu. Le benchmark cible quatre familles d'artefacts typiques de la conversation orale : les demandes de clarification, les interruptions, les signaux incarnés (hochements de tête, expressions faciales) et les contraintes de temps. Les auteurs décrivent aussi leur intention de l'étendre à d'autres dimensions de l'interaction homme-robot. Pour le rendre praticable, ils recommandent Retico, un framework de communication en temps réel censé répondre aux exigences techniques d'un dialogue oral robotisé. Le résumé ne donne ni scores, ni plateformes testées, ni jeu de données chiffré : il s'agit d'une proposition de cadre, pas d'une évaluation de systèmes existants.

L'enjeu pour l'industrie est surtout méthodologique. Les démonstrations de robots conversationnels reposent souvent sur des scénarios choisis, avec des tours de parole bien séparés et une latence rarement documentée. Or, dans un accueil, un service ou un atelier, un robot doit savoir demander de repréciser, accepter d'être coupé et répondre dans un délai tenable, tout en coordonnant sa gestuelle avec sa voix. Aujourd'hui, ces comportements sont jugés au cas par cas, ce qui rend les comparaisons entre fournisseurs peu fiables pour un intégrateur ou un décideur B2B. Un banc d'essai commun, s'il est adopté, permettrait de mesurer ces écarts entre démonstration et usage réel. Il reste toutefois à voir quelles métriques seront retenues et si les pratiques de production, notamment la qualité perçue de l'échange, s'y retrouveront.

Ce travail s'inscrit dans le déploiement rapide des LLM et des modèles voix-langage-action sur des robots d'interaction, alors que les évaluations existantes se concentrent surtout sur le texte, la manipulation ou la navigation, rarement sur la dynamique conversationnelle incarnée. Les acteurs de la robotique sociale, dont les européens comme Enchanted Tools avec son robot Mirokaï, auraient un intérêt direct à disposer d'une référence partagée, mais l'article ne cite aucun partenaire industriel. La suite dépendra de l'ouverture effective du code et des scénarios, de l'adhésion de laboratoires tiers et de l'intégration de Retico dans des piles logicielles déjà en place. À ce stade, il s'agit d'un projet de recherche annoncé, sans produit livré ni déploiement.

Impact France/UE

Un banc d'essai commun pour le dialogue oral pourrait servir de référence aux acteurs européens de la robotique sociale, mais aucun partenaire ni déploiement européen n'est cité.

À lire aussi

CSIR : des robots sensibles au contexte et aux normes sociales pour une navigation efficace vers une personne cible
1arXiv cs.RO 

CSIR : des robots sensibles au contexte et aux normes sociales pour une navigation efficace vers une personne cible

Des chercheurs proposent CSIR, un cadre de planification qui permet à un robot mobile de retrouver une personne en intérieur pour lui remettre un objet, même quand la demande est vague et que les informations sur le destinataire sont incomplètes. Le travail, publié sur arXiv (2610.02750) et accompagné d'un site de démonstration anonymisé, traite le problème dit « Person Goal Navigation » (PersonNav). La méthode combine deux signaux : la distance jusqu'aux lieux candidats et des informations sémantiques sur la personne (habitudes, intention), pondérées par le degré de confiance accordé aux renseignements fournis par l'utilisateur. Les auteurs ont aussi construit un banc d'essai synthétique, avec acteurs, objets et requêtes en langage naturel, pour évaluer les performances avant tout déploiement réel. Selon l'étude, la recherche informée surpasse nettement les références classiques fondées sur des graphes et la seule distance. La sémantique employée seule produit une exploration sporadique, mal ancrée dans l'espace. Une variante pilotée par un LLM obtient des résultats comparables. Des essais sur matériel ont été réalisés. Le résumé ne donne ni chiffres de gain, ni plateforme robotique, ni site de test. L'intérêt tient au problème visé. Les systèmes de recherche de personnes existants supposent en général une connaissance exacte de l'individu, ce qui ne correspond pas aux usages de livraison en bureaux, hôpitaux ou hôtels, où la consigne est du type « apporte ça à la personne de la comptabilité ». Le résultat contredit aussi une tentation courante : le tout-sémantique, ou le tout-LLM, ne suffit pas sans ancrage métrique. Le fait que la variante LLM ne fasse que jeu égal avec le planificateur explicite relativise l'idée qu'un modèle de langage généraliste serait nécessaire ici. La représentation explicite des croyances ouvre en outre la voie à un filtrage bayésien, plus auditable pour un intégrateur. Reste une réserve : les gains sont mesurés surtout en simulation sur un benchmark conçu par les auteurs, et la validation matérielle est décrite de façon qualitative. Ce travail s'inscrit dans la navigation orientée objectif (ObjectNav, puis PersonNav), où les approches apprises souffrent d'un manque de données publiques, la confidentialité des personnes limitant la collecte. Les auteurs contournent ce verrou par la planification et la génération synthétique, plutôt que par l'apprentissage de bout en bout adopté par de nombreux laboratoires. Il s'agit d'une publication de recherche, pas d'un produit ni d'un pilote : aucun calendrier de déploiement n'est annoncé. La suite logique serait le filtrage bayésien évoqué, puis des tests en environnement occupé et sur de longues durées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Vers un MAPF réaliste : SMART, un banc de test multi-agents extensible pour le monde réel
2arXiv cs.RO 

Vers un MAPF réaliste : SMART, un banc de test multi-agents extensible pour le monde réel

Une équipe de chercheurs a publié SMART (Scalable Multi-Agent Realistic Testbed), un environnement de simulation open-source destiné à l'évaluation des algorithmes MAPF (Multi-Agent Path Finding), c'est-à-dire la planification de trajectoires sans collision pour des flottes de robots. Le papier, référencé arXiv:2503.04798, présente un outil capable de simuler jusqu'à plusieurs milliers de robots simultanément, en intégrant un moteur physique complet qui modélise la kinodynamique des robots et les incertitudes d'exécution réelles. SMART s'appuie sur un cadre de supervision d'exécution basé sur l'Action Dependency Graph (ADG), ce qui permet une intégration modulaire avec différents planificateurs MAPF et modèles de robots. Le code est disponible publiquement sur GitHub, accompagné d'un service de démonstration en ligne. L'enjeu industriel est direct : les meilleurs planificateurs MAPF actuels sont capables de calculer des trajectoires pour des centaines de robots en quelques secondes, mais ils reposent presque tous sur des modèles de robots simplifiés, ignorant la dynamique réelle, les glissements, les délais de démarrage ou les imprécisions de positionnement. Ce fossé entre simulation idéalisée et comportement terrain est un frein majeur au déploiement en entrepôt ou en atelier. SMART propose de combler ce gap en permettant aux intégrateurs et aux équipes R&D de tester leurs algorithmes dans des conditions proches de la réalité sans avoir besoin de dizaines ou de centaines de robots physiques, ressource quasi-inaccessible en laboratoire. Pour un COO industriel qui évalue des solutions AMR (Autonomous Mobile Robots), disposer d'un simulateur crédible et open-source réduit significativement le risque d'un déploiement raté. Le problème du sim-to-real gap dans le MAPF est documenté depuis plusieurs années, et des acteurs comme Amazon Robotics, Geek+ ou Exotec en Europe ont développé leurs propres outils internes. SMART vise à démocratiser cet accès, notamment pour les équipes académiques et les intégrateurs de taille intermédiaire. Le framework ADG n'est pas nouveau, il était déjà central dans les travaux antérieurs sur l'exécution robuste de MAPF, mais son intégration dans un simulateur à physique réaliste et passant à l'échelle représente une avancée méthodologique. Les prochaines étapes probables incluent la validation sur des cas industriels concrets et l'ajout de modèles de robots commerciaux comme les AMR à différentiel ou les AGV à guidage magnétique.

UEExotec, acteur français des AMR d'entrepôt, est cité parmi les rares industriels disposant d'outils internes similaires ; SMART pourrait réduire la barrière à l'entrée pour les équipes R&D et intégrateurs européens de taille intermédiaire souhaitant valider des algorithmes MAPF sans flotte physique.

RecherchePaper
1 source
ARIS : un système d'intelligence relationnelle à base d'agents pour les robots sociaux
3arXiv cs.RO 

ARIS : un système d'intelligence relationnelle à base d'agents pour les robots sociaux

Des chercheurs ont publié sur arXiv (arXiv:2605.00943) ARIS, un cadre IA agentique conçu pour doter les robots sociaux d'une mémoire relationnelle persistante et d'un raisonnement contextuel multi-tours. L'architecture combine trois composants : un raisonnement multimodal (vision, parole, action physique), un Social World Model structuré en graphe de connaissances qui cartographie les relations entre utilisateurs, et un pipeline de génération augmentée par récupération (RAG) garantissant une latence bornée même lorsque l'historique de dialogue atteint plusieurs milliers d'échanges. Le système a été évalué sur un robot Pepper de SoftBank Robotics dans un cadre de conversation dyadique. Une étude utilisateur portant sur 23 participants montre qu'ARIS obtient des scores significativement supérieurs à une baseline LLM classique sur quatre dimensions : intelligence perçue, animacité, anthropomorphisme et sympathie. L'apport principal réside dans l'architecture de persistance sociale : les systèmes actuels traitent chaque interaction comme stateless, sans mémoire des rencontres précédentes ni modélisation des liens entre individus. ARIS rompt avec ce paradigme via un graphe de connaissances capable de réidentifier les utilisateurs d'une session à l'autre et de raisonner sur leurs relations mutuelles, une propriété directement utile dans des contextes d'accueil, d'assistance en entreprise ou d'accompagnement médical. Le pipeline RAG résout par ailleurs un problème pratique souvent ignoré : maintenir des réponses pertinentes sans dégradation de latence lorsque l'historique s'allonge, une contrainte critique pour un déploiement réel. Les résultats d'une étude à N=23 restent modestes en termes de puissance statistique, et aucune métrique de latence absolue n'est communiquée dans l'abstract. Le travail s'inscrit dans la vague d'application des grands modèles de fondation à la robotique sociale, dans la lignée de PaLM-E (Google, 2023) et des architectures Vision-Language-Action (VLA) de Physical Intelligence. Sur le marché des robots sociaux, les acteurs clés restent SoftBank Robotics (Pepper, NAO), Furhat Robotics et, côté français, Enchanted Tools avec son robot Miroki. ARIS sera publié en open source à la parution de l'article, ce qui pourrait accélérer l'adoption par des intégrateurs cherchant une couche de mémoire sociale au-dessus de modèles LLM existants. La prochaine étape est une validation en environnement réel.

UELe framework ARIS, promis en open source à la parution, offre une couche de mémoire sociale réutilisable que des intégrateurs européens, notamment Enchanted Tools (Miroki) pour l'accueil et l'assistance, pourraient exploiter directement au-dessus de leurs modèles LLM existants.

RecherchePaper
1 source
RoboChrono : un banc d'essai sur robot réel pour la compréhension de tâches en flux continu
4arXiv cs.RO 

RoboChrono : un banc d'essai sur robot réel pour la compréhension de tâches en flux continu

Des chercheurs publient sur arXiv RoboChrono, un benchmark qui mesure la compréhension de tâches en flux continu (streaming) pendant la manipulation robotique. Il compte 39 scénarios et 34 713 instances d'évaluation, tirées d'exécutions sur robot réel et complétées par des enregistrements de mains humaines nues. Sept tâches sont réparties en trois familles : reconnaissance, alignement et ancrage temporel. Elles couvrent la compréhension et l'anticipation d'actions, la correspondance visuelle, l'ordonnancement temporel et la localisation d'actions. Dix-huit modèles vision-langage ont été évalués en zero-shot. GPT-6-Astra atteint 98,3 % de précision sur l'appariement d'images (Frame Matching), mais seulement 68,3 % sur leur mise en ordre chronologique (Frame Ordering). RynnBrain1.1-122B-A10B montre un écart plus net encore : 95,4 % contre 32,9 %. L'intérêt tient à ce que l'étude dissocie des capacités que les scores agrégés confondent. Une ablation sur cinq modèles open-weight montre que retirer les observations visuelles fait chuter la reconnaissance de l'action en cours de 22,1 points, mais la prédiction de l'action suivante de seulement 0,7 point. Une bonne anticipation peut donc venir de priors sur la tâche et les gestes typiques plutôt que d'une lecture de la scène. Pour un intégrateur ou un responsable industriel, un modèle qui reconnaît bien les images n'est pas forcément fiable pour suivre l'avancement d'une tâche, détecter un échec ou décider d'une reprise. Ces usages exigent une vraie logique temporelle. Le contexte est celui des modèles VLA (Pi-0, GR00T, Helix), qui reposent sur des backbones vision-langage évalués surtout par des taux de réussite de tâche ou des questions-réponses statiques. RoboChrono est un outil de diagnostic : il ne s'agit ni d'un produit ni d'un déploiement, et l'évaluation n'est pas en boucle fermée sur robot. Le résumé ne cite aucun acteur français ou européen, ni de plateforme robotique précise. La suite logique serait de tester des modèles affinés sur des données temporelles robotiques, puis de vérifier si ces écarts se retrouvent dans le succès réel des tâches.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source