Aller au contenu principal
Un robot autonome, conscient des normes sociales, franchit des portes et livre une charge utile en urgence
RecherchearXiv cs.RO 

Un robot autonome, conscient des normes sociales, franchit des portes et livre une charge utile en urgence

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de ce papier arXiv (2607.05315v1) ont testé un système d'assistance robotique à l'évacuation d'urgence sur le Toyota Human Support Robot (HSR), une plateforme mobile équipée d'un bras manipulateur. Le robot doit remplir deux missions simultanées lors d'une évacuation : ouvrir les portes sur le chemin des personnes évacuées en repérant et actionnant les boutons d'accès conformes aux normes ADA, et récupérer du matériel de secours pour le livrer aux intervenants d'urgence. L'équipe a bâti l'architecture de décision autour d'un arbre de comportement (behavior tree), une structure capable de sélectionner des tâches de haut niveau selon des déclencheurs environnementaux et de s'étendre à de nouvelles situations. Le système a été évalué sur 105 essais, répartis entre cinq scénarios matériels réels et trois scénarios en simulation, avec un taux de réussite de 97 sur 105, soit environ 92%.

Ce résultat compte parce qu'il s'attaque à un problème rarement traité dans la littérature robotique : la prise de décision sociale en contexte d'urgence, où le robot doit arbitrer en temps réel entre céder le passage à une personne, franchir une porte qu'un humain tient déjà ouverte, ou aller chercher un équipement avant de traverser. C'est un cas concret où la robotique d'assistance dépasse la simple exécution de tâches pour intégrer une conscience de l'environnement humain, un enjeu clé pour les intégrateurs qui envisagent des déploiements en environnements partagés avec des personnes, secteur hospitalier, logistique de secours ou sites industriels évacuables.

Le choix de l'arbre de comportement plutôt qu'un contrôleur monolithique ou un modèle end-to-end répond à un besoin d'extensibilité et de traçabilité des décisions, un critère souvent recherché dans les systèmes destinés à des usages critiques. Les auteurs ont publié le code et des démonstrations vidéo sur GitHub (AndrewSnowdy/hsrmmcontrol), ouvrant la voie à des reproductions et extensions vers d'autres tâches de réponse d'urgence.

Dans nos dossiers

À lire aussi

FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage
1arXiv cs.RO 

FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage

Des chercheurs proposent FLARE (Failure-Aware framework for Autonomous Correction and Recovery), publié sur arXiv sous la référence 2608.26645v1, une méthode destinée aux modèles vision-langage-action (VLA) utilisés pour la manipulation robotique. Le système repose sur deux mécanismes complémentaires baptisés « Retry » et « Reset ». Le mécanisme Retry injecte des perturbations et des segments de transition dans les démonstrations d'entraînement, en dissociant la pose du robot de l'état de l'environnement, afin que la politique apprenne à gérer seule les écarts d'exécution mineurs comme une prise ratée ou un objet qui glisse. Le pipeline Reset s'attaque aux échecs plus graves, dits hors distribution (OOD), qui rompent l'état de la tâche : un grand modèle multimodal (MLLM) analyse hors ligne des vidéos d'exécution pour repérer automatiquement ces états OOD, ce qui permet de constituer une petite bibliothèque ciblée de compétences de récupération centrées sur les objets. En inférence, un moniteur MLLM en ligne arbitre en temps réel entre poursuite de la tâche et déclenchement d'une compétence Reset. Les auteurs annoncent des gains de taux de réussite et de robustesse sur des tâches de manipulation complexes et riches en contacts, sans toutefois détailler dans le résumé les chiffres précis ni la plateforme robotique testée. L'enjeu touche un point faible connu des VLA : entraînés sur des démonstrations « parfaites », sans échec, ils peinent souvent à se rattraper en conditions réelles, un écart classique entre démonstration et déploiement. Pour les intégrateurs et les équipes robotique industrielles, la capacité à détecter et corriger automatiquement une erreur d'exécution, sans intervention humaine ni réinitialisation manuelle du poste de travail, conditionne directement la viabilité de cellules de manipulation autonomes en production. FLARE s'inscrit dans une tendance de recherche qui cherche à combler l'écart entre les démonstrations vidéo souvent présentées par les laboratoires et la réalité d'une ligne de production où objets glissent, collisions surviennent et préhenseurs ratent leur prise. Le travail s'inscrit dans la lignée des modèles VLA génériques récemment mis en avant dans le secteur, comme Pi-0, GR00T N2 ou Helix, qui visent à généraliser la manipulation à partir d'un apprentissage à grande échelle mais partagent la même limite de données d'entraînement sans échec. FLARE reste à ce stade une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel ni de partenariat commercial associé ; sa validation repose sur des expériences en laboratoire, et son adoption dépendra de tests indépendants et d'une éventuelle intégration dans des piles logicielles de manipulation existantes.

RechercheActu
1 source
CSIR : des robots sensibles au contexte et aux normes sociales pour une navigation efficace vers une personne cible
2arXiv cs.RO 

CSIR : des robots sensibles au contexte et aux normes sociales pour une navigation efficace vers une personne cible

Des chercheurs proposent CSIR, un cadre de planification qui permet à un robot mobile de retrouver une personne en intérieur pour lui remettre un objet, même quand la demande est vague et que les informations sur le destinataire sont incomplètes. Le travail, publié sur arXiv (2610.02750) et accompagné d'un site de démonstration anonymisé, traite le problème dit « Person Goal Navigation » (PersonNav). La méthode combine deux signaux : la distance jusqu'aux lieux candidats et des informations sémantiques sur la personne (habitudes, intention), pondérées par le degré de confiance accordé aux renseignements fournis par l'utilisateur. Les auteurs ont aussi construit un banc d'essai synthétique, avec acteurs, objets et requêtes en langage naturel, pour évaluer les performances avant tout déploiement réel. Selon l'étude, la recherche informée surpasse nettement les références classiques fondées sur des graphes et la seule distance. La sémantique employée seule produit une exploration sporadique, mal ancrée dans l'espace. Une variante pilotée par un LLM obtient des résultats comparables. Des essais sur matériel ont été réalisés. Le résumé ne donne ni chiffres de gain, ni plateforme robotique, ni site de test. L'intérêt tient au problème visé. Les systèmes de recherche de personnes existants supposent en général une connaissance exacte de l'individu, ce qui ne correspond pas aux usages de livraison en bureaux, hôpitaux ou hôtels, où la consigne est du type « apporte ça à la personne de la comptabilité ». Le résultat contredit aussi une tentation courante : le tout-sémantique, ou le tout-LLM, ne suffit pas sans ancrage métrique. Le fait que la variante LLM ne fasse que jeu égal avec le planificateur explicite relativise l'idée qu'un modèle de langage généraliste serait nécessaire ici. La représentation explicite des croyances ouvre en outre la voie à un filtrage bayésien, plus auditable pour un intégrateur. Reste une réserve : les gains sont mesurés surtout en simulation sur un benchmark conçu par les auteurs, et la validation matérielle est décrite de façon qualitative. Ce travail s'inscrit dans la navigation orientée objectif (ObjectNav, puis PersonNav), où les approches apprises souffrent d'un manque de données publiques, la confidentialité des personnes limitant la collecte. Les auteurs contournent ce verrou par la planification et la génération synthétique, plutôt que par l'apprentissage de bout en bout adopté par de nombreux laboratoires. Il s'agit d'une publication de recherche, pas d'un produit ni d'un pilote : aucun calendrier de déploiement n'est annoncé. La suite logique serait le filtrage bayésien évoqué, puis des tests en environnement occupé et sur de longues durées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)
3arXiv cs.RO 

Robots de livrable : navigation en foule via apprentissage des préférences sociales (SPLC)

Une équipe de recherche présente SPLC (Social Preference Learning for Crowd Robot Navigation), un nouvel algorithme d'apprentissage par renforcement hors ligne conçu pour faire naviguer des robots au milieu de foules de piétons sans avoir à concevoir manuellement une fonction de récompense. Publié sur arXiv le 2 juillet 2026 (arXiv:2607.01925v1), le système introduit un mécanisme de retour de préférences sociales qui génère automatiquement des données de préférence à partir de critères d'évaluation prédéfinis, en tenant compte explicitement de la dynamique complexe des piétons. Les auteurs ont testé SPLC en combinaison avec plusieurs méthodes de RL hors ligne et rapportent des gains constants par rapport aux meilleures références actuelles sur des métriques de performance standard, avant de valider l'approche en conditions réelles sur un robot TurtleBot4. Le code et des démonstrations vidéo sont disponibles sur le dépôt GitHub du projet (sklus949/SPLC). L'enjeu pratique est la conception des récompenses en RL, un goulot d'étranglement bien connu pour déployer des robots mobiles autonomes dans des environnements humains partagés, entrepôts, hôpitaux, espaces commerciaux. Écrire à la main une fonction qui capture des normes sociales floues (garder ses distances, céder le passage, anticiper une trajectoire) introduit des biais et ne généralise pas d'une foule à l'autre. En automatisant la génération de préférences plutôt que la récompense elle-même, SPLC s'attaque directement au problème du "reward hacking" et du décalage entre simulation et réel, un point sensible pour tout intégrateur qui envisage des robots de navigation autonome en zones piétonnes denses. Le passage à un test réel sur TurtleBot4, plutôt qu'une simple démonstration en simulateur, distingue ce travail de nombreuses publications qui restent cantonnées au benchmark. Ce travail s'inscrit dans une lignée de recherches sur le RL hors ligne appliqué à la navigation sociale, un axe où les laboratoires cherchent à réduire la dépendance aux interactions coûteuses en environnement réel pendant l'entraînement. Les approches concurrentes reposent généralement sur du reward shaping manuel ou sur de l'apprentissage par imitation à partir de trajectoires humaines annotées, des méthodes que les auteurs positionnent comme moins robustes face à la variabilité des comportements piétons. Les prochaines étapes annoncées ne sont pas détaillées dans le résumé, mais la mise à disposition du code laisse présager des évaluations comparatives par d'autres équipes, et potentiellement une extension à des plateformes robotiques plus complexes que le TurtleBot4.

RecherchePaper
1 source
Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff
4arXiv cs.RO 

Diffusion socialement guidée pour une navigation robotique pilotable et ancrée dans les normes sociales : SoGuDiff

Une équipe de recherche publie SoGuDiff (Socially Guided Diffusion), un cadre de navigation robotique fondé sur un modèle de diffusion, dans une prépublication arXiv (2609.30560v1, catégorie "new"). Le système permet de régler à l'exécution le style social d'un robot mobile : distance de passage, côté privilégié pour contourner un obstacle, degré de déférence envers un groupe de personnes. Contrairement aux politiques classiques, entraînées par apprentissage par renforcement sur une récompense fixe ou par imitation de démonstrations humaines, qui figent un comportement unique sans réglage possible, SoGuDiff définit des axes de style continus, utilisables seuls ou combinés, plutôt qu'un catalogue de comportements discrets prédéfinis. Une couche de projection de faisabilité sépare ce comportement social appris des contraintes cinématiques et de l'évitement de collision. Les auteurs montrent qu'un balayage sur un seul axe de style produit une courbe de compromis qui domine strictement les configurations de référence à comportement fixe testées, et que les différences de style se retrouvent dans des démonstrations réelles ; aucune plateforme commerciale, entreprise ni volume de déploiement n'est cité, il s'agit d'une contribution méthodologique et non d'un produit livré. Pour les intégrateurs de robots mobiles autonomes et de service évoluant en environnements partagés avec des humains, l'absence d'interface de réglage du comportement social est une limite connue : chaque site, culture ou réglementation impose ses propres conventions de distance et de priorité de passage, qu'une politique figée gère mal. Pouvoir ajuster ce comportement via des paramètres continus au déploiement, sans ré-entraînement ni choix parmi des comportements discrets prédéfinis, simplifierait l'adaptation d'une même flotte à plusieurs sites. La validation reste toutefois limitée à un seul axe de style balayé et à des références "comportement fixe" définies par les auteurs eux-mêmes, sans comparaison à un système commercial existant ni test à grande échelle : le résultat démontré est une courbe de compromis en banc d'essai, pas un déploiement en flotte. Le travail prolonge des recherches antérieures sur les modèles de diffusion appliqués à la planification de trajectoire, une approche qui a gagné du terrain depuis 2023 pour sa capacité à représenter des comportements multimodaux, à la différence des politiques par renforcement ou par imitation classiques qui convergent vers un comportement moyen unique. L'abstract ne cite aucun concurrent ni acteur industriel, américain ou européen, ni aucun des acteurs FR/EU du secteur AMR comme Wandercraft ou Exotec, le travail relevant de la recherche académique plutôt que d'un produit commercial. Aucun calendrier de pilote ni prochaine étape n'est annoncé : il s'agit pour l'instant d'une simple prépublication, dont la portée pratique dépendra de validations futures sur du matériel varié et à plus grande échelle.

UEAucune entreprise ni institution européenne n'est impliquée, mais la méthode pourrait intéresser les intégrateurs européens de robots mobiles de service confrontes a des normes sociales variables selon les pays.

RecherchePaper
1 source