Aller au contenu principal
RecherchearXiv cs.RO 

Social-WM : des modèles du monde latents sensibles à la sécurité pour la navigation sociale des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient Social-WM, un cadre de planification par modèle de monde latent destiné à la navigation sociale des robots, c'est-à-dire le déplacement parmi des piétons et des obstacles. Le système est entraîné uniquement à partir de séquences vidéo RGB égocentriques. Il prédit, en fonction de l'action commandée, l'observation future réellement obtenue après chaque commande. Il apprend ainsi les conséquences pertinentes pour la sécurité. Un second objectif, dit de dynamique inverse « réalisable », associe chaque transition latente observée à l'action effectivement réalisée, et non à l'action nominale demandée. Au déploiement, le robot imagine plusieurs actions candidates dans le modèle de monde. Le modèle inverse estime ensuite leur réalisabilité, et l'écart entre action nominale et action réalisable sert de signal de sécurité avant exécution. Sur le benchmark Social-HM3D, Social-WM atteint 63,77 % de réussite avec 21,67 % de collisions avec des humains. Les résultats restent solides en transfert zéro-shot sur Social-MP3D. L'approche n'utilise ni suivi explicite des piétons, ni état humain privilégié, ni apprentissage par renforcement en ligne.

L'intérêt tient à la manière de traiter le problème. Une action « avancer » peut s'exécuter entièrement en espace libre, mais doit être freinée ou modifiée face à un piéton ou un obstacle. Les données de navigation sociale contiennent donc un décalage systématique entre commande et mouvement réel. En apprenant ce décalage plutôt qu'en le supposant nul, le robot dispose d'un indicateur de risque sans module de perception dédié aux humains. Pour un intégrateur, cela réduit la dépendance à des piles de suivi et de prédiction de trajectoires, coûteuses à calibrer. Le fait que la dynamique et la réalisabilité soient indépendantes du but permet de réutiliser le même modèle pour la navigation par position et par image-cible. Il faut toutefois relativiser : un taux de collision de 21,67 % reste très éloigné d'un niveau acceptable en environnement réel, et les résultats proviennent de simulation. Aucun test sur robot physique ni comparaison de coûts de calcul n'est mentionné dans le résumé.

Ce travail s'inscrit dans la montée des modèles de monde latents, qui planifient dans un espace de représentation compact plutôt qu'en reconstruisant des pixels, et dans l'effort pour combler l'écart entre simulation et réel en navigation sociale. Les benchmarks utilisés, construits sur les scènes HM3D et Matterport3D, relèvent de la simulation d'intérieur et couvrent mal la variété des lieux publics. Les approches concurrentes reposent généralement soit sur l'apprentissage par renforcement en ligne, soit sur des modules explicites de suivi des piétons. La suite logique est une validation sur plateforme mobile réelle, dans des espaces partagés comme les hôpitaux ou la logistique, où des robots mobiles autonomes (AMR) croisent déjà des opérateurs. Il s'agit pour l'instant d'une préimpression arXiv (v1), non évaluée par les pairs, sans produit ni déploiement annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Modèle du monde pour la navigation sociale de robots guidée par la logique
1arXiv cs.RO 

Modèle du monde pour la navigation sociale de robots guidée par la logique

Des chercheurs ont publié NaviWM (Navigation World Model), un système de navigation robotique socialement consciente qui couple un grand modèle de langage (LLM) avec un modèle de monde structuré et un module de raisonnement logique déductif. Le système repose sur deux composants principaux : un modèle spatio-temporel qui capture en temps réel les positions, vitesses et activités des agents présents dans l'environnement, et un module de raisonnement par chaîne-de-pensée (chain-of-thought) guidé par des règles formelles. La nouveauté centrale est l'encodage des normes sociales en logique du premier ordre (first-order logic), ce qui rend le raisonnement du robot vérifiable et interprétable, contrairement aux approches par prompt engineering ou fine-tuning. Les expériences menées montrent une amélioration du taux de succès de navigation et une réduction des violations sociales dans les environnements encombrés. L'article, disponible en version 2 sur arXiv (référence 2510.23509), est accompagné de vidéos de démonstration publiées par les auteurs. Ce travail s'attaque à une faille bien documentée des LLM appliqués à la planification de trajectoires en robotique mobile : le manque d'ancrage physique et de cohérence logique lorsqu'ils opèrent seuls. En environnements dynamiques peuplés d'humains, les LLM purs produisent des comportements imprévisibles, voire dangereux. En ajoutant une couche de raisonnement formel en aval du LLM sous des contraintes explicites (espace personnel, évitement de collision, gestion du timing), NaviWM propose une solution plus robuste. Pour un intégrateur travaillant sur des robots de service en intérieur, livraison hospitalière ou navigation en entrepôt mixte humain-robot, cela représente un levier concret pour réduire le gap entre démonstration en laboratoire et déploiement opérationnel. Le caractère interprétable du raisonnement constitue également un atout pour les exigences de traçabilité et de certification en milieu industriel ou médical. La navigation sociale pour robots mobiles est un champ en forte effervescence, où coexistent des approches classiques comme ORCA (Optimal Reciprocal Collision Avoidance), des prédicteurs à base de réseaux LSTM sociaux, et plus récemment des systèmes intégrant des VLA (Vision-Language-Action models) comme Pi-0 ou les architectures embarquées de Boston Dynamics et Figure. NaviWM se positionne dans un segment distinct : il ne cherche pas à remplacer le LLM mais à le contraindre via un modèle du monde explicite et des règles formelles, une approche hybride neuro-symbolique proche des travaux du MIT CSAIL sur la planification task-and-motion. Les prochaines étapes naturelles seront de valider l'architecture sur des plateformes physiques hors simulation et de tester la robustesse des règles logiques face à des scénarios sociaux non anticipés lors de leur encodage initial.

RecherchePaper
1 source
Modèles fondation vérifiables pour la sécurité des robots
2arXiv cs.RO 

Modèles fondation vérifiables pour la sécurité des robots

Une équipe de chercheurs présente FEARL (Foundation-Enabled Assured Robot Learning), un cadre publié en juin 2026 sur arXiv (2606.23754), conçu pour rendre les modèles de fondation utilisés en robotique formellement vérifiables. L'architecture repose sur une décomposition en deux modules : un grand Contrôleur (C) qui gère la perception haute dimension et le raisonnement sur les tâches, et un petit module de Sécurité (S) alimenté par des capteurs dédiés basse dimension et un embedding contextuel borné fourni par C, qui produit l'action finale. La vérification formelle s'applique uniquement à S, un composant compact dont les contraintes de sécurité, évitement de collision, limites d'espace de travail, peuvent s'exprimer sur des observations de faible dimension. Le cadre a été évalué sur trois domaines robotiques simulés, en intégrant des VLA (Vision-Language-Action) pré-entraînés disponibles sur étagère, et le transfert vers un robot physique a été validé. Ce découplage répond à un blocage concret pour les intégrateurs et équipes de certification industrielle. Des VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA sont performants mais formellement opaques, ce qui les rend incompatibles avec les outils de vérification existants et freine leur déploiement dans des environnements à risque. FEARL propose un compromis : le Contrôleur conserve sa pleine expressivité pour le raisonnement, tandis que S reste vérifiable. Le transfert sim-to-real réussi indique que l'interface basse dimension ne dégrade pas les performances réelles, ce qui nuance l'hypothèse selon laquelle la richesse sensorielle serait indispensable à un contrôle fiable. Les approches antérieures pour sécuriser les politiques robotiques reposaient sur le reinforcement learning contraint ou des moniteurs d'exécution superposés, sans garanties formelles sur l'ensemble du pipeline. FEARL s'inscrit dans le champ de l'assured autonomy et constitue l'une des premières architectures à intégrer des VLA pré-entraînés dans une boucle vérifiable. Des acteurs comme Enchanted Tools (France) ou Wandercraft, qui développent des systèmes embarqués à contraintes de sécurité fortes, pourraient directement bénéficier de ce type d'approche. Les prochaines étapes naturelles seraient une validation sur des benchmarks de safety formels (IEC 61508, DO-178C) et des tests sur des manipulateurs industriels en environnement non structuré.

UEEnchanted Tools et Wandercraft, acteurs français développant des robots à fortes contraintes de sécurité embarquée, sont explicitement identifiés comme bénéficiaires directs de cette architecture de vérification formelle des VLA.

RecherchePaper
1 source
Sentir le terrain avant de le franchir : des modèles du monde pour la navigation tout-terrain
3arXiv cs.RO 

Sentir le terrain avant de le franchir : des modèles du monde pour la navigation tout-terrain

Une équipe de chercheurs présente, dans un article déposé sur arXiv (référence 2609.19863v1, catégorie "new"), Feel-WM, un modèle de monde ("world model") de navigation conçu pour les terrains accidentés hors piste. Contrairement aux modèles de navigation urbaine, qui se contentent de prédire la scène visuelle à venir, Feel-WM prédit en plus l'état proprioceptif futur du robot, c'est-à-dire son glissement, son inclinaison et ses vibrations le long d'une trajectoire envisagée, ainsi qu'un risque d'échec associé, le tout appris directement à partir de l'expérience du robot sans étiquetage humain. Le planificateur simule ce futur physique en parallèle de la scène visuelle et pondère le risque d'échec prédit face à la proximité avec l'objectif dans un score de décision séparé. Les auteurs ont testé le système sur des données réelles de terrain accidenté et en simulation, sur des plateformes à la fois à roues et à pattes, puis l'ont déployé en embarqué sur un robot à roues Husky lancé sur des sentiers de montagne, où il a anticipé les zones de sol difficile, les a contournées, et a terminé des parcours qu'une politique de bout en bout classique échouait à compléter. L'apport revendiqué est de démontrer que la seule prédiction visuelle ne suffit pas dès que l'interaction robot-terrain devient le facteur dominant, ce qui est le cas hors des environnements urbains structurés où circulent la plupart des robots mobiles commerciaux actuels. En ajoutant la proprioception comme donnée d'entrée, Feel-WM améliore la prédiction du futur physique et surpasse les modèles de navigation purement visuels, aussi bien en planification en boucle ouverte qu'en navigation en boucle fermée sur terrain difficile. Pour les intégrateurs de robots mobiles destinés à l'agriculture, la défense, la sylviculture ou le secours en zone non structurée, ce travail suggère une piste concrète pour réduire les échecs de navigation sans dépendre uniquement de caméras ou de lidars, un enjeu de fiabilité central pour les flottes autonomes en extérieur. Il nuance aussi l'idée reçue selon laquelle les modèles de monde visuels suffiraient à généraliser la planification robotique à tous les environnements. Ce travail s'inscrit dans la tendance de recherche consistant à planifier par anticipation, en simulant les conséquences de chaque action candidate plutôt qu'en associant directement observation et commande, une approche qui concurrence les politiques de bout en bout entraînées par imitation ou apprentissage par renforcement. La quasi-totalité des modèles de monde publiés jusqu'ici ciblait des environnements urbains ou structurés, où l'image seule constitue un proxy suffisant du futur pertinent pour la navigation. Feel-WM comble ce manque pour la robotique tout-terrain en exploitant des signaux proprioceptifs, issus par exemple de centrales inertielles ou d'encodeurs de roues et de jambes, appris de façon autonome. L'article ne mentionne à ce stade ni affiliation industrielle ni partenaire de déploiement commercial : il s'agit d'une validation expérimentale sur robot Husky et en simulation, sans calendrier de mise en production ni pilote industriel annoncé.

RecherchePaper
1 source
G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots
4arXiv cs.RO 

G2-Nav : cartes de coûts vision-langage ancrées et sécurisées pour la navigation sociale des robots

Des chercheurs présentent G2-Nav, un nouveau framework de navigation sociale pour robots mobiles, détaillé dans un article déposé sur arXiv (2607.16956v1). Plutôt que de laisser un modèle vision-langage (VLM) décider directement des trajectoires, comme le font les approches end-to-end existantes, G2-Nav traduit le raisonnement sémantique du VLM en une costmap vision-langage interprétable. Le modèle identifie les zones traversables et les agents sociaux à partir d'une perception en ensemble ouvert (open-set), puis cartographie ce contexte social sous forme de coûts exploitables par le planificateur. Pour renforcer la robustesse en conditions réelles, le VLM effectue aussi une vérification sémantique sur le suivi (tracking) en amont, et les auteurs ajoutent un contrôle de sécurité à haute fréquence destiné à compenser la latence du système avant la génération de trajectoire. Des expériences en environnement réel, selon les auteurs, montrent une navigation autonome sûre, efficace et socialement conforme dans des espaces non structurés. Le code source doit être publié ultérieurement. L'intérêt de ce travail tient à la faille qu'il cherche à combler entre deux approches jugées insuffisantes pour l'autonomie complète: les frameworks VLM end-to-end, qui produisent des décisions de planification difficiles à auditer et donc risquées à déployer, et les méthodes d'instruction-following, pensées pour suivre des consignes humaines plutôt que pour opérer de façon totalement autonome. En cantonnant le VLM à un rôle d'évaluation sémantique plutôt que de contrôle direct, G2-Nav vise une architecture plus traçable, un enjeu concret pour les intégrateurs et décideurs industriels qui doivent justifier la sécurité de robots évoluant parmi des humains, en entrepôt, en établissement de santé ou en espace public. Le garde-fou de sécurité haute fréquence répond en particulier à un angle mort fréquent des démonstrations VLM: la latence d'inférence, souvent ignorée dans les vidéos promotionnelles du secteur. Ce travail s'inscrit dans la vague de recherche actuelle sur l'usage des VLM pour doter les robots d'un raisonnement de niveau humain en navigation sociale, un domaine où les benchmarks restent encore largement issus de démonstrations contrôlées. L'abstract ne précise ni l'institution porteuse ni le matériel robotique utilisé pour les essais réels, et le code, annoncé comme futur, n'est pas encore disponible: il s'agit donc à ce stade d'un préprint à confirmer par la publication effective et par une évaluation indépendante, plutôt que d'une solution déployée ou commercialisée.

RecherchePaper
1 source