Aller au contenu principal
IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM
RecherchearXiv cs.RO 

IndoorR2X : coordination robot-vers-tout en intérieur pilotée par LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche arXiv (2603.20182v4) présente IndoorR2X, un benchmark et un framework de simulation pour la planification multi-robots pilotée par des grands modèles de langage (LLM), avec perception et communication de type "Robot-to-Everything" (R2X) en environnement intérieur. Le système combine les observations de robots mobiles avec celles de capteurs IoT statiques déjà présents dans de nombreux bâtiments, comme des caméras, pour construire un état sémantique global de la scène. Cette architecture permet une compréhension de l'environnement à l'échelle du bâtiment, dépassant ce qu'un seul robot ou même une flotte en communication robot-à-robot (R2R) peut percevoir. Le framework propose des environnements de simulation configurables, des dispositions de capteurs, des compositions d'équipes robotiques et des suites de tâches, afin d'évaluer systématiquement différentes stratégies de coordination sémantique via planification LLM.

L'enjeu principal que cible IndoorR2X est un problème connu de la robotique multi-agents : la communication R2R seule ne résout pas l'observabilité partielle sans exploration coûteuse ou sans multiplier le nombre de robots déployés. En exploitant des capteurs IoT déjà installés (caméras de bâtiment notamment), l'approche réduit l'exploration redondante et améliore l'efficacité et la fiabilité de la coordination, selon les auteurs. Pour les intégrateurs et opérateurs de flottes AMR en entrepôt ou en environnement industriel, cela ouvre une piste concrète pour réduire les coûts d'infrastructure robotique en réutilisant l'instrumentation IoT existante plutôt que de multiplier les capteurs embarqués.

Ce travail s'inscrit dans la vague de recherche récente combinant LLM et planification robotique multi-agents, où la coordination sémantique de haut niveau reste un défi ouvert face aux limites de perception embarquée. Il s'agit ici d'un outil de recherche et de benchmarking, pas d'un système commercial déployé : les auteurs eux-mêmes documentent les modes d'échec observés dans leurs expériences, signe que la coordination LLM-robots-IoT reste à un stade exploratoire. Le projet, dont le code et les détails sont disponibles sur une page dédiée, vise à devenir une référence pour comparer les futures stratégies de coordination sémantique entre robots et capteurs ambiants.

Dans nos dossiers

À lire aussi

Navigation par apprentissage pour robots mobiles en intérieur
1arXiv cs.RO 

Navigation par apprentissage pour robots mobiles en intérieur

Des chercheurs ont publié sur arXiv (référence 2605.30468) un framework de navigation hybride pour robots mobiles intérieurs, combinant un planificateur global neuronal et un planificateur local affiné par apprentissage par renforcement. Le planificateur global est un réseau de neurones supervisé, entraîné à partir de trajectoires générées par un algorithme A* pondéré par les coûts, ce qui lui permet de produire des routes globalement cohérentes et évitant les zones dangereuses. Le planificateur local, baptisé Learning-Based DWA, reformule l'approche classique Dynamic Window Approach (DWA) comme un problème de sélection discrète sur une grille d'actions prédéfinies. La politique locale est d'abord initialisée par clonage comportemental (imitation d'un expert), puis optimisée par Proximal Policy Optimization (PPO) avec un masquage de faisabilité, un mécanisme éliminant les actions physiquement irréalisables ou à risque de collision avant même l'exploration. Les résultats expérimentaux, conduits en simulation et en environnement réel intérieur, montrent une navigation sûre et fiable vers des objectifs en présence d'obstacles. L'intérêt de cette contribution réside dans son positionnement hybride : plutôt que d'abandonner DWA au profit d'une approche entièrement apprise, les auteurs l'utilisent comme squelette structurant pour contraindre le problème d'apprentissage. Ce choix de conception présente deux avantages pour les intégrateurs. D'abord, le masquage de faisabilité réduit l'espace d'exploration du policy gradient aux seules actions physiquement admissibles, limitant les comportements dangereux en phase d'apprentissage et facilitant le transfert sim-to-réel. Ensuite, conserver la logique DWA comme substrat rend la politique plus interprétable qu'un réseau boîte noire, un critère non négligeable pour les déploiements industriels soumis à certification. La méthode démontre qu'un classique de la robotique réactive, largement jugé dépassé par les approches end-to-end, peut encore être un socle pertinent pour des pipelines d'apprentissage modernes. Le DWA a été introduit par Fox, Burgard et Thrun en 1997 et reste une brique fondamentale des stacks de navigation ROS et Nav2, déployés sur une large partie des flottes d'AMR (robots mobiles autonomes) industriels actuels. C'est dans cet écosystème très installé que s'inscrit ce travail, face à des approches concurrentes plus radicales : navigation end-to-end par apprentissage (ETH Zurich, MIT CSAIL), planificateurs à modèle comme TEB ou MPPI, et méthodes VLA émergentes pour la navigation en langage naturel. Les auteurs annoncent la mise à disposition du code source sur leur page projet. Aucun partenaire industriel ni déploiement commercial n'est mentionné : il s'agit d'une contribution de recherche académique, pas d'un produit commercialisé.

RecherchePaper
1 source
Coordination multi-robots sécurisée par raisonnement VLM-LLM et analyse d'atteignabilité
2arXiv cs.RO 

Coordination multi-robots sécurisée par raisonnement VLM-LLM et analyse d'atteignabilité

Des chercheurs décrivent, dans un article publié sur arXiv (référence 2609.27816v1), une architecture centralisée de coordination sécurisée pour des équipes hétérogènes de robots mobiles communiquant en machine-to-machine. Le système testé associe un quadrupède équipé de caméra et un véhicule robotique dépourvu de caméra, qui doivent atteindre conjointement une zone objectif tout en évitant des obstacles statiques et dynamiques et en prévenant les interactions dangereuses entre eux. Le quadrupède transmet sa compréhension sémantique de l'environnement à un serveur centralisé via un broker MQTT, ce qui permet au véhicule sans caméra de naviguer à partir de cette représentation partagée combinée à sa propre odométrie, ses centrales inertielles (IMU) et ses retours d'état. Un modèle vision-langage (VLM) interprète le flux vidéo et convertit les données sémantiques en contraintes géométriques métriques conservatives : ensembles d'obstacles dilatés, corridors sûrs et zones cibles. Un grand modèle de langage (LLM) propose ensuite une répartition des tâches de haut niveau, mais l'autorité d'exécution des commandes reste conditionnée à un filtre de vérification spécifique à chaque robot, fondé sur l'analyse d'atteignabilité par zonotopes, qui propage des tubes atteignables indépendants pour valider l'évitement d'obstacles, le confinement dans les corridors sûrs et la séparation entre robots avant d'approuver tout mouvement. Des expériences en conditions réelles, sur des scénarios à chemin dégagé et à obstacles dynamiques, montrent que le pipeline approuve de façon fiable les mouvements sûrs et déclenche une replanification conservative ou un arrêt temporaire dès qu'une contrainte est violée. Ce travail illustre une tendance de fond en robotique multi-agents : coupler des modèles VLM et LLM, puissants mais non vérifiables formellement, à une couche de sécurité mathématiquement garantie, seule détentrice de l'autorité d'exécution. Pour les intégrateurs et décideurs qui envisagent des flottes hétérogènes (robots à pattes, AMR, bras manipulateurs) partageant un même espace de travail, l'article répond à une limite récurrente des approches de planification robotique purement fondées sur des modèles de langage : l'absence de garanties de sécurité. En séparant strictement le raisonnement sémantique consultatif de l'exécution motrice vérifiée, l'architecture traite explicitement l'écart entre démonstration et fiabilité opérationnelle, un enjeu central pour tout déploiement de systèmes robotiques pilotés par IA générative dans des environnements partagés avec des humains ou d'autres machines. Cette publication s'inscrit dans un courant de recherche qui cherche à exploiter VLM et LLM pour la perception et la planification robotique tout en compensant leur manque de garanties par des méthodes de vérification formelle issues du contrôle, comme l'analyse d'atteignabilité par zonotopes, déjà employée pour certifier des systèmes autonomes critiques. Il s'agit d'une preuve de concept académique, testée en expériences réelles sur une paire de plateformes physiques plutôt qu'en simulation seule, ce qui la distingue de nombreuses démonstrations purement simulées du domaine. Aucun acteur européen n'apparaît dans cette publication, et les auteurs ne fixent aucun calendrier de transfert industriel, mais l'approche pourrait intéresser les fournisseurs de flottes multi-robots hétérogènes, notamment en logistique et en industrie, cherchant à certifier la sécurité d'interactions entre plateformes aux capacités de perception très différentes.

RecherchePaper
1 source
IndoorBEV : un système léger de perception BEV par LiDAR en temps réel pour robots mobiles d'intérieur
3arXiv cs.RO 

IndoorBEV : un système léger de perception BEV par LiDAR en temps réel pour robots mobiles d'intérieur

Des chercheurs publient sur arXiv (2610.00355) IndoorBEV, un système de perception LiDAR conçu pour les robots mobiles d'intérieur. Le modèle ne compte que 0,6 million de paramètres et occupe 2,3 Mo de stockage. Sur un NVIDIA AGX Orin, il consomme 21,52 Mo de mémoire GPU par inférence et affiche une latence moyenne de 169,6 ms, pour une échéance de perception fixée à 200 ms. Le taux de dépassement de cette échéance est de 1,8 %. Le système produit simultanément des cartes sémantiques en vue de dessus (BEV, bird's-eye view) et des boîtes englobantes orientées pour les objets. Il repose sur une représentation BEV « consciente de la hauteur » : pour chaque cellule, la distribution verticale des points est résumée par des statistiques de hauteur et un encodage multi-fréquence, ce qui permet à de simples convolutions 2D de traiter une information 3D. Un encodeur léger fusionne ces indices géométriques avec des représentations locales multi-échelles et un contexte global compact, puis des têtes de prédiction découplées génèrent les sorties. L'évaluation couvre des scènes simulées, des scans réels de robots et un jeu de données ouvert de nuages de points d'intérieur. L'enjeu est très concret pour les intégrateurs et les équipes qui embarquent de la perception sur des plateformes à budget calcul limité. Les méthodes à base de points ou de voxels restent coûteuses, tandis que les BEV classiques, issus surtout de la conduite autonome, sacrifient la géométrie verticale, un handicap dans des intérieurs encombrés où tables, étagères, suspensions et objets en surplomb comptent. Avec un modèle de 2,3 Mo, IndoorBEV laisse l'essentiel du GPU disponible pour la navigation, la planification ou d'autres réseaux sur la même machine. Les auteurs affirment ainsi qu'encoder explicitement la hauteur dans une représentation 2D compacte est une voie viable. Quelques réserves s'imposent : il s'agit d'une préimpression non relue par les pairs, une latence moyenne de 169,6 ms sous une échéance de 200 ms laisse une marge mince, soit environ 6 images par seconde, ce qui est modeste pour un robot rapide, et le résumé ne donne aucun chiffre de précision, ni comparaison chiffrée avec des modèles concurrents. L'affirmation d'un « compromis favorable » reste donc à vérifier dans l'article complet. Ce travail s'inscrit dans la série des architectures BEV, popularisées par la conduite autonome (PointPillars, BEVFusion) et désormais adaptées aux contraintes de l'embarqué. Le choix de l'AGX Orin, plateforme de référence pour la robotique mobile, rend les résultats comparables à ce que les intégrateurs déploient réellement. Les concurrents sont les réseaux voxel creux et les approches point à point, plus précis mais plus lourds, ainsi que les modèles de fondation de perception 3D, qui visent la généralité plutôt que la frugalité. Aucune annonce de déploiement industriel, de code ou de pilote n'accompagne la publication à ce stade. La suite logique consisterait à publier des benchmarks comparatifs, à tester le système sur des robots en conditions réelles de logistique ou de service, et à vérifier sa tenue face à des environnements dynamiques et à des capteurs LiDAR de résolutions différentes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
NavVerse : évaluer la navigation incarnée intérieur-extérieur en simulation robotique continue
4arXiv cs.RO 

NavVerse : évaluer la navigation incarnée intérieur-extérieur en simulation robotique continue

NavVerse est un nouveau benchmark de simulation physique dédié à la navigation robotique continue entre intérieur et extérieur, présenté dans un article déposé sur arXiv le 24 juillet 2026. Il couvre 100 scènes intérieures, 50 scènes urbaines extérieures et 50 scènes hybrides intérieur-extérieur, pour un total de 10 000 épisodes répartis sur trois tâches : navigation vers un objet (Object Navigation), navigation guidée par le langage (Vision-and-Language Navigation) et navigation vers un lieu (Place Navigation), où l'agent doit localiser des points d'intérêt sémantiques comme un restaurant ou une banque. Contrairement aux benchmarks existants qui évaluent séparément l'intérieur et l'extérieur et abstraient souvent l'exécution robotique réelle, NavVerse impose aux agents de passer par des interfaces robotiques exécutables, avec des métriques de succès de tâche, d'efficacité de trajectoire et de sécurité. Les tests zéro-shot menés avec des baselines par apprentissage par renforcement (RL), des modèles vision-langage-action (VLA) et des architectures modulaires montrent qu'aucune approche ne résout le problème : les VLA de bout en bout obtiennent le meilleur taux de succès zéro-shot, tandis que la méthode modulaire affiche le meilleur profil de sécurité. Cette double évaluation comble un angle mort réel du secteur : la plupart des robots de livraison, de campus ou d'intervention d'urgence doivent aujourd'hui franchir la frontière bâtiment-rue au sein d'un seul épisode continu, un cas d'usage rarement testé de bout en bout. Le résultat le plus révélateur concerne PlaceNav, dont les performances chutent nettement dès qu'on passe d'un environnement purement extérieur à un scénario hybride intérieur-extérieur, ce qui pointe l'adaptation au changement de contexte comme goulot d'étranglement majeur plutôt que la perception ou la planification prises isolément. Pour les intégrateurs et décideurs B2B, ce constat tempère l'idée que les modèles VLA génériques sont prêts à généraliser sans friction hors des environnements d'entraînement : le meilleur taux de succès zéro-shot ne s'accompagne pas du meilleur niveau de sécurité, ce qui illustre un arbitrage encore mal résolu entre performance brute et fiabilité opérationnelle. Le benchmark s'inscrit dans une lignée de plateformes de simulation pour la navigation incarnée (embodied navigation), généralement centrées soit sur l'intérieur soit sur l'extérieur, que NavVerse cherche explicitement à unifier en modélisant la traversée de frontière, la recherche de sortie et les échecs kinodynamiques souvent ignorés ailleurs. L'article ne précise pas d'institution porteuse ni de partenaire industriel, et reste à ce stade un outil d'évaluation académique plutôt qu'un produit déployé. Les prochaines étapes annoncées concernent l'élargissement des baselines testées et l'affinement des scénarios hybrides, dans un contexte où la course aux agents de navigation généralistes s'intensifie face à la difficulté persistante de transférer des compétences apprises en simulation vers des déploiements réels multi-environnements.

RecherchePaper
1 source