Aller au contenu principal
MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte
RecherchearXiv cs.RO 

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente MR-SLAM, un système de supervision en réalité mixte permettant à un opérateur unique de téléopérer simultanément une flotte de robots en cours de cartographie. L'opérateur porte un casque Meta Quest 3 et visualise, via la vue passthrough superposée au monde physique, trois TurtleBot3 simulés naviguer dans l'espace, pendant que des panneaux de tableau de bord ancrés spatialement affichent en temps réel l'état de la cartographie de chaque robot. Côté serveur, chaque robot exécute une instance indépendante de SLAM Toolbox sous ROS 2 (Robot Operating System 2), et leurs grilles d'occupation sont fusionnées en continu. Sur cinq sessions d'évaluation de neuf minutes, le système a maintenu un débit de 8,83 plus ou moins 0,16 Hz, cartographié 17,9 plus ou moins 0,8 m² fusionnés et atteint 94,7 plus ou moins 0,5 % de cohérence inter-instances. Une session additionnelle a enregistré une gigue médiane de transformation de 6,3 ms et une couverture de 26,7 m² sur un espace de référence de 41 m². Il s'agit d'une prépublication arXiv (2605.16432), conduite sur robots simulés en environnement contrôlé, et non d'un produit commercialisé.

La contribution adresse un vrai goulet d'étranglement opérationnel : à mesure que les flottes robotiques grandissent, les interfaces 2D classiques imposent une charge cognitive croissante à l'opérateur, contraint de reconstruire mentalement la géométrie de l'espace à partir de plusieurs fenêtres de cartes planaires. La réalité mixte avec ancrage spatial délègue cette reconstruction à la perception naturelle humaine. Le taux de cohérence de 94,7 % est encourageant pour la fusion multi-robots, mais les chiffres restent à nuancer : environnement contrôlé de moins de 30 m², trois robots seulement, et couverture incomplète (65 % de la grille de référence atteinte dans la session additionnelle). Pour les intégrateurs industriels et les décideurs B2B, le signal utile est la validité de principe sur matériel grand public (Meta Quest 3, environ 500 euros), ce qui ouvre une voie à des solutions de supervision moins coûteuses que des postes de contrôle dédiés.

Le problème de la supervision spatiale de flottes multi-robots est un chantier actif depuis l'essor des AMR dans la logistique et l'inspection industrielle. Les approches dominantes reposent sur des interfaces RVIZ ou des tableaux de bord web 2D, sans restitution de profondeur ni de contexte spatial. Les stacks concurrentes en SLAM multi-robots incluent Cartographer de Google et Nav2 sous ROS 2 ; côté supervision en réalité mixte, les travaux antérieurs ciblaient surtout les bras manipulateurs plutôt que les flottes mobiles. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé. Les prochaines étapes naturelles sont la validation sur robots physiques réels, à plus grande échelle et dans des espaces industriels non contrôlés.

Impact France/UE

Impact indirect et lointain : les intégrateurs européens d'AMR en logistique pourraient à terme bénéficier d'interfaces de supervision moins coûteuses basées sur du matériel grand public, mais aucun acteur FR/EU n'est impliqué et le système reste au stade de préprint sur robots simulés.

Dans nos dossiers

À lire aussi

Décision de navigation topologique pour la localisation et la cartographie multi-session
1arXiv cs.RO 

Décision de navigation topologique pour la localisation et la cartographie multi-session

Des chercheurs publient sur arXiv (référence 2602.17226, version 2 révisée) un nouveau cadre pour la cartographie et la localisation multi-session en robotique autonome, un problème central pour les véhicules autonomes, la topographie et la robotique d'entrepôt ou domestique. Le système repose sur une décision structurelle: plutôt que de relancer systématiquement un SLAM complet a chaque nouvelle visite d'un lieu puis de recoller les cartes obtenues a posteriori, méthode couteuse et source d'erreurs, les auteurs analysent directement la topologie du graphe de poses joint. Ils utilisent des métriques de connectivité spectrale pour repérer les zones déconnectées ou faiblement contraintes de ce graphe, et ne déclenchent une nouvelle cartographie ou une fermeture de boucle que lorsque cette structure révèle un manque de support. La carte et le graphe résultants sont ensuite fusionnes dans le modèle existant, ce qui réduit l'erreur accumulée et améliore la cohérence globale sans remaniement redondant. La méthode a été validée sur des séquences de jeux de données se recouvrant partiellement, puis testée dans un environnement réel de type mine souterraine. Ce travail s'attaque a un angle mort fréquent des pipelines SLAM commerciaux: la plupart des systèmes traitent chaque session d'exploration indépendamment puis tentent de fusionner les cartes après coup, une approche qui échoue souvent dans des environnements répétitifs ou peu textures, un scenario courant en mine, en entrepôt ou sur site industriel. En déplaçant la décision de recartographier vers une analyse topologique explicite plutôt qu'une simple heuristique de correspondance, l'approche vise des cycles de navigation plus courts et moins de dérivé cumulée pour les flottes de robots ou véhicules qui reviennent régulièrement sur les mêmes zones, un enjeu direct pour les intégrateurs d'AMR en logistique et les opérateurs de sites industriels cherchant a réduire le temps d'immobilisation lie au recalibrage cartographique. Elle interroge aussi l'hypothèse répandue selon laquelle une fusion de cartes post-hoc suffit a garantir une localisation fiable sur le long terme. La publication s'inscrit dans la continuité des travaux sur le SLAM multi-session et la localisation basée sur carte, un domaine actif en robotique mobile ou la gestion de la redondance entre sessions reste un point de friction face aux méthodes classiques de fermeture de boucle et aux frameworks de pose-graph existants. Le texte ne mentionne aucun partenariat industriel ni déploiement commercial a ce stade: il s'agit d'une contribution de recherche validée expérimentalement, non d'un produit livre. Les auteurs indiquent vouloir étendre les essais a davantage d'environnements réels, en particulier souterrains, la ou la robustesse face aux zones répétitives et faiblement texturées reste la plus critique.

RecherchePaper
1 source
EgoPush : réarrangement multi-objets à la première personne pour robots mobiles via observabilité contrainte du superviseur
2arXiv cs.RO 

EgoPush : réarrangement multi-objets à la première personne pour robots mobiles via observabilité contrainte du superviseur

Des chercheurs du laboratoire AI4CE publient une version mise à jour sur arXiv (2602.18071v2) d'EgoPush, un système qui permet à un robot mobile de réarranger plusieurs objets en les poussant vers des positions définies relativement à un point d'ancrage, en utilisant uniquement une caméra RGB-D embarquée, sans estimation de pose globale, sans suivi externe ni carte au moment du déploiement. Le système a été transféré en zero-shot sur un TurtleBot, testé dans des scènes contrôlées puis visuellement encombrées. Le résultat central de l'étude concerne l'apprentissage par distillation enseignant-élève: trois "enseignants" privilégiés, disposant d'un accès complet à l'état de la scène et entraînés avec des récompenses, une architecture et des hyperparamètres identiques, dépassent tous 98% de réussite. Pourtant, leurs "élèves" égocentriques distillés à partir de ces enseignants n'atteignent respectivement que 0%, 54,8% et 87,3% de réussite, la seule variable étant la fonction d'observation de l'enseignant. La solution proposée consiste à contraindre l'enseignant lui-même à des indices visuels limités, ne révélant les références de cible que lorsque l'ancrage est visible au centre du champ de vision, afin que sa supervision reste transmissible à un élève basé sur la profondeur, distillé en ligne. Deux éléments techniques supplémentaires soutiennent cette approche: une interface objet-centrée à rôles groupés partagée entre enseignant et élève, et des récompenses à décroissance temporelle par étapes pour gérer l'attribution de crédit sur des horizons longs. Code, vidéos et une version jouable de la tâche sont publiés sur ai4ce.github.io/EgoPush. Cette étude a une portée avant tout méthodologique pour la recherche en manipulation mobile: elle montre que l'échec fréquent de la distillation sim-to-réel dans les tâches de réarrangement ne vient pas nécessairement de l'architecture ou de l'algorithme d'apprentissage, mais de la façon dont l'enseignant privilégié perçoit la scène pendant son propre entraînement. Pour les équipes travaillant sur des robots mobiles de manutention ou des AMR en environnement encombré, le résultat suggère qu'il est possible de s'affranchir d'une brique SLAM ou de cartographie globale pour des tâches de poussée d'objets, un enjeu concret puisque l'action de pousser modifie continuellement la scène qu'un système de cartographie devrait par ailleurs reconstruire. Ce travail s'inscrit dans la lignée des méthodes de "privileged learning" déjà utilisées pour la locomotion de robots à pattes, où un enseignant omniscient guide un élève aux capteurs limités, mais l'applique ici au réarrangement d'objets par poussée, une tâche encore peu couverte par cette littérature. Il se distingue nettement des approches VLA à grande échelle (type GR00T N2, Pi-0 ou Helix) qui visent la généralisation via des modèles fondation entraînés sur des données massives: EgoPush reste une contribution de recherche ciblée, publiée en preprint, testée sur un seul robot en laboratoire, et non un produit ou un pilote industriel.

RecherchePaper
1 source
CognitiveReality : cartographie gaussienne sémantique agnostique au robot avec un agent LLM pour la téléopération VR collaborative immersive
3arXiv cs.RO 

CognitiveReality : cartographie gaussienne sémantique agnostique au robot avec un agent LLM pour la téléopération VR collaborative immersive

CognitiveReality, décrit dans un article publié sur arXiv (2609.31418v1), transforme le flux RGB-D d'un robot en une carte 3D sémantique vivante, combinant Gaussian splatting et TSDF, partagée entre un opérateur en réalité virtuelle et un agent logiciel basé sur un grand modèle de langage. Un seul binaire de cartographie s'adapte par configuration à toute plateforme et compense les pertes de localisation SLAM via un tracker de secours. Un modèle Qwen3-VL-8B exécuté en local atteint 81,24 % de précision dans le choix des outils et corrige 101 identifiants d'objets fusionnés. Sur données réelles, le système dépasse une base Gaussian+SDF de 2 à 8 dB, avec une erreur de pose limitée à 1-8 cm lors de coupures SLAM de 5 à 40 secondes. Testé sur deux robots quadrupèdes, il a réussi 26 des 30 demandes de navigation et 20 des 20 demandes de ré-observation. Le système répond à un problème concret de la téléopération VR : une reconstruction 3D photoréaliste montre où se trouve un robot, pas ce qu'il y a dans la scène ni comment traduire un geste ou une instruction vocale en action. En rendant la cartographie agnostique au robot via un binaire unique configurable, l'approche vise les intégrateurs gérant des flottes hétérogènes sans développement dédié par plateforme. Le recours à un modèle vision-langage léger tournant en local plutôt qu'en cloud répond aux contraintes de latence et de confidentialité industrielles. L'évaluation reste néanmoins modeste, 30 requêtes de navigation et 20 de ré-observation sur deux robots, relevant plutôt d'une preuve de concept que d'une validation industrielle à grande échelle. L'architecture se distingue des systèmes misant sur une autonomie de bout en bout pilotée par des modèles vision-langage-action : l'humain reste dans la boucle via son casque VR, l'agent se limitant à interpréter la scène et à proposer des actions que l'opérateur valide avant exécution. Publié comme article de recherche sur arXiv, sans entreprise ni laboratoire nommé, CognitiveReality relève pour l'instant de la recherche académique plutôt que d'un produit prêt au déploiement, sans calendrier commercial annoncé. Les suites logiques consisteraient à étendre les essais au-delà des deux quadrupèdes testés et à élargir l'échantillon de requêtes pour confirmer ces résultats.

RecherchePaper
1 source
OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots
4arXiv cs.RO 

OctoSense : apprentissage auto-supervisé pour la perception multimodale des robots

Une équipe de recherche a publié sur arXiv (arXiv:2606.17317) OctoSense, une plateforme matérielle open-source de perception multimodale accompagnée d'un dataset de 59 heures de données embarquées synchronisées. Le rig intègre une paire de caméras RGB stéréo, une caméra à événements, un LiDAR, une caméra thermique, une centrale inertielle (IMU), un GPS RTK et des données de proprioception issues d'un bus CAN automobile et d'un robot quadrupède. Les données ont été collectées dans des environnements variés, à différentes heures du jour et de la nuit, y compris en conditions de dégradation sensorielle sévère. Sur ce dataset, les auteurs démontrent une architecture de foundation model baptisée "late-fusion masked autoencoder" : des tokeniseurs spécifiques par modalité gèrent les différences de résolution spatiotemporelle, de fréquence et de latence entre capteurs, puis les tokens sont mis en cache à l'inférence pour traiter les nouvelles mesures au fil de leur arrivée. Le temps de calcul de représentation atteint 6,68 ms sur GPU NVIDIA RTX 5090 et 112 ms sur module embarqué Jetson Orin NX. Ce résultat est notable pour les intégrateurs robotiques car il démontre qu'un modèle auto-supervisé entraîné sur des données réelles hétérogènes surpasse les foundation models vision-only (entraînés sur images seules) sur quatre tâches critiques : estimation du flot optique, reconstruction de profondeur, segmentation sémantique et estimation de l'ego-motion (translation, rotation, angle de braquage). L'absence de labels supervisés dans le pipeline d'entraînement réduit significativement le coût de constitution des datasets pour les équipes qui déploient sur des plateformes mobiles. La robustesse nocturne et en conditions dégradées adresse directement un point de friction récurrent dans les déploiements AMR en entrepôts logistiques et en robotique outdoor. OctoSense s'inscrit dans la tendance des foundation models perceptifs pour la robotique, un espace très actif depuis les travaux de type CLIP/DINOv2 et plus récemment les VLA (Vision-Language-Action models) poussés par Physical Intelligence (Pi-0) et NVIDIA (GR00T). Contrairement à ces approches centrées sur la manipulation ou la navigation en langage naturel, OctoSense cible la représentation sensorielle bas-niveau sur plateforme embarquée contrainte. Le projet est entièrement open-source (code, dataset et vidéos supplémentaires disponibles), ce qui le distingue des stacks propriétaires des acteurs commerciaux. Aucun déploiement industriel ni partenariat n'est annoncé à ce stade ; il s'agit d'un preprint de recherche sans validation externe. La prochaine étape naturelle serait une évaluation sur des benchmarks robotiques standardisés (OpenX-Embodiment, CARLA) pour confirmer la généralisation hors-distribution.

RecherchePaper
1 source