Aller au contenu principal
RecherchearXiv cs.RO 

Vers une perception spatiale pour la collaboration de robots hétérogènes en milieu minier souterrain

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv le pipeline de perception embarqué du projet PERSEPHONE, une mission d'extraction minière autonome dans d'anciennes mines souterraines abandonnées. Le système associe deux robots hétérogènes. Un robot « Explorer », léger, cartographie une mine inconnue et produit un graphe de scène 3D des cibles à inspecter. Pour cela, il exécute une pile de segmentation sémantique vision-langage en zero-shot, qui détecte les gisements minéraux à partir de simples requêtes en langage naturel. La carte et le graphe sont ensuite transmis à un second robot, l'« Inspector », équipé d'une charge utile de capteurs avancés, qui s'en sert pour planifier des points de vue d'inspection rapprochée. L'étape clé décrite est l'abstraction géométrique qui transforme les détections brutes en cibles exploitables : génération de boîtes englobantes par vue, fusion des boîtes entre vues, ajustement de plans et extraction de polygones. La validation a eu lieu dans une installation d'essai souterraine et dans une mine de magnésite en activité, sur des minéralisations de veines de fer et de magnésite, en conditions de perception dégradée. Le résumé ne donne ni taux de détection, ni temps de mission, ni dimensions des robots.

L'intérêt tient au constat de départ : aucune plateforme unique ne combine la mobilité nécessaire pour parcourir des kilomètres de galeries dégradées et la charge utile de capteurs requise pour caractériser un corps minéralisé. La réponse est donc une division du travail entre un éclaireur agile et un inspecteur lourd. Pour les intégrateurs et les exploitants, l'enjeu concret est la passation d'un robot à l'autre, à travers une représentation partagée, et non plus la performance d'un seul engin. Le recours à des modèles vision-langage sans entraînement spécifique suggère aussi qu'on peut désigner une cible minérale par une phrase plutôt que par un jeu de données annoté. Reste à savoir ce que vaut cette approche hors des deux sites testés, car le texte ne chiffre pas la précision de détection, la robustesse face à la poussière, à l'obscurité ou aux variations de minéralogie, ni l'autonomie de l'ensemble.

Ce travail s'inscrit dans la robotique souterraine, dont les références restent les équipes de la compétition DARPA SubT, qui avaient éprouvé cartographie et exploration en environnements dégradés, mais surtout pour la recherche et le sauvetage. Ici, la finalité est la réouverture de gisements profonds dans des mines abandonnées, un cas d'usage où le graphe de scène sert d'interface entre perception et planification. Le document est un preprint, non évalué par les pairs, et décrit un pipeline de perception, non un système commercial ni un déploiement industriel. Les suites logiques sont l'intégration avec les phases d'extraction de PERSEPHONE et des essais dans d'autres mines, sans calendrier annoncé dans le résumé.

Dans nos dossiers

À lire aussi

Co-GLANCE : perception active sous incertitude pour équipes de robots hétérogènes
1arXiv cs.RO 

Co-GLANCE : perception active sous incertitude pour équipes de robots hétérogènes

Des chercheurs ont publié Co-GLANCE (arXiv:2606.09919), un système embarqué de perception active et de prise de décision pour équipes robotiques hétérogènes opérant en extérieur non structuré. Le problème central adressé est l'incertitude perceptuelle liée aux occlusions : selon la position d'un robot, certaines zones de la scène restent invisibles ou ambiguës, et aucun agent isolé ne dispose d'un point de vue suffisant pour une compréhension fiable. Co-GLANCE distille les capacités de raisonnement sémantique d'un vision-language model (VLM) dans un modèle embarqué end-to-end qui réalise simultanément la segmentation des occlusions et l'allocation des robots les plus adaptés pour résoudre ces zones d'incertitude. Pour quantifier cette incertitude de façon statistiquement garantie, le système combine la prédiction conforme (conformal prediction) et l'abstention sélective sur les sorties de segmentation, d'allocation et de détection. Comparé aux baselines VLM cloud, Co-GLANCE améliore la précision de segmentation des occlusions de 25% et l'allocation robotique de 36%, tout en réduisant la latence d'inférence par image d'un facteur 350. Un dataset air-sol est également publié en open source. Ce résultat est significatif pour les intégrateurs et les décideurs industriels déployant des flottes multi-robots sur des chantiers, des sites miniers ou des opérations de surveillance. L'élimination de la dépendance au cloud pour l'inférence VLM lève un verrou majeur : latence, connectivité intermittente et coûts d'API. Le gain de 350x en latence n'est pas un chiffre de laboratoire anecdotique, il rend la perception active temps-réel praticable sur du matériel embarqué contraint. La combinaison conformal prediction + abstention sélective apporte des garanties de couverture statistique, ce qui est rare dans les systèmes robotiques terrain : les incertitudes sont exploitables (elles déclenchent des actions), pas seulement affichées. Les travaux sur la coordination multi-robots hétérogènes air-sol s'inscrivent dans un champ actif depuis plusieurs années, avec des groupes comme MIT CSAIL, Stanford, ETH Zurich et CMU comme références principales. La tendance forte est le passage des VLM cloud-only vers des modèles distillés edge-capable, que l'on retrouve aussi dans des travaux comme OpenVLA ou octo. Co-GLANCE se positionne spécifiquement sur l'allocation robotique sous incertitude, un angle moins couvert que la simple navigation ou manipulation. Les prochaines étapes probables incluent des validations sur des flottes plus larges et des environnements dégradés (nuit, pluie), ainsi que l'intégration dans des stacks ROS2 existants. Le code et le dataset sont disponibles sur co-glance.github.io.

RecherchePaper
1 source
Collaboration drone-robot terrestre pour la navigation autonome en terrain enneigé
2arXiv cs.RO 

Collaboration drone-robot terrestre pour la navigation autonome en terrain enneigé

Un preprint arXiv (2608.07797, mis en ligne début aout 2026) décrit un système de navigation collaborative associant un drone et un robot terrestre pour circuler en terrain enneige d'altitude, la ou faible visibilité et sol instable mettent en échec les méthodes classiques. Le dispositif s'appuie sur une architecture U-Net allégée, taillée pour le temps réel sous contrainte de calcul embarque et entraînée via une augmentation de données synthétiques simulant la neige, atteignant 96,5% de précision en segmentation de route. Le drone se localise grâce a un filtre de Kalman étendu fusionnant GPS et IMU, avec une erreur maximale de ±0,5 mètre, tandis que le robot terrestre, sans localisation propre, est suivi par un pipeline YOLOv5 combine aux données de profondeur de sa camera RGB-D embarquée. Un planificateur de trajectoire dynamique contourne ensuite les congères détectées, avec une déviation minimale observée lors des tests. L'approche illustre une tendance de la robotique de terrain: confier a un drone la perception que le robot au sol ne peut assurer seul, utile quand la neige efface les repères visuels et fausse l'odométrie des roues ou chenilles. Pour les intégrateurs déployant des UGV en montagne, en logistique hivernale ou en recherche et sauvetage, cette coordination air-sol permet d'éviter d'équiper chaque robot terrestre d'une suite de capteurs couteuse. Elle confirme aussi que la segmentation sémantique par vision reste exploitable sous contrainte de calcul embarque stricte, un enjeu clé pour déployer des flottes multi-robots a cout maitrise plutôt que des plateformes suréquipées. Le travail s'inscrit dans un courant de recherche plus large sur la coopération UAV-UGV, déjà explore pour des usages militaires ou de secours en montagne, mais rarement valide spécifiquement en conditions neigeuses. Il s'agit d'un preprint non encore revu par les pairs: les 96,5% de précision et la déviation minimale annoncée reposent sur un seul environnement de test contrôle, sans précision sur sa durée, son échelle ou les conditions météorologiques réellement rencontrées. Les auteurs ne mentionnent ni partenaire industriel ni calendrier de déploiement; la suite logique serait une validation en conditions réelles, sur plusieurs sites et avec des chutes de neige actives plutôt qu'un sol déjà enneige mais statique.

RecherchePaper
1 source
D-VLC : collaboration vision-langage décentralisée pour systèmes multi-robots incarnés hétérogènes en environnements inconnus
3arXiv cs.RO 

D-VLC : collaboration vision-langage décentralisée pour systèmes multi-robots incarnés hétérogènes en environnements inconnus

Un article de recherche publié sur arXiv (arXiv:2607.29009v1) présente D-VLC (Decentralized Vision-Language Collaboration), un framework destiné aux essaims de robots hétérogènes évoluant dans des environnements inconnus, sans carte préétablie. Contrairement aux approches classiques qui s'appuient sur une prise de décision centralisée et synchronisée, D-VLC combine un raisonnement décentralisé et asynchrone, un partage d'informations léger entre robots, une collaboration tenant compte des capacités spécifiques de chaque plateforme, et une interface d'action unifiée. Le système permet à des modèles vision-langage (VLM) généralistes de générer des actions adaptées à chaque robot, exécutées ensuite par des modules experts sans apprentissage ni entraînement spécifique à la tâche ou au robot. Testé sur plusieurs scénarios et plusieurs VLM différents, le framework atteint des taux de réussite supérieurs à 70%, avec un temps d'exécution réduit jusqu'à 55,8% par rapport à une méthode de référence gloutonne géométrique. Ce travail s'attaque à une limite bien identifiée des systèmes multi-robots pilotés par LLM ou VLM: leur dépendance à des cartes connues et à une coordination centralisée, qui freine leur généralisation à des flottes hétérogènes et à des tâches inédites. En s'affranchissant de ces contraintes, D-VLC apporte un argument concret au débat sur la capacité des VLM à raisonner et coordonner sans entraînement dédié, un enjeu central pour la logistique, l'entreposage automatisé et les essaims industriels mêlant robots à roues, bras manipulateurs et drones. Le gain de temps de complétion suggère un passage à l'échelle plus réaliste que les démonstrations centralisées habituelles, même si les résultats restent issus d'expériences en environnement contrôlé et non d'un déploiement industriel. D-VLC s'inscrit dans la vague récente de recherches combinant grands modèles de langage et perception visuelle pour la robotique collaborative, après plusieurs générations d'approches à base de règles jugées trop rigides pour des instructions sémantiques complexes. Aucun acteur industriel n'est associé à cette publication à ce stade: il s'agit d'un travail académique, dont la prochaine étape logique serait une validation sur des flottes physiques réelles, hétérogènes, au delà des scénarios expérimentaux actuels.

RecherchePaper
1 source
PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes
4arXiv cs.RO 

PolygMap : un cadre de locomotion perceptive pour la montée d'escaliers des robots humanoïdes

Traversée d'escaliers pour robots humanoïdes: des chercheurs présentent PolyMap, un système de navigation qui construit en temps réel une carte sémantique polygonale des marches à partir de la fusion de plusieurs capteurs, LiDAR, caméra RGB-D et centrales inertielles. Le robot segmente chaque plan de marche sous forme de polygones puis calcule où poser le pied grâce à un planificateur qui exploite directement ces segments plans. L'ensemble tourne sur une carte NVIDIA Orin embarquée, avec une sortie de planification de mouvement corps entier à 20-30 Hz, une cadence suffisante pour ajuster la trajectoire du robot en marchant sans interrompre la locomotion. Les auteurs, dont les travaux sont documentés dans un article déposé sur arXiv (2510.12346, version 2, remplaçant une publication antérieure), rapportent des essais réels en intérieur et en extérieur validant la robustesse et l'efficacité de l'approche pour la montée d'escaliers. L'enjeu dépasse la simple prouesse technique: la marche humanoïde actuelle reste largement conçue pour des sols plats et prévisibles, un schéma de marche générique qui ne demande pas au robot de regarder où il pose le pied. Grimper un escalier inconnu exige au contraire une perception précise et une planification de pas en temps réel, exactement le type de tâche où les démonstrations spectaculaires en environnement contrôlé échouent souvent une fois confrontées à un terrain réel non calibré. En combinant cartographie sémantique et planification de pas sur du matériel embarqué à cadence élevée, PolyMap répond directement à ce fossé entre démonstration et déploiement, un point sensible pour tout intégrateur envisageant des humanoïdes en environnement industriel ou logistique comportant des dénivelés. Cette approche s'inscrit dans une lignée de recherche plus large sur la locomotion perceptive, qui cherche à remplacer les mouvements scriptés par une perception active de l'environnement, un axe également exploré par d'autres laboratoires académiques et industriels travaillant sur la marche humanoïde. Le papier étant une publication arXiv de recherche et non une annonce produit, aucun calendrier de commercialisation n'est communiqué; il s'agit ici d'une contribution méthodologique destinée à alimenter les futurs systèmes de contrôle plutôt que d'un déploiement commercial annoncé.

RecherchePaper
1 source