Aller au contenu principal
Contrôle par vision guidée et cible conditionnée pour l'excavation autonome
RecherchearXiv cs.RO 

Contrôle par vision guidée et cible conditionnée pour l'excavation autonome

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'équipe de recherche à l'origine du preprint arXiv:2608.21778v1, publié en août 2026 et intitulé « Vision Guided Target Conditioned Control for Autonomous Excavation », présente un système de contrôle pour pelles mécaniques autonomes entraîné et testé dans un environnement de simulation physique à sol déformable. Le principe : un masque cible aligné sur l'image sert de commande spatiale visuelle désignant la zone à creuser, tandis qu'un Action Chunking Transformer (ACT) conditionné par ce masque traduit des observations RGB multi-vues, la proprioception du bras et le masque cible en séquences de commandes joystick étendues dans le temps. Pour éviter que le modèle ignore la cible indiquée, les démonstrations d'entraînement associent une même scène à des masques différents et aux séquences d'actions correspondantes. Sur une tâche diagnostique de manipulation, le taux de réussite sur la cible grimpe de 4% pour un ACT sans condition à 63% pour un ACT conditionné par masque non apparié, puis à 96% avec la supervision par paires. Sur un scénario de dégagement séquentiel de tas de terre, la version conditionnée par paires retire 76,8% du volume contre 27,4% et 15,7% pour les deux méthodes de référence, avec une efficacité normalisée à 91% par rapport à un opérateur humain.

Ce travail s'adresse à un problème resté largement non résolu dans l'automatisation du BTP et du terrassement : contrairement à la manipulation d'objets rigides, l'excavation implique une interaction sol-outil complexe et changeante, difficile à modéliser et à généraliser par apprentissage par imitation. Les résultats indiquent que le conditionnement visuel par cible et la structuration par paires de démonstrations réduisent significativement un biais connu des architectures type ACT, celui d'ignorer la consigne spatiale fournie. Il s'agit toutefois d'une validation uniquement en simulation, sans transfert vers une machine réelle démontré dans cet article.

L'excavation autonome intéresse un écosystème industriel plus large, entre les efforts d'automatisation de flottes minières de Komatsu ou Caterpillar et les startups spécialisées comme Built Robotics ou SafeAI. Ce papier reste une contribution académique isolée, sans annonce de partenaire industriel ni de calendrier de transfert vers le réel, mais il illustre l'extension des architectures de type VLA/ACT, popularisées sur des bras manipulateurs et des humanoïdes, vers les engins de chantier lourds.

Dans nos dossiers

À lire aussi

Video Assessment Conditionnée par l'Action et le Langage pour le Contrôle Incarné
1arXiv cs.RO 

Video Assessment Conditionnée par l'Action et le Langage pour le Contrôle Incarné

ALVA, pour Action- and Language-Conditioned Video Assessment, est une méthode d'évaluation de trajectoires présentée dans une prépublication arXiv d'août 2026 (référence 2608.08273), qui vérifie si un agent robotique a réellement exécuté une instruction en langage naturel donnée en plusieurs étapes. Le système s'appuie sur un modèle vision-langage pré-entraîné en deux temps : il résume d'abord les transitions visuelles conditionnées sur les actions exécutées, puis confronte ce résumé à l'instruction pour produire un score discret de progression sur la trajectoire. Testé dans des environnements domestiques 3D simulés, ALVA se montre conservateur, avec un taux de faux positifs proche de zéro, et utilisé comme récompense terminale pour l'optimisation de politiques, il surpasse les références fondées sur l'image finale ou la similarité d'embeddings et réduit l'écart avec un oracle de vérité terrain. Ce travail s'attaque à un point faible connu de l'apprentissage par renforcement pour agents suivant des instructions : concevoir une récompense fiable capable de détecter si une tâche multi-étapes est vraiment accomplie, sans se laisser tromper par des états visuellement proches mais fonctionnellement incorrects. Pour les équipes qui entraînent des politiques VLA (vision-language-action), un évaluateur conservateur, quitte à sous-noter certaines réussites, limite le risque qu'un agent apprenne à exploiter les failles d'une récompense trop permissive et conforte l'idée que des VLM généralistes peuvent servir de juges interprétables pour le contrôle robotique. Ces résultats restent toutefois circonscrits à des environnements simulés, sans validation sur robot physique, ce qui limite pour l'instant leur portée industrielle directe. La démarche s'inscrit dans un courant de recherche plus large visant à remplacer les récompenses figées, fondées sur l'appariement de l'image finale ou la distance d'embedding, par des juges basés sur des modèles de fondation capables de raisonner sur une trajectoire complète et le langage de la consigne. Cette prépublication arXiv n'a pas encore été relue par les pairs et ne compare pas ALVA à des systèmes commerciaux. Les auteurs le présentent comme un mécanisme de feedback interprétable pour les tâches de contrôle robotique simulées étudiées, laissant ouverte son extension à des tâches plus complexes ou à des robots réels, étape logique mais non annoncée à ce stade.

RecherchePaper
1 source
De la sélection de cible au creusement : un cadre par apprentissage pour l'excavation autonome continue
2arXiv cs.RO 

De la sélection de cible au creusement : un cadre par apprentissage pour l'excavation autonome continue

Un article publié en septembre 2026 sur arXiv (2609.29750) présente un système d'excavation autonome continue combinant apprentissage par renforcement et apprentissage par imitation. Une politique RL partagée pilote l'approche guidée par points de passage (waypoints) et le transport de charge, tandis qu'une politique IL, entraînée sur des démonstrations expertes, gère le creusement et le levage à partir de données visuelles. Les cibles de creusement sont extraites de cartes d'élévation LiDAR et converties en trajectoires pour la pointe du godet. Testé sur un excavateur hydraulique à échelle réduite équipé de capteurs multimodaux, le système atteint une charge utile moyenne de 6,52 kg par cycle complet, contre 2,68 kg pour la méthode de référence "Fixed Dig", sur trois séries de cinq pelletées consécutives. Ce travail cible une limite fréquente des démonstrations d'excavation autonome, généralement testées sur un cycle isolé et un tas figé, loin de la réalité d'un chantier où la géométrie du terrain change à chaque pelletée. En séparant la navigation et le transport, confiés au RL plus robuste aux variations, du geste de creusement fin, confié à l'IL plus fidèle au savoir-faire expert, l'approche répond à l'écart classique entre démonstration ponctuelle et usage répété en conditions changeantes. Le gain de charge utile, plus du double de la baseline, constitue un indicateur économique parlant pour les intégrateurs de machines de BTP et de mines, secteurs où la productivité se mesure en tonnes déplacées par heure. Les chiffres restent toutefois issus d'un banc d'essai réduit en laboratoire, pas d'un engin grandeur nature en conditions de chantier réelles. Le projet s'inscrit dans une évolution académique de l'excavation autonome, qui remplace progressivement les commandes scriptées rigides des premiers systèmes par des politiques apprises combinant RL, IL et, plus récemment, des approches vision-langage-action. Il se distingue d'acteurs industriels comme Built Robotics ou SafeAI, qui automatisent des engins de chantier grandeur nature en conditions réelles : ce travail reste au stade de la recherche, validé sur une plateforme réduite en environnement contrôlé. L'article ne mentionne ni partenaire industriel ni calendrier de commercialisation. La suite logique, non précisée dans le résumé, serait un passage à l'échelle sur un excavateur de taille réelle et des essais en conditions de chantier non contrôlées, où la variabilité du sol et des matériaux dépasse largement celle reproduite en laboratoire.

RecherchePaper
1 source
De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas
3arXiv cs.RO 

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas

Une équipe de recherche présente dans un article publie en preprint sur arXiv (2609.15382) le World-Action Model (WAM), un système de décision pour l'excavation autonome par chargeuse sur pneus. Comme chaque scoop modifie le relief disponible pour l'action suivante, WAM génère plusieurs trajectoires de godet candidates, éliminé celles géométriquement impossibles, prédit conjointement pour chacune le changement de terrain et le volume charge, puis exécuté celle au chargement prédit le plus élevé avant de replanifier depuis le nouveau relief observe. Sur 32 épisodes de test MinSlope a géométries distinctes, ce classement par modèle du monde applique a des propositions générées par diffusion fait chuter le nombre moyen de passes de godet de 651,8 a 540,6 (-17,1%), préservé un taux de réussite de 32/32 et améliore chaque épisode teste individuellement. En comparaison système complet, WAM termine ses 32 épisodes contre 29 sur 32 pour une politique "soft actor-critic" entraînée séparément. L'équipe a aussi valide l'interface sur des données de chargeuse grandeur réelle et déployé la boucle complète perception-proposition-prédiction-sélection-exécution en conditions physiques, via une implémentation ROS2/TensorRT traitant cinq candidats en 72,4 millisecondes sur un module Jetson AGX Orin. Le résultat vise un problème central du terrassement autonome: chaque action transforme l'environnement de la décision suivante, ce qui rend l'anticipation des conséquences plus déterminante que la seule qualité du mouvement exécuté. En montrant qu'une couche de décision fondée sur un modèle du monde améliore a la fois l'efficacité, moins de passes pour un même résultat, et la fiabilité, taux de complétion supérieur a une politique de renforcement entraînée de bout en bout, l'étude indique que le gain vient du choix explicite entre plusieurs actions possibles plutôt que de la seule politique de mouvement. Pour les intégrateurs et fabricants d'équipements de chantier et de mines, une baisse de 17% du nombre de passes se traduit directement en gains de temps de cycle a l'échelle d'une flotte, même si ces chiffres restent issus de la simulation, l'expérience physique ne démontrant pour l'instant que la faisabilité de la boucle fermée en conditions réelles. Le travail s'inscrit dans l'automatisation des engins de terrassement, ou les approches existantes reposent soit sur des politiques de mouvement générées par diffusion sans raisonnement explicite sur les conséquences terrain, soit sur de l'apprentissage par renforcement comme le soft actor-critic utilise ici en comparaison. Les auteurs testent également plusieurs représentations d'entrée, étendues spatiales et cinq architectures de réseau afin d'identifier un prédicteur "structure par la physique" a la fois précis et rapide, une contribution méthodologique distincte du résultat applicatif. A ce stade, il s'agit d'un article de recherche en preprint, valide sur chargeuse grandeur réelle en boucle expérimentale mais sans déploiement en flotte ni acteur industriel nomme, ce qui le situe cote recherche amont dans un domaine ou l'automatisation des chargeuses et pelles intéressé autant les laboratoires que les fabricants d'équipements de chantier et de mines.

RecherchePaper
1 source
Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome
4arXiv cs.RO 

Réseau de perception visuelle multitâche conditionné par un LLM pour la navigation autonome

Un article de recherche publié en septembre 2026 sur arXiv (référence 2609.14297) décrit un nouveau framework de navigation autonome pour robots de service, baptisé VL-Navigation. Le système associe un réseau de perception visuelle multi-tâches à un grand modèle de langage (LLM) capable d'interpréter des commandes vocales ou textuelles de l'utilisateur. Contrairement aux approches classiques de planification de trajectoire comme A, RRT, DiPPer ou ViT-A, qui s'appuient sur une carte 2D globale et se dégradent avec l'accumulation de dérive odométrique et d'erreurs de capteurs, VL-Navigation génère des plans d'action séquentiels à partir d'indices visuels locaux et d'instructions géométriques égocentriques. La localisation est réinitialisée à chaque cible intermédiaire, ce qui limite l'accumulation de dérive sans nécessiter la maintenance d'une carte globale cohérente. Les chercheurs annoncent des résultats supérieurs aux méthodes existantes sur des données réelles et simulées, sans toutefois publier dans le résumé de chiffres précis de taux de réussite ou de temps de cycle, ce qui invite à la prudence tant que le travail n'a pas été validé par une relecture par les pairs. Le code source est disponible publiquement sur GitHub, sous le dépôt PraveenSingh24/VL-Navigation. Pour les intégrateurs de robots de service, en hôtellerie, en logistique légère ou en environnement hospitalier, ce travail cible un point de friction bien réel: le coût de maintenance des cartes SLAM dans des lieux qui évoluent constamment, mobilier déplacé, couloirs encombrés, zones en travaux. En confiant à un LLM la traduction d'instructions naturelles en plans d'action locaux plutôt qu'à une carte globale figée, l'approche s'inscrit dans la tendance plus large des modèles vision-langage-action qui cherchent à remplacer une partie du pipeline de cartographie classique par du raisonnement contextuel embarqué. Si les résultats se confirment à plus grande échelle, une telle méthode pourrait réduire le temps d'ingénierie nécessaire au déploiement de flottes mobiles dans des environnements partiellement inconnus, un frein récurrent à la commercialisation de la robotique de service au-delà des démonstrations contrôlées. La dérive odométrique cumulative reste un problème non résolu depuis les débuts de la navigation mobile autonome, et les algorithmes de référence cités dans l'article, A, RRT, DiPPer et ViT-A, illustrent les limites successives des approches purement géométriques face à des environnements dynamiques. VL-Navigation se positionne dans la lignée d'autres travaux récents associant modèles de langage et perception visuelle pour la navigation robotique, un champ en pleine expansion en parallèle des modèles VLA appliqués à la manipulation comme Pi-0 ou GR00T N2. Publié comme preprint sans affiliation industrielle mentionnée, l'article ne précise ni calendrier de déploiement pilote ni partenariat commercial; la mise à disposition du code sur GitHub vise avant tout la reproductibilité par la communauté académique, une étape encore éloignée d'une intégration en produit commercial.

RecherchePaper
1 source