Aller au contenu principal
RecherchearXiv cs.RO 

De la sélection de cible au creusement : un cadre par apprentissage pour l'excavation autonome continue

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié en septembre 2026 sur arXiv (2609.29750) présente un système d'excavation autonome continue combinant apprentissage par renforcement et apprentissage par imitation. Une politique RL partagée pilote l'approche guidée par points de passage (waypoints) et le transport de charge, tandis qu'une politique IL, entraînée sur des démonstrations expertes, gère le creusement et le levage à partir de données visuelles. Les cibles de creusement sont extraites de cartes d'élévation LiDAR et converties en trajectoires pour la pointe du godet. Testé sur un excavateur hydraulique à échelle réduite équipé de capteurs multimodaux, le système atteint une charge utile moyenne de 6,52 kg par cycle complet, contre 2,68 kg pour la méthode de référence "Fixed Dig", sur trois séries de cinq pelletées consécutives.

Ce travail cible une limite fréquente des démonstrations d'excavation autonome, généralement testées sur un cycle isolé et un tas figé, loin de la réalité d'un chantier où la géométrie du terrain change à chaque pelletée. En séparant la navigation et le transport, confiés au RL plus robuste aux variations, du geste de creusement fin, confié à l'IL plus fidèle au savoir-faire expert, l'approche répond à l'écart classique entre démonstration ponctuelle et usage répété en conditions changeantes. Le gain de charge utile, plus du double de la baseline, constitue un indicateur économique parlant pour les intégrateurs de machines de BTP et de mines, secteurs où la productivité se mesure en tonnes déplacées par heure. Les chiffres restent toutefois issus d'un banc d'essai réduit en laboratoire, pas d'un engin grandeur nature en conditions de chantier réelles.

Le projet s'inscrit dans une évolution académique de l'excavation autonome, qui remplace progressivement les commandes scriptées rigides des premiers systèmes par des politiques apprises combinant RL, IL et, plus récemment, des approches vision-langage-action. Il se distingue d'acteurs industriels comme Built Robotics ou SafeAI, qui automatisent des engins de chantier grandeur nature en conditions réelles : ce travail reste au stade de la recherche, validé sur une plateforme réduite en environnement contrôlé. L'article ne mentionne ni partenaire industriel ni calendrier de commercialisation. La suite logique, non précisée dans le résumé, serait un passage à l'échelle sur un excavateur de taille réelle et des essais en conditions de chantier non contrôlées, où la variabilité du sol et des matériaux dépasse largement celle reproduite en laboratoire.

À lire aussi

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas
1arXiv cs.RO 

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas

Une équipe de recherche présente dans un article publie en preprint sur arXiv (2609.15382) le World-Action Model (WAM), un système de décision pour l'excavation autonome par chargeuse sur pneus. Comme chaque scoop modifie le relief disponible pour l'action suivante, WAM génère plusieurs trajectoires de godet candidates, éliminé celles géométriquement impossibles, prédit conjointement pour chacune le changement de terrain et le volume charge, puis exécuté celle au chargement prédit le plus élevé avant de replanifier depuis le nouveau relief observe. Sur 32 épisodes de test MinSlope a géométries distinctes, ce classement par modèle du monde applique a des propositions générées par diffusion fait chuter le nombre moyen de passes de godet de 651,8 a 540,6 (-17,1%), préservé un taux de réussite de 32/32 et améliore chaque épisode teste individuellement. En comparaison système complet, WAM termine ses 32 épisodes contre 29 sur 32 pour une politique "soft actor-critic" entraînée séparément. L'équipe a aussi valide l'interface sur des données de chargeuse grandeur réelle et déployé la boucle complète perception-proposition-prédiction-sélection-exécution en conditions physiques, via une implémentation ROS2/TensorRT traitant cinq candidats en 72,4 millisecondes sur un module Jetson AGX Orin. Le résultat vise un problème central du terrassement autonome: chaque action transforme l'environnement de la décision suivante, ce qui rend l'anticipation des conséquences plus déterminante que la seule qualité du mouvement exécuté. En montrant qu'une couche de décision fondée sur un modèle du monde améliore a la fois l'efficacité, moins de passes pour un même résultat, et la fiabilité, taux de complétion supérieur a une politique de renforcement entraînée de bout en bout, l'étude indique que le gain vient du choix explicite entre plusieurs actions possibles plutôt que de la seule politique de mouvement. Pour les intégrateurs et fabricants d'équipements de chantier et de mines, une baisse de 17% du nombre de passes se traduit directement en gains de temps de cycle a l'échelle d'une flotte, même si ces chiffres restent issus de la simulation, l'expérience physique ne démontrant pour l'instant que la faisabilité de la boucle fermée en conditions réelles. Le travail s'inscrit dans l'automatisation des engins de terrassement, ou les approches existantes reposent soit sur des politiques de mouvement générées par diffusion sans raisonnement explicite sur les conséquences terrain, soit sur de l'apprentissage par renforcement comme le soft actor-critic utilise ici en comparaison. Les auteurs testent également plusieurs représentations d'entrée, étendues spatiales et cinq architectures de réseau afin d'identifier un prédicteur "structure par la physique" a la fois précis et rapide, une contribution méthodologique distincte du résultat applicatif. A ce stade, il s'agit d'un article de recherche en preprint, valide sur chargeuse grandeur réelle en boucle expérimentale mais sans déploiement en flotte ni acteur industriel nomme, ce qui le situe cote recherche amont dans un domaine ou l'automatisation des chargeuses et pelles intéressé autant les laboratoires que les fabricants d'équipements de chantier et de mines.

RecherchePaper
1 source
Contrôle par vision guidée et cible conditionnée pour l'excavation autonome
2arXiv cs.RO 

Contrôle par vision guidée et cible conditionnée pour l'excavation autonome

L'équipe de recherche à l'origine du preprint arXiv:2608.21778v1, publié en août 2026 et intitulé « Vision Guided Target Conditioned Control for Autonomous Excavation », présente un système de contrôle pour pelles mécaniques autonomes entraîné et testé dans un environnement de simulation physique à sol déformable. Le principe : un masque cible aligné sur l'image sert de commande spatiale visuelle désignant la zone à creuser, tandis qu'un Action Chunking Transformer (ACT) conditionné par ce masque traduit des observations RGB multi-vues, la proprioception du bras et le masque cible en séquences de commandes joystick étendues dans le temps. Pour éviter que le modèle ignore la cible indiquée, les démonstrations d'entraînement associent une même scène à des masques différents et aux séquences d'actions correspondantes. Sur une tâche diagnostique de manipulation, le taux de réussite sur la cible grimpe de 4% pour un ACT sans condition à 63% pour un ACT conditionné par masque non apparié, puis à 96% avec la supervision par paires. Sur un scénario de dégagement séquentiel de tas de terre, la version conditionnée par paires retire 76,8% du volume contre 27,4% et 15,7% pour les deux méthodes de référence, avec une efficacité normalisée à 91% par rapport à un opérateur humain. Ce travail s'adresse à un problème resté largement non résolu dans l'automatisation du BTP et du terrassement : contrairement à la manipulation d'objets rigides, l'excavation implique une interaction sol-outil complexe et changeante, difficile à modéliser et à généraliser par apprentissage par imitation. Les résultats indiquent que le conditionnement visuel par cible et la structuration par paires de démonstrations réduisent significativement un biais connu des architectures type ACT, celui d'ignorer la consigne spatiale fournie. Il s'agit toutefois d'une validation uniquement en simulation, sans transfert vers une machine réelle démontré dans cet article. L'excavation autonome intéresse un écosystème industriel plus large, entre les efforts d'automatisation de flottes minières de Komatsu ou Caterpillar et les startups spécialisées comme Built Robotics ou SafeAI. Ce papier reste une contribution académique isolée, sans annonce de partenaire industriel ni de calendrier de transfert vers le réel, mais il illustre l'extension des architectures de type VLA/ACT, popularisées sur des bras manipulateurs et des humanoïdes, vers les engins de chantier lourds.

RecherchePaper
1 source
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
3arXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence. Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte. CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

RecherchePaper
1 source
Apprentissage de l'exploitation de la dynamique passive pour un saut ciblé économe en énergie d'un quadricoptère à pattes ressorts
4arXiv cs.RO 

Apprentissage de l'exploitation de la dynamique passive pour un saut ciblé économe en énergie d'un quadricoptère à pattes ressorts

Le 15 septembre 2026, une équipe de recherche a publié sur arXiv (arXiv:2609.15447v1) une nouvelle méthode de contrôle pour un quadricoptère monopode à jambe ressort, un robot hybride qui combine poussée aérienne et rebond passif sur une jambe équipée d'un ressort pour se déplacer sur terrain accidenté. Les auteurs remplacent le réglage heuristique par PID, habituellement utilisé pour coordonner poussée active et dynamique de contact passive, par une politique entraînée par apprentissage par renforcement (Proximal Policy Optimization, PPO) qui commande directement les quatre moteurs à partir de l'état estimé du robot, sans machine à états de saut ni boucle PID d'attitude bas niveau. La fonction de récompense combine un module "Energy-Manifold Shaping", qui suit une trajectoire d'énergie verticale normalisée par la masse et ancre l'état au sommet de chaque saut, et un module "Efficiency Shaping", qui s'appuie sur un estimateur de puissance tenant compte de l'historique pour pénaliser la consommation générale, ajouter un coût spécifique à la puissance en phase aérienne, et limiter la quasi-immobilité en vol. Sur des essais matériels représentatifs, la politique PPO réduit la puissance électrique mesurée, moyennée sur le cycle, de 30,7%, et la poussée totale normalisée moyenne de 49,8% par rapport au contrôleur PID de référence, tout en conservant des sauts répétables à hauteur commandée et des atterrissages plus concentrés. Ce résultat s'adresse directement aux limites connues des robots hybrides sol-air: le PID, réglé à la main, sous-exploite la dynamique passive du ressort et gaspille de l'énergie en poussée continue pour compenser une coordination imparfaite. Montrer qu'une politique bout-en-bout, sans machine à états ni boucles imbriquées, réduit à la fois la consommation électrique et la poussée nécessaire tout en gardant la précision de saut, constitue un argument concret pour l'apprentissage par renforcement appliqué à des systèmes physiques à dynamiques de contact intermittentes, un cas plus difficile que la marche pure ou le vol pur. Pour les intégrateurs travaillant sur des robots de terrain autonomes sur batterie, ce type de gain énergétique conditionne directement l'autonomie de mission, un facteur souvent plus limitant que la puissance de calcul embarquée. Le papier s'inscrit dans une lignée de recherche qui cherche à combiner la rapidité de déplacement de l'aérien avec l'efficacité énergétique du contact au sol, une alternative aux quadrirotors purs ou aux robots à pattes classiques pour franchir des obstacles. Il s'agit ici d'un résultat de recherche publié en preprint, validé sur du matériel en conditions représentatives mais pas encore d'un produit commercial ni d'un déploiement opérationnel. Les auteurs ne précisent pas de prochaine étape chiffrée, mais la logique de l'article ouvre la voie à des essais sur terrains plus variés et à une généralisation au-delà du suivi de hauteur de saut.

RecherchePaper
1 source