Aller au contenu principal
RecherchearXiv cs.RO 

LocoWM : locomotion de haute précision grâce à une adaptation résiduelle guidée par un modèle du monde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

LocoWM est un cadre de contrôle publié sur arXiv (version 1, identifiant 2609.39179) qui vise la locomotion de haute précision, c'est-à-dire le suivi de commandes de mouvement associé à une régulation fine d'états physiques utiles à la tâche. L'architecture combine trois briques. Une politique de base assure la locomotion qui suit les commandes. Un modèle du monde conditionné par l'action prédit une séquence d'états physiques futurs à partir de l'historique proprioceptif et de l'action proposée par la politique de base. Un adaptateur résiduel, alimenté par cette séquence prédite, produit des corrections additives censées compenser les écarts anticipés. L'entraînement se fait en deux étapes : la locomotion et la dynamique conditionnée par l'action sont d'abord apprises, puis les deux modules sont gelés pendant l'entraînement de l'adaptateur. Les auteurs testent trois scénarios, le nivellement de terrain, la compensation d'accélération et la récupération après poussée. Ils annoncent une meilleure précision de contrôle et une meilleure robustesse aux perturbations que des références de bout en bout et des références résiduelles réactives. Démonstrations et code sont publiés en ligne. Le résumé ne donne aucun chiffre, aucun robot ni aucune plateforme matérielle.

L'intérêt tient à un problème connu de l'apprentissage par renforcement pour la marche. Une optimisation conjointe de bout en bout sacrifie souvent les objectifs de précision au profit du suivi de vitesse et de la stabilité, car ces derniers dominent la récompense. Les correcteurs résiduels réactifs, eux, n'agissent qu'une fois l'écart observable, donc trop tard pour des tâches où la tolérance est serrée, par exemple porter une charge, niveler un sol ou tenir une posture en mouvement. Le caractère « préactif » de LocoWM, qui corrige avant que l'erreur ne se manifeste, répond à ce défaut. La séparation entre l'acquisition de la locomotion et l'adaptation de précision est aussi un choix d'ingénierie utile : la politique de base reste intacte et la couche de précision se greffe par-dessus. Reste à vérifier que cela tient au-delà de la simulation. Le résumé ne précise ni le transfert sim-to-real, ni le coût de calcul du modèle du monde à l'inférence, ni l'ampleur des gains. Il s'agit d'un travail de recherche et non d'un produit, sans déploiement industriel.

Ce travail s'inscrit dans le courant qui rapproche modèles du monde et contrôle bas niveau pour les robots à pattes et humanoïdes. Il existe déjà des politiques de locomotion apprises en simulation, des architectures à correction résiduelle et des modèles dynamiques appris pour la planification. Les acteurs industriels de l'humanoïde, comme Figure, Tesla ou Agility, dépendent de telles couches de contrôle bas niveau, sans qu'un lien avec LocoWM soit établi ici. Aucun calendrier de suite n'est annoncé. Les prochaines étapes à surveiller sont la validation sur robot réel, la comparaison chiffrée avec les méthodes existantes et la réutilisation du code publié par d'autres laboratoires.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas
1arXiv cs.RO 

De la prédiction à la décision : sélection d'action guidée par modèle du monde pour l'excavation continue de tas

Une équipe de recherche présente dans un article publie en preprint sur arXiv (2609.15382) le World-Action Model (WAM), un système de décision pour l'excavation autonome par chargeuse sur pneus. Comme chaque scoop modifie le relief disponible pour l'action suivante, WAM génère plusieurs trajectoires de godet candidates, éliminé celles géométriquement impossibles, prédit conjointement pour chacune le changement de terrain et le volume charge, puis exécuté celle au chargement prédit le plus élevé avant de replanifier depuis le nouveau relief observe. Sur 32 épisodes de test MinSlope a géométries distinctes, ce classement par modèle du monde applique a des propositions générées par diffusion fait chuter le nombre moyen de passes de godet de 651,8 a 540,6 (-17,1%), préservé un taux de réussite de 32/32 et améliore chaque épisode teste individuellement. En comparaison système complet, WAM termine ses 32 épisodes contre 29 sur 32 pour une politique "soft actor-critic" entraînée séparément. L'équipe a aussi valide l'interface sur des données de chargeuse grandeur réelle et déployé la boucle complète perception-proposition-prédiction-sélection-exécution en conditions physiques, via une implémentation ROS2/TensorRT traitant cinq candidats en 72,4 millisecondes sur un module Jetson AGX Orin. Le résultat vise un problème central du terrassement autonome: chaque action transforme l'environnement de la décision suivante, ce qui rend l'anticipation des conséquences plus déterminante que la seule qualité du mouvement exécuté. En montrant qu'une couche de décision fondée sur un modèle du monde améliore a la fois l'efficacité, moins de passes pour un même résultat, et la fiabilité, taux de complétion supérieur a une politique de renforcement entraînée de bout en bout, l'étude indique que le gain vient du choix explicite entre plusieurs actions possibles plutôt que de la seule politique de mouvement. Pour les intégrateurs et fabricants d'équipements de chantier et de mines, une baisse de 17% du nombre de passes se traduit directement en gains de temps de cycle a l'échelle d'une flotte, même si ces chiffres restent issus de la simulation, l'expérience physique ne démontrant pour l'instant que la faisabilité de la boucle fermée en conditions réelles. Le travail s'inscrit dans l'automatisation des engins de terrassement, ou les approches existantes reposent soit sur des politiques de mouvement générées par diffusion sans raisonnement explicite sur les conséquences terrain, soit sur de l'apprentissage par renforcement comme le soft actor-critic utilise ici en comparaison. Les auteurs testent également plusieurs représentations d'entrée, étendues spatiales et cinq architectures de réseau afin d'identifier un prédicteur "structure par la physique" a la fois précis et rapide, une contribution méthodologique distincte du résultat applicatif. A ce stade, il s'agit d'un article de recherche en preprint, valide sur chargeuse grandeur réelle en boucle expérimentale mais sans déploiement en flotte ni acteur industriel nomme, ce qui le situe cote recherche amont dans un domaine ou l'automatisation des chargeuses et pelles intéressé autant les laboratoires que les fabricants d'équipements de chantier et de mines.

RecherchePaper
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
2arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA
3arXiv cs.RO 

ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA

Une équipe publie sur arXiv (2608.15816v1) ViTaR (Visuo-Tactile Residual Adaptation), qui comble un angle mort des modèles Vision-Language-Action (VLA) : entraînés sur de vastes a priori visuels, ils produisent la même action que le contact avec l'objet soit établi, perdu ou déstabilisé. Plutôt que de modifier l'intérieur du VLA, au risque d'un oubli catastrophique, ou de recourir à du renforcement en ligne près des conditions d'échec, ViTaR garde le modèle gelé et traite le tactile comme un modulateur d'exécution plutôt que comme une entrée génératrice d'action. Une première étape détermine si une correction résiduelle est localement justifiée à partir des résultats observés, une seconde la convertit en un gain continu calculé en temps réel. Sur le benchmark UniVTAC, sept tâches de manipulation à fort contact, ViTaR atteint 61,3% de réussite moyenne, soit 30,6 points de plus que le VLA gelé de base, devançant aussi des méthodes tactiles spécialisées ; des essais sur robot physique confirment le transfert au bruit et à la dynamique réels des capteurs. Ce résultat cible un point critique pour l'industrialisation des VLA, de plus en plus déployés sur bras manipulateurs et humanoïdes : ces modèles excellent sur des tâches visuelles généralistes mais restent fragiles dès qu'il faut saisir, insérer ou assembler avec un contact fin, un scénario omniprésent en logistique et en assemblage industriel. En montrant qu'une correction résiduelle bornée, greffée sur un VLA figé, suffit à gagner plus de 30 points de réussite sans réentraîner le modèle de base, ViTaR ouvre une voie pour ajouter de la robustesse tactile aux piles VLA existantes sans dégrader leurs capacités généralistes. Les approches précédentes laissaient au contraire au tactile une influence non bornée sur l'action générée, au risque de contredire les a priori qui font la généralisabilité de ces modèles. Le travail s'inscrit dans les efforts pour doter les modèles VLA de fondation, dans la lignée de familles comme Pi-0, GR00T ou Helix, d'une perception multimodale plus fine que la seule vision. Publié comme soumission arXiv nouvelle, ViTaR reste à ce stade une contribution de recherche validée sur un benchmark simulé et par des essais robot physique limités, sans annonce de déploiement industriel ni de partenariat commercial. Les auteurs ne donnent pas de calendrier pour une intégration dans des piles VLA commerciales existantes.

RecherchePaper
1 source
Imagine-RL : cross-attention guidée par la confiance résiduelle pour l'apprentissage par renforcement VLA augmenté par modèle du monde
4arXiv cs.RO 

Imagine-RL : cross-attention guidée par la confiance résiduelle pour l'apprentissage par renforcement VLA augmenté par modèle du monde

Un preprint arXiv publie ce mois-ci (référence 2609.24033) présente Imagine-RL, une méthode de post-entrainement par renforcement pour les politiques Vision-Language-Action (VLA), destinée a la manipulation robotique riche en contacts. Le système associe une politique VLA figée a un modèle du monde latent visuel-couple (VTLWM), lui aussi gelé, qui prédit de manière autoregressive de futures représentations compactes sans reconstruction pixel par pixel. Une requête image-état-action croise l'historique observe et ces futurs prédits, les résidus de prédiction de la fenêtre précédente servant de priors de confiance qui écartent les prédictions peu fiables, pour que le critique juge chaque action candidate selon ses conséquences anticipées. Sur quatre taches robotiques réelles a 50 essais chacune, la méthode n'utilise que 100 trajectoires de renforcement et améliore le taux de réussite moyen de 23,6% face a DSRL et de 60% face aux politiques VLA de base. Ce résultat cible une faiblesse connue des méthodes de RL en espace de bruit, qui pilotent des politiques VLA figées sans reentrainement complet : leurs critiques jugent généralement l'action a partir de la seule observation présente, aveugles aux conséquences physiques futures, ce qui pénalisé les taches a fort contact comme l'insertion ou l'assemblage. Un gain de réussite de 60% obtenu avec seulement 100 trajectoires réelles, sans reentrainer la politique VLA ni le modèle du monde, ouvre une piste de spécialisation peu couteuse pour les intégrateurs qui veulent adapter des politiques généralistes a du matériel réel sans multiplier la collecte de données. L'approche s'inscrit dans une tendance de la recherche robotique a coupler modèles du monde et politiques VLA pour réduire l'écart entre simulation et performance réelle, sur un périmètre pour l'instant limite a quatre taches et 50 essais chacune. Le travail prolonge les méthodes de RL en espace de bruit destinées a affiner des politiques VLA preentrainees sans toucher a leurs poids, DSRL servant ici de référence de comparaison directe. Il y ajoute un modèle du monde spécialisé sur les signaux visuels et de couple, plutôt qu'un modèle génératif pixel, pour rendre exploitable la projection dans le futur sans reentrainement de bout en bout. Le preprint ne précise ni la politique VLA de base ni les taches exactes évaluées, et aucun déploiement industriel n'est annonce : il s'agit d'une contribution de recherche dont la reproductibilité sur d'autres politiques reste a établir.

RechercheOpinion
1 source