Aller au contenu principal
LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles
RecherchearXiv cs.RO 

LAMP : apprentissage guidé par un a priori de mouvement latent pour la manipulation dextérique en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de LAMP (Latent Motion Prior-Guided Real-World Learning) proposent une méthode d'apprentissage en trois étapes pour piloter des mains robotiques dexterous directement dans le monde réel, sans passer par la simulation. Le système commence par pré-entraîner un module de "prior de mouvement latent", qui compresse l'historique récent des actions de la main en une représentation compacte et décodable en commandes exécutables à haute dimension. Une politique visuomotrice est ensuite entraînée pour prédire à la fois les commandes natives du bras et des corrections latentes pour la main, avant d'être affinée par apprentissage par renforcement (RL) résiduel en ligne, directement sur le robot physique. Testée sur quatre tâches réelles de manipulation dexterous, la méthode atteint un taux de réussite moyen de 56,25% après la seule phase d'imitation, porté à 98,75% après le RL en ligne, avec 100% de réussite sur trois des quatre tâches et 95% sur la dernière.

L'enjeu dépasse la simple performance chiffrée: l'apprentissage de mains robotiques à haute dimensionnalité (nombreux degrés de liberté par doigt) est historiquement instable, car la moindre erreur d'imitation s'amplifie et pousse l'exploration par renforcement à casser le contact avec l'objet manipulé, un risque direct pour du matériel physique coûteux. En contraignant l'exploration RL à rester proche de mouvements démontrés et cohérents en termes de contact, plutôt que de perturber chaque articulation indépendamment, LAMP répond à un vrai goulot d'étranglement pour les intégrateurs qui veulent déployer de la manipulation fine (préhension d'objets fragiles, assemblage) sans multiplier les cycles de simulation coûteux ni les casses de vérins.

Le travail s'inscrit dans la lignée des approches hybrides imitation + RL déjà explorées pour la robotique, mais cible spécifiquement l'espace d'action des mains dexterous, comparé ici à des interfaces d'action brutes, linéaires et discrètes, que LAMP surpasse selon les auteurs. Publié sur arXiv début juillet 2026, ce travail reste à ce stade une contribution de recherche académique, sans acteur industriel ni date de commercialisation annoncée; sa validation sur davantage de tâches et de plateformes matérielles reste l'étape logique suivante.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique
1arXiv cs.RO 

Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique

Une nouvelle méthode d'apprentissage par renforcement (RL) entraînée directement sur un robot physique, sans simulation préalable ni démonstrations humaines, a été détaillée dans un article publié sur arXiv (2609.14878v1). Le système associe un contrôleur prédictif par échantillonnage (MPC) à un apprenant Soft Actor-Critic hors politique pour piloter une main robotique Allegro à 16 degrés de liberté. Concrètement, 20 trajectoires générées par le MPC sur le matériel réel, collectées en 12 minutes, servent d'abord à préremplir un buffer de rejeu et à pré-entraîner l'acteur et le critique. Pendant la phase en ligne, le MPC continue de guider la collecte de données par intermittence, tandis que le contrôle bascule progressivement vers la politique apprise. Sur une tâche de rotation continue d'objet en main, la politique atteint 100% de réussite en évaluation autonome (5 essais sur 5) après seulement 7 minutes d'apprentissage en ligne, moyennant environ trois chutes d'objet durant l'entraînement. Après 20 minutes, elle tourne plus de cinq fois plus vite que le contrôleur MPC initial et enchaîne 1000 rotations consécutives sur plus de 110 minutes sans lâcher l'objet. Ce résultat s'attaque à l'un des obstacles les plus concrets du RL en robotique: l'exploration initiale aléatoire, lente et destructrice pour le matériel réel. En ancrant l'apprentissage dans l'expérience d'un contrôleur classique plutôt que dans des démonstrations humaines téléopérées, coûteuses à produire en volume, la méthode réduit fortement le temps d'intervention et le nombre d'échecs physiques nécessaires avant d'obtenir une politique fiable. Pour les équipes travaillant sur la manipulation dextre, c'est un indice que l'apprentissage sur robot réel, longtemps jugé trop lent et risqué face au sim-to-real, peut converger en quelques dizaines de minutes sur une tâche à haute dimensionnalité, à condition de structurer l'exploration plutôt que de la laisser libre. Le résultat nuance aussi l'hypothèse selon laquelle des démonstrations humaines seraient indispensables pour amorcer ce type de politique. La démonstration reste toutefois limitée à une tâche de référence en conditions de laboratoire, sans institution ni calendrier de publication du code précisés. Les ablations montrent que le pré-entraînement MPC, la conservation de cette expérience dans le buffer et le guidage MPC en ligne apportent chacun un gain distinct et complémentaire, ce qui distingue l'approche des pipelines purement sim-to-real ou de l'apprentissage par imitation à partir de téléopération, aujourd'hui dominant dans la manipulation dextre humanoïde. Les auteurs rapportent en complément une adaptation rapide à d'autres géométries d'objets et une réorientation conditionnée par objectif, sans annoncer de partenariat industriel ni de déploiement au-delà du résultat de recherche.

RecherchePaper
1 source
Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons
2arXiv cs.RO 

Res-HIL : apprentissage par renforcement résiduel guidé par l'humain pour la manipulation dextérique efficace en échantillons

Res-HIL, un framework de reinforcement learning résiduel guidé par l'humain pour la manipulation robotique dextre, a été publié sur arXiv le 25 septembre 2026 sous la référence 2609.30023. La méthode combine une politique d'imitation pré-entraînée et gelée avec une politique résiduelle corrective, entraînée à partir d'interventions humaines en temps réel : chaque intervention fournit à la fois une supervision directe de la politique résiduelle et un signal de récompense pour le comportement autonome qui l'a précédée. La politique résiduelle démarre à zéro pour stabiliser l'apprentissage en ligne. Testée sur cinq tâches de manipulation à fort contact, mêlant haute précision et longs horizons temporels, Res-HIL surpasse, avec seulement 20 démonstrations initiales et dix minutes d'entraînement en ligne, les méthodes de référence de RL human-in-the-loop à politique complète et de fine-tuning résiduel sans guidage humain. Elle dépasse également des politiques d'imitation pure entraînées avec cinq fois plus de démonstrations. Le résultat cible le principal goulot d'étranglement du déploiement de manipulateurs dextres : le coût de collecte de démonstrations humaines, qui ne garantit pas la généralisation une fois la politique déployée hors distribution. En montrant qu'une correction résiduelle guidée par l'humain, appliquée seulement dix minutes, peut égaler des politiques entraînées sur cinq fois plus de données, Res-HIL suggère que l'effort humain est mieux investi dans la correction ciblée d'une politique existante que dans la multiplication des démonstrations complètes, une remise en cause pratique de l'hypothèse dominante en apprentissage par imitation selon laquelle la qualité dépend avant tout du volume de données. Pour les intégrateurs évaluant des tâches à fort contact comme l'assemblage ou l'insertion, cela ouvre une voie d'amélioration post-déploiement moins coûteuse qu'un ré-entraînement complet. L'approche s'inscrit entre deux courants existants : l'apprentissage par imitation, dont les politiques échouent typiquement hors de la distribution des démonstrations d'entraînement, et le RL human-in-the-loop, qui exploite des corrections en ligne mais réapprend généralement une politique complète plutôt que d'affiner un modèle déjà entraîné. Res-HIL se positionne explicitement contre ces deux références, qu'il surpasse systématiquement dans l'étude comparative. Une analyse d'ablation montre que la supervision directe de la politique résiduelle est le facteur critique de performance, tandis que le façonnage de récompense sensible aux interventions améliore surtout l'efficacité de l'entraînement. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche méthodologique dont la validation sur des plateformes robotiques réelles, au-delà des cinq tâches testées, reste l'étape suivante.

RecherchePaper
1 source
Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines
3arXiv cs.RO 

Apprentissage de la manipulation dextérique via guidage par couple de contact issu de démonstrations humaines

Wandercraft, Exotec, Pollen et Enchanted Tools ne sont pas mentionnés dans le papier, donc aucune mention forcée. Voici l'article : Une équipe de recherche publie CHORD (Contact Wrench Guidance from Human Demonstration in Robotic Dexterous Manipulation), un framework d'apprentissage par renforcement pour la manipulation dextre à long horizon d'objets rigides et articulés, dans un preprint arXiv daté du 2 juillet 2026 (arXiv:2607.00033v1). L'idée centrale consiste à représenter les mouvements humains et robotiques non pas par des trajectoires articulaires brutes, mais par les forces et couples (wrench) qu'ils induisent sur l'objet manipulé, ce qui permet de comparer directement leur effet plutôt que leur cinématique. Les chercheurs ont construit un benchmark de simulation de 4 739 tâches de manipulation bimanuelle dextre, issu de jeux de données de capture de mouvement et de vidéos reconstruites en interne. Sur 1 831 tâches évaluées, CHORD atteint un taux de réussite moyen de 82,12 %. La méthode se généralise aussi à la manipulation corps entier à partir de démonstrations limitées aux mains ou filmées à la troisième personne, avec 90,77 % de réussite, et les politiques apprises se transfèrent vers le réel en boucle ouverte comme en boucle fermée. L'enjeu dépasse la simple prouesse académique : l'apprentissage par renforcement pour la manipulation riche en contacts est réputé difficile à faire passer à l'échelle, car les démonstrations humaines se transposent mal aux mains robotiques dont la cinématique diffère. En ancrant le signal de guidage dans la physique des forces plutôt que dans les gestes eux-mêmes, CHORD contourne en partie ce fossé d'incarnation. Un benchmark de près de 5 000 tâches, avec transfert vérifié sur robot réel et non seulement en simulation, constitue un test de scalabilité plus rigoureux que la plupart des démonstrations ponctuelles habituelles du secteur. Ce travail s'inscrit dans une tendance plus large exploitant la capture de mouvement et la vidéo humaine pour entraîner des politiques robotiques, en parallèle des approches par imitation ou des modèles vision-langage-action comme Pi-0 ou GR00T N2. Étant un preprint, il reste à valider par relecture par les pairs, avec une portée réelle encore limitée aux conditions de laboratoire décrites.

RecherchePaper
1 source
Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles
4arXiv cs.RO 

Une seule démonstration suffit pour l'apprentissage par renforcement robotique en conditions réelles

Des chercheurs présentent AutoSERL, un framework d'apprentissage par renforcement (RL) pour robots qui n'a besoin que d'une seule démonstration humaine pour apprendre des tâches de manipulation complexes en conditions réelles, sans intervention humaine continue pendant l'entraînement. Le système repose sur trois mécanismes complémentaires : une fenêtre glissante d'intervention qui guide l'exploration pour éviter les minima locaux et les mouvements dangereux, un mécanisme de récupération de sécurité qui détecte les échecs et corrige la trajectoire via des points de reprise prédéfinis, et un critère d'arrêt automatique qui coupe le guidage dès que la politique apprise devient autonome. Les auteurs ont testé AutoSERL sur six tâches de manipulation à contact intensif (insertion, accrochage, tâches à charnière) réparties sur deux plateformes robotiques différentes. Le framework atteint 100% de réussite sur les tâches d'insertion et dépasse systématiquement SERL entraîné avec 20 démonstrations, l'apprentissage par imitation classique (behavior cloning) et MILES, une méthode dédiée à l'apprentissage en un coup, tout en égalant les performances de HIL-SERL qui nécessite lui une supervision humaine continue. L'intérêt pour l'industrie tient à la réduction drastique du coût de collecte de données, généralement le principal frein au déploiement de RL sur du matériel physique. La plupart des approches existantes exigent soit des dizaines de démonstrations, soit un opérateur qui intervient en permanence pendant l'entraînement, ce qui limite le passage à l'échelle en usine ou en intégration industrielle. En automatisant l'intervention à partir d'un seul exemple tout en conservant une robustesse aux variations de position des pièces, AutoSERL rapproche le RL réel de tâches d'assemblage fin, un terrain où les approches purement basées sur l'imitation ou les politiques VLA préentraînées peinent encore à garantir une fiabilité industrielle. Ce travail s'inscrit dans la lignée de SERL et HIL-SERL, frameworks de référence pour le RL avec intervention humaine sur robots physiques, en cherchant à supprimer leur principale contrainte opérationnelle. Le code et les vidéos de démonstration sont publiés par les auteurs sur un site dédié, mais le papier, déposé sur arXiv le 1er juillet 2026, reste à ce stade une contribution de recherche académique évaluée en laboratoire sur deux plateformes robotiques, sans indication de déploiement industriel ni de partenariat commercial annoncé.

RecherchePaper
1 source