Aller au contenu principal
FAME : RL adaptatif à la force pour élargir l'enveloppe de manipulation d'un robot humanoïde grandeur nature
RecherchearXiv cs.RO 

FAME : RL adaptatif à la force pour élargir l'enveloppe de manipulation d'un robot humanoïde grandeur nature

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire CORRELL proposent FAME, un cadre d'apprentissage par renforcement qui permet à un humanoïde grandeur nature de rester stable lorsqu'il subit des forces aux mains pendant une manipulation bimanuelle. Le travail, publié sur arXiv (2603.08961, version 2), conditionne une politique de maintien debout sur un contexte latent appris qui encode à la fois la configuration articulaire du haut du corps et les forces d'interaction aux deux mains. L'entraînement applique des forces 3D échantillonnées de façon isotrope sur chaque main, selon un curriculum de postures du haut du corps. Au déploiement, la force n'est pas mesurée : elle est reconstruite en ligne à partir des couples et états articulaires par dynamique inverse du corps rigide, sans capteur force/couple au poignet. Sur plus de 100 configurations du haut du corps soumises à des forces croissantes, FAME atteint 38,9 % de réussite avec une tolérance de 150 mm sur la position des mains. Les références plafonnent à 16,6 % (même force sans encodage), 4,3 % (politique à curriculum conditionnée par la pose) et 24,7 % (politique de locomotion entraînée de façon adverse). Le transfert est montré dans une cuisine simulée sous MuJoCo, puis sur un Unitree H1-2 grandeur nature avec des charges asymétriques et bimanuelles. Le code et les vidéos sont publiés.

Ce résultat s'attaque à un point faible de la manipulation humanoïde : la plupart des politiques de locomotion savent ne pas tomber, mais pas tenir une tâche pendant qu'on les pousse. Le critère de réussite est ici plus exigeant que le simple fait de rester debout, puisque le robot doit aussi garder les mains près de la cible. La politique adverse en est l'illustration : elle reste droite en faisant un pas, ce qui déplace les mains et fait échouer la tâche. Pour un intégrateur, le gain est double. Retirer les capteurs F/T de poignet réduit coût, masse et fragilité, et la dynamique inverse est déjà disponible sur les plateformes à retour de couple. Il faut toutefois relativiser : 38,9 % de réussite sur un balayage volontairement difficile de forces et de postures montre que l'enveloppe reste étroite, très loin d'un niveau de fiabilité industrielle. Les résultats sont aussi essentiellement obtenus en simulation, avec une démonstration matérielle qualitative sur le H1-2, sans taux de réussite chiffré sur robot réel.

Le travail s'inscrit dans la montée des politiques de contrôle du corps entier pour humanoïdes, où la manipulation avec charge reste moins mature que la marche ou la téléopération. Il se positionne face aux approches de robustesse par entraînement adverse et aux politiques conditionnées sur la seule pose, que les auteurs surclassent nettement dans leur protocole. Les acteurs commerciaux comme Figure, Tesla (Optimus) ou Agility misent sur des contrôleurs propriétaires dont les performances sous charge ne sont pas publiées, ce qui rend la comparaison impossible. Les prochaines étapes naturelles seraient d'intégrer ce contrôleur de stabilité sous une politique de manipulation de type VLA, de quantifier les résultats sur robot réel et d'élargir l'enveloppe au-delà de la posture debout, vers la marche chargée.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique
1arXiv cs.RO 

Adaptation cinématique basée sur la force et le couple pour les tâches de manipulation robotique

Publié sur arXiv le 21 août 2026 (arXiv:2608.21592v1), l'article présente une méthode d'adaptation cinématique en ligne pour la manipulation robotique en contact riche, où la relation entre les articulations d'un robot et l'outil qu'il tient change à chaque prise, parfois presque instantanément lors des changements de mode de contact, notamment pour les mains multi-doigts dont les points de contact ne sont pas fixés à l'avance. Les auteurs dérivent une loi de mise à jour dont la stabilité est démontrée mathématiquement: elle identifie la cinématique d'un outil inconnu à partir des seules mesures articulaires et d'un capteur de force/couple monté au poignet, sans aucune mesure extéroceptive de la pointe de l'outil, aussi bien en rigide qu'avec un contrôleur de compliance en boucle interne. L'identification ne porte que sur les directions excitées par le mouvement: la longueur d'un outil reste inobservable lors d'une insertion rigide en ligne droite, mais devient partiellement observable via le relâchement passif d'une boucle compliante. Une formulation alternative en programme quadratique reproduit le terme de prédiction de cette loi mais échoue à reproduire son terme de suivi. La validation reste, pour l'instant, une simulation d'insertion cheville-trou. Ce travail cible un verrou concret pour l'industrie: la plupart des systèmes de manipulation supposent une cinématique outil-effecteur fixe et connue, ce qui impose de recalibrer le robot à chaque changement d'outil ou de préhenseur, un frein à la polyvalence recherchée par les intégrateurs et les concepteurs de mains robotiques multi-doigts. En rendant l'estimation purement proprioceptive, sans caméra ni capteur tactile dédié, l'approche réduit l'instrumentation nécessaire pour des tâches de prise pleine main où les points de contact varient à chaque saisie. Elle s'inscrit aussi dans un débat plus large de la recherche en robotique: découpler l'apprentissage de la politique de tâche, par exemple via apprentissage par renforcement, de l'adaptation aux spécificités physiques d'un robot, d'une main ou d'un outil donné, dans l'idée de faciliter le transfert de politiques apprises vers d'autres configurations matérielles sans réentraînement complet. Les auteurs présentent ce travail comme une première étape d'un programme de recherche plus large, et non comme une solution aboutie: aucune validation sur robot physique n'est rapportée, seulement une simulation simple d'insertion, ce qui laisse ouverte la question du passage à l'échelle sur des prises complexes et sur du matériel réel. Le résumé public n'identifie ni laboratoire ni entreprise, et aucun lien n'est établi avec des plateformes commerciales comme Figure ou Tesla Optimus, ni avec des modèles vision-langage-action tels que Pi-0 ou GR00T N2. La démarche s'inscrit dans la lignée des recherches sur la manipulation dextre adaptative et l'estimation en ligne de paramètres physiques, un axe exploré en parallèle par plusieurs laboratoires de robotique pour réduire la dépendance des politiques de manipulation à une calibration extéroceptive précise.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
2arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
3arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle
4arXiv cs.RO 

AXIS : un moteur de données communautaire évolutif pour la manipulation robotique à grande échelle

Des chercheurs ont présenté AXIS, un moteur de données communautaire et évolutif pour l'apprentissage de la manipulation robotique, décrit dans un article déposé sur arXiv le 24 juillet 2026. Le système permet de collecter des démonstrations à grande échelle via téléopération directement dans le navigateur, sans matériel spécialisé ni opérateurs centralisés, et génère puis valide automatiquement de nouvelles tâches de manipulation. Un pipeline automatisé filtre la qualité des trajectoires, les lisse et applique des augmentations visuelles et physiques pour produire des données prêtes à l'entraînement. Le jeu de données AXIS compte actuellement 207 tâches diverses et plus de 50 000 trajectoires, organisées en "task snapshots" évalués selon un protocole strict à données retenues (held-out). Ce travail cible un goulot d'étranglement bien identifié du secteur : la difficulté à faire grandir les jeux de démonstrations utilisés pour entraîner les politiques vision-langage-action (VLA), jusqu'ici souvent limités par du matériel dédié ou des catalogues de tâches figés. Les auteurs montrent que le pré-entraînement continu sur AXIS améliore le taux de réussite global du modèle π0.5 de 5,8 points, et dépasse de 37,3 points un modèle pré-entraîné sur RoboCasa365, avec des gains qui s'accentuent à mesure que le volume de données augmente. Les progrès les plus nets apparaissent sous perturbations de disposition, de bruit capteur et de point de vue caméra, un signal utile pour les intégrateurs cherchant des politiques robustes hors laboratoire plutôt que de simples démonstrations réussies en conditions idéales. Le projet s'inscrit dans une tendance émergente consistant à traiter la collecte de données robotiques comme un problème d'échelle communautaire, à l'image de ce que le crowdsourcing a permis pour les grands modèles de langage. Il se positionne explicitement face à RoboCasa365, utilisé comme référence de comparaison, et s'appuie sur des politiques VLA existantes telles que π0.5 pour évaluer l'apport réel des données AXIS. Il s'agit à ce stade d'un article de recherche déposé en preprint, dont les résultats n'ont pas encore été validés par relecture par les pairs ni reproduits par des équipes tierces.

RecherchePaper
1 source