
FAME : RL adaptatif à la force pour élargir l'enveloppe de manipulation d'un robot humanoïde grandeur nature
Des chercheurs du laboratoire CORRELL proposent FAME, un cadre d'apprentissage par renforcement qui permet à un humanoïde grandeur nature de rester stable lorsqu'il subit des forces aux mains pendant une manipulation bimanuelle. Le travail, publié sur arXiv (2603.08961, version 2), conditionne une politique de maintien debout sur un contexte latent appris qui encode à la fois la configuration articulaire du haut du corps et les forces d'interaction aux deux mains. L'entraînement applique des forces 3D échantillonnées de façon isotrope sur chaque main, selon un curriculum de postures du haut du corps. Au déploiement, la force n'est pas mesurée : elle est reconstruite en ligne à partir des couples et états articulaires par dynamique inverse du corps rigide, sans capteur force/couple au poignet. Sur plus de 100 configurations du haut du corps soumises à des forces croissantes, FAME atteint 38,9 % de réussite avec une tolérance de 150 mm sur la position des mains. Les références plafonnent à 16,6 % (même force sans encodage), 4,3 % (politique à curriculum conditionnée par la pose) et 24,7 % (politique de locomotion entraînée de façon adverse). Le transfert est montré dans une cuisine simulée sous MuJoCo, puis sur un Unitree H1-2 grandeur nature avec des charges asymétriques et bimanuelles. Le code et les vidéos sont publiés.
Ce résultat s'attaque à un point faible de la manipulation humanoïde : la plupart des politiques de locomotion savent ne pas tomber, mais pas tenir une tâche pendant qu'on les pousse. Le critère de réussite est ici plus exigeant que le simple fait de rester debout, puisque le robot doit aussi garder les mains près de la cible. La politique adverse en est l'illustration : elle reste droite en faisant un pas, ce qui déplace les mains et fait échouer la tâche. Pour un intégrateur, le gain est double. Retirer les capteurs F/T de poignet réduit coût, masse et fragilité, et la dynamique inverse est déjà disponible sur les plateformes à retour de couple. Il faut toutefois relativiser : 38,9 % de réussite sur un balayage volontairement difficile de forces et de postures montre que l'enveloppe reste étroite, très loin d'un niveau de fiabilité industrielle. Les résultats sont aussi essentiellement obtenus en simulation, avec une démonstration matérielle qualitative sur le H1-2, sans taux de réussite chiffré sur robot réel.
Le travail s'inscrit dans la montée des politiques de contrôle du corps entier pour humanoïdes, où la manipulation avec charge reste moins mature que la marche ou la téléopération. Il se positionne face aux approches de robustesse par entraînement adverse et aux politiques conditionnées sur la seule pose, que les auteurs surclassent nettement dans leur protocole. Les acteurs commerciaux comme Figure, Tesla (Optimus) ou Agility misent sur des contrôleurs propriétaires dont les performances sous charge ne sont pas publiées, ce qui rend la comparaison impossible. Les prochaines étapes naturelles seraient d'intégrer ce contrôleur de stabilité sous une politique de manipulation de type VLA, de quantifier les résultats sur robot réel et d'élargir l'enveloppe au-delà de la posture debout, vers la marche chargée.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




