
AdaptManip : apprentissage du levage et de la livraison adaptatifs d'objets en corps entier, avec estimation d'état récurrente en ligne
Des chercheurs publient AdaptManip, un cadre entièrement autonome qui permet à un robot humanoïde d'enchaîner navigation, saisie et livraison d'un objet, le tout appris par apprentissage par renforcement (RL) en simulation, sans démonstration humaine ni données de téléopération. Le système repose sur trois briques couplées. Un estimateur récurrent suit l'objet manipulé en temps réel malgré un champ de vision limité et des occlusions. Une politique de base corps entier assure une locomotion robuste, complétée par un contrôle de manipulation « résiduel » (une correction ajoutée à la politique de marche) pour soulever et livrer l'objet de façon stable. Enfin, un estimateur de position globale par LiDAR fournit une localisation peu sujette à la dérive. Tout est entraîné en simulation puis déployé sur matériel réel en zero-shot, sans réglage supplémentaire. Les auteurs affirment que la méthode surpasse nettement les approches de référence, dont celles par apprentissage par imitation, en adaptabilité et en taux de réussite global, et montrent une séquence complète autonome sur un humanoïde réel. L'article est une version révisée (v2) d'un dépôt arXiv de février 2026.
L'intérêt tient à la cible visée : la fragilité des politiques par imitation face aux perturbations. Ces approches dépendent de démonstrations coûteuses à collecter, et leur robustesse hors distribution reste leur point faible. Montrer qu'un pipeline purement RL, sans téléopération, peut transférer au réel une tâche mêlant locomotion et manipulation corps entier irait dans le sens d'une thèse défendue par une partie du secteur : le sim-to-real devient viable pour la loco-manipulation, et pas seulement pour la marche. Pour un intégrateur, le point le plus concret est l'estimateur d'état qui continue de suivre l'objet quand la caméra le perd de vue, un cas fréquent en logistique, où les bras et la charge masquent la scène. Les réserves restent classiques : il s'agit d'un résumé académique, sans charge utile, temps de cycle, taux de réussite chiffrés ni modèle d'humanoïde précisés, et rien n'indique la variété d'objets ou d'environnements testés.
Ce travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Elle oppose les approches de modèles vision-langage-action (VLA) entraînés sur des données de téléopération, comme celles de Figure (Helix) ou de Physical Intelligence (Pi-0), à des approches RL en simulation. AdaptManip se range dans la seconde famille, plus économe en données mais dépendante de la fidélité du simulateur. La suite logique serait une validation sur des charges et des objets plus variés, des mesures de cycle en conditions réelles, puis un test hors laboratoire. Aucun pilote industriel ni calendrier n'est annoncé : on reste au stade de la recherche.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




