Aller au contenu principal
AdaptManip : apprentissage du levage et de la livraison adaptatifs d'objets en corps entier, avec estimation d'état récurrente en ligne
RecherchearXiv cs.RO 

AdaptManip : apprentissage du levage et de la livraison adaptatifs d'objets en corps entier, avec estimation d'état récurrente en ligne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient AdaptManip, un cadre entièrement autonome qui permet à un robot humanoïde d'enchaîner navigation, saisie et livraison d'un objet, le tout appris par apprentissage par renforcement (RL) en simulation, sans démonstration humaine ni données de téléopération. Le système repose sur trois briques couplées. Un estimateur récurrent suit l'objet manipulé en temps réel malgré un champ de vision limité et des occlusions. Une politique de base corps entier assure une locomotion robuste, complétée par un contrôle de manipulation « résiduel » (une correction ajoutée à la politique de marche) pour soulever et livrer l'objet de façon stable. Enfin, un estimateur de position globale par LiDAR fournit une localisation peu sujette à la dérive. Tout est entraîné en simulation puis déployé sur matériel réel en zero-shot, sans réglage supplémentaire. Les auteurs affirment que la méthode surpasse nettement les approches de référence, dont celles par apprentissage par imitation, en adaptabilité et en taux de réussite global, et montrent une séquence complète autonome sur un humanoïde réel. L'article est une version révisée (v2) d'un dépôt arXiv de février 2026.

L'intérêt tient à la cible visée : la fragilité des politiques par imitation face aux perturbations. Ces approches dépendent de démonstrations coûteuses à collecter, et leur robustesse hors distribution reste leur point faible. Montrer qu'un pipeline purement RL, sans téléopération, peut transférer au réel une tâche mêlant locomotion et manipulation corps entier irait dans le sens d'une thèse défendue par une partie du secteur : le sim-to-real devient viable pour la loco-manipulation, et pas seulement pour la marche. Pour un intégrateur, le point le plus concret est l'estimateur d'état qui continue de suivre l'objet quand la caméra le perd de vue, un cas fréquent en logistique, où les bras et la charge masquent la scène. Les réserves restent classiques : il s'agit d'un résumé académique, sans charge utile, temps de cycle, taux de réussite chiffrés ni modèle d'humanoïde précisés, et rien n'indique la variété d'objets ou d'environnements testés.

Ce travail s'inscrit dans la course aux politiques corps entier pour humanoïdes. Elle oppose les approches de modèles vision-langage-action (VLA) entraînés sur des données de téléopération, comme celles de Figure (Helix) ou de Physical Intelligence (Pi-0), à des approches RL en simulation. AdaptManip se range dans la seconde famille, plus économe en données mais dépendante de la fidélité du simulateur. La suite logique serait une validation sur des charges et des objets plus variés, des mesures de cycle en conditions réelles, puis un test hors laboratoire. Aucun pilote industriel ni calendrier n'est annoncé : on reste au stade de la recherche.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne
1arXiv cs.RO 

MetaPusher : méta-apprentissage et planification pour la manipulation non préhensile d'objets inconnus avec adaptation rapide en ligne

Un article publié le 21 septembre 2026 sur arXiv (2609.21122) présente MetaPusher, un système de méta-apprentissage et de planification adaptative pour la manipulation non-préhensile (pousser, faire glisser sans saisir) d'objets jamais rencontrés par le robot. Un modèle dynamique méta-appris s'ajuste en quelques interactions pendant l'exécution de la tâche, tandis qu'un planificateur kinodynamique met à jour ses plans à long horizon en réutilisant son arbre de recherche existant plutôt qu'en repartant de zéro, sans phase de collecte de données dédiée à l'objet. Testé en simulation et en transfert simulation-vers-réel contre quatre méthodes de référence (fine-tuning, apprentissage actif, contrôle MPPI, politique de renforcement), MetaPusher réduit l'erreur de prédiction dynamique et améliore le taux de réussite des tâches jusqu'à 20 %. Les propriétés physiques d'un objet inconnu, comme sa friction ou la distribution de sa masse, ne se déduisent pas de la seule perception visuelle, ce qui limite les politiques de manipulation entraînées sur un catalogue fermé d'objets. Le problème pratique que cible ce travail est bien identifié par les intégrateurs : actualiser un modèle dynamique en cours de tâche invalide généralement la trajectoire déjà planifiée, forçant un choix entre geler le modèle au prix de la précision, ou replanifier entièrement au prix du temps de cycle. En couplant les deux, MetaPusher illustre une piste pour réduire, dans le tri ou la logistique industrielle, la dépendance à des bases d'objets préalablement appris. Ce travail s'inscrit dans une recherche plus large sur la réduction de l'écart entre simulation et réel sans réentraînement massif par objet. Plutôt que de se comparer à des systèmes commerciaux, l'équipe confronte sa méthode aux approches classiques de la littérature (fine-tuning, apprentissage actif, MPPI, apprentissage par renforcement), sur lesquelles elle affiche son gain de 20 % en réussite des tâches. Il s'agit à ce stade d'une contribution académique évaluée en simulation et sur des scénarios de transfert contrôlés, sans mention de déploiement industriel, de partenariat ni de calendrier au-delà de la publication.

RecherchePaper
1 source
Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet
2arXiv cs.RO 

Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet

Une équipe de recherche publie sur arXiv, le 16 septembre 2026 (arXiv:2609.16683), Weave, un framework pour apprendre à des robots humanoïdes la loco-manipulation dextre en corps entier à partir de démonstrations humaines capturées. Ces interactions humain-objet sont converties en références exécutables par le robot via un retargeting sensible aux contacts et une complétion du mouvement d'approche. Une politique consciente des contacts et de la géométrie commande ensuite simultanément 29 articulations corporelles et 12 articulations de doigts actionnées, sur plusieurs objets et séquences d'interaction. Sur neuf objets testés, le taux de réussite atteint 92,5 % pour les interactions entraînées et 65,0 % pour des séquences totalement inédites, sans entraînement supplémentaire. Les auteurs publient aussi environ 9 000 exécutions physiques réelles, soit près de 23 heures de trajectoires robot-objet annotées en contacts. Coordonner équilibre, locomotion et contact dextre des doigts reste l'un des obstacles majeurs pour faire passer les humanoïdes de la démonstration scriptée à la manipulation réelle d'objets variés, un enjeu direct pour les intégrateurs visant l'entrepôt ou l'usine. En retargetant des captures de mouvement humain vers l'embodiment du robot, Weave s'attaque frontalement au fossé entre démonstration et contrôle réel. Le score de 65 % sur des séquences jamais vues, même limité à neuf objets, suggère que la politique apprend des primitives de contact réutilisables plutôt que de simples trajectoires mémorisées, une distinction clé face aux démonstrations vidéo soigneusement sélectionnées courantes dans le secteur. Le jeu de données publié constitue par ailleurs une ressource comparable, dans son esprit, aux corpus servant à entraîner des modèles vision-langage-action comme Pi-0 ou GR00T N2. Il s'agit d'un travail de recherche en preprint, sans partenaire industriel ni plateforme robotique nommée dans le résumé, pas encore relu par les pairs : une démonstration de laboratoire, non un produit déployé ni un pilote commercial. Weave s'inscrit dans la vague de recherches sur l'apprentissage par imitation à partir de capture de mouvement humain, aux côtés d'initiatives comme Helix chez Figure ou les politiques de Physical Intelligence, qui visent toutes à résoudre le transfert humain-vers-robot pour la manipulation dextre. Aucun calendrier de déploiement n'est annoncé ; la suite logique, ouverte par la publication du jeu de données, est son adoption par d'autres équipes pour entraîner ou évaluer leurs propres politiques d'interaction, plutôt qu'un lancement produit à court terme.

RecherchePaper
1 source
Téléopération bilatérale du corps entier avec estimation multi-étapes des paramètres d'objets pour la locomanipulation humanoïde à roues
3arXiv cs.RO 

Téléopération bilatérale du corps entier avec estimation multi-étapes des paramètres d'objets pour la locomanipulation humanoïde à roues

Un article mis à jour sur arXiv (référence 2508.09846, version 2) décrit un système de téléopération bilatérale corps entier pour un robot humanoïde à roues effectuant des tâches de manipulation en mouvement. L'apport technique central est un module d'estimation en ligne, en plusieurs étapes, des paramètres inertiels de l'objet saisi (masse, centre de masse, inertie). Le pipeline enchaîne un estimateur de taille par vision, une estimation initiale générée par un grand modèle vision-langage (VLM), puis un raffinement par échantillonnage hiérarchique découplé en plusieurs hypothèses, conçu pour limiter l'impact d'une erreur du VLM. Ce module tourne en parallèle d'une simulation haute-fidélité et du matériel réel, avec mise à jour en temps réel du point d'équilibre du robot. Les auteurs valident l'approche sur un prototype maison équipé d'une pince robotique et d'une interface homme-machine, démontrant en temps réel des tâches de levage, transport et dépose d'une charge représentant environ un tiers du poids corporel du robot. Pour l'industrie robotique, ce travail cible un verrou concret de la téléopération à retour haptique : sans connaissance des propriétés physiques de l'objet manipulé, le retour de force transmis à l'opérateur reste imprécis, ce qui brise la dynamique du contrôle corps entier. Combiner vision et VLM pour réduire l'espace de recherche avant d'affiner par échantillonnage accélérerait, selon les auteurs, l'estimation par rapport à des méthodes purement stochastiques ; l'abstract ne fournit toutefois aucun temps de cycle chiffré ni comparaison directe, ce qui invite à la prudence sur l'ampleur réelle du gain. L'intérêt pour les intégrateurs est de voir les VLM utilisés non pas pour générer des politiques d'action autonomes à la manière des approches VLA, mais comme prior physique exploitable en téléopération, une piste intermédiaire entre autonomie complète et contrôle humain pur. Cette publication s'inscrit dans la recherche sur la téléopération bilatérale de robots humanoïdes, où l'estimation dynamique des objets manipulés reste un problème ouvert. Elle se distingue des approches commerciales dominantes de robots humanoïdes bipèdes visant l'autonomie complète via des modèles VLA génératifs, en misant plutôt sur une plateforme à roues pilotée par un opérateur humain en boucle, un choix qui privilégie stabilité et charge utile relative. L'article ne précise ni institution porteuse ni calendrier de commercialisation : il s'agit d'une démonstration de faisabilité en laboratoire, sans pilote industriel ni partenaire annoncé à ce stade.

RecherchePaper
1 source
Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède
4arXiv cs.RO 

Apprentissage de la loco-manipulation globale du corps entier avec un manipulateur mobile bipède

Des chercheurs publient sur arXiv (référence 2609.18930v1, septembre 2026) un contrôleur unifié de corps entier pour un robot bipède manipulateur mobile, entraîné par apprentissage par renforcement. Le système prend en entrée une seule cible d'effecteur terminal en 6 degrés de liberté (position et orientation) et produit directement les actions coordonnées de la base bipède et du bras, sans qu'aucune commande explicite de vitesse de base ou de placement de pas ne soit fournie séparément. L'entraînement repose sur une stratégie de "reward-gating" qui arbitre dynamiquement entre suivi de trajectoire de l'effecteur, locomotion et maintien de l'équilibre. Un module d'estimation de contexte temporel, combinant un encodeur Transformer à fenêtre glissante, une mémoire récurrente GRU et une prédiction auxiliaire de dynamique, extrait des informations pertinentes de l'historique d'observation pour affiner le contrôle. Sur robot réel, les auteurs montrent que ce même contrôleur exécute des tâches d'atteinte, d'adaptation posturale et de pas sous trois types de commandes différentes : téléopération en réalité virtuelle, une politique de diffusion apprise, et des trajectoires scriptées. L'intérêt pour l'industrie robotique tient à la simplification de l'architecture de contrôle: au lieu de piloter séparément la locomotion et la manipulation, ou de dépendre de commandes de pas explicites, une seule interface d'effecteur terminal suffit à coordonner l'ensemble du corps. Cela facilite en théorie le branchement de politiques de haut niveau (VLA, diffusion, téléopération) sur un même contrôleur bas niveau, sans réentraînement spécifique à chaque source de commande. C'est un signal pertinent pour les équipes qui travaillent sur l'intégration de piles de manipulation sur plateformes humanoïdes ou bipèdes mobiles, dans la lignée des efforts sectoriels pour découpler la couche de décision de la couche de contrôle moteur. Le travail s'inscrit dans la recherche académique sur la loco-manipulation bipède, un problème identifié de longue date car il étend la portée effective des bras au-delà de leur espace de travail nominal en mobilisant les jambes. L'abstract ne précise ni l'identité des auteurs, ni la plateforme robotique utilisée, ni un calendrier de déploiement commercial: il s'agit d'un preprint de recherche avec validation expérimentale en laboratoire, pas d'un produit ou d'un pilote industriel annoncé.

RecherchePaper
1 source