Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement
Un article de recherche publie sur arXiv (2609.21467v1) présente Distance-Conditioned Reference Recomposition (DCRR), une méthode pour entrainer des robots humanoïdes a la loco-manipulation d'objets a partir d'un seul clip de mouvement démontre. Les auteurs identifient un biais qu'ils nomment le "termination-versus-passage gap": une politique de suivi de mouvement entraînée sur une trajectoire fixe ne reproduit fidèlement que le point d'arrivée démontre, alors que la source visite déjà des positions intermédiaires de l'objet. DCRR déplace le segment de fin de démonstration vers ces états intermédiaires, les rejoue via un teacher de suivi fige, puis distille les résultats reetiquetes dans une politique sans référence. Sur quatre taches (porter, pousser au pied, pousser accroupi, trainer), DCRR-BC obtient une erreur moyenne normalisée de 0,15 contre 0,28 pour un clonage comportemental classique; un affinage par renforcement améliore ensuite la robustesse, confirmée sur robot physique.
Cette contribution s'attaque a une limite connue des pipelines d'imitation pour humanoïdes: une politique apprise par retargeting d'un mouvement humain unique reproduit généralement une seule démonstration figée, sans capacité a viser une distance de transport arbitraire a l'inférence. Pour un intégrateur industriel, déposer une caisse a 30 centimètres ou a 1,20 mètre exigerait normalement autant de démonstrations que de distances cibles. En montrant qu'un clip source unique, recompose puis redistribue, suffit a produire un comportement conditionne par la distance, l'étude réduit le besoin de collecte de données, un goulot d'étranglement reconnu face aux approches VLA gourmandes en téléopération. Elle rappelle aussi que le transfert simulation-vers-réel reste teste, non acquis: les auteurs vérifient d'abord la robustesse en sim-to-sim avant le matériel.
Il s'agit d'une publication de recherche (arXiv, catégorie "new"), sans robot ni entreprise identifies dans le résume: la méthode est validée en simulation puis sur du matériel générique, sans que la plateforme humanoïde soit précisée. Elle s'inscrit dans la lignée des travaux combinant retargeting de mouvement humain et apprentissage par renforcement pour la loco-manipulation, une famille distincte des modèles VLA comme Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus multi-taches plutôt que sur un clip unique. Aucun pilote industriel ni calendrier de déploiement n'est annonce: c'est un résultat méthodologique destine a de futures politiques de transport conditionne, pas un produit prêt a intégrer.
Dans nos dossiers




