Aller au contenu principal
RecherchearXiv cs.RO 

ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ULTRA, un framework unifié pour le contrôle autonome de la loco-manipulation du corps entier chez les humanoïdes, publié en version révisée sur arXiv (2603.03279v2). Le système combine un algorithme de retargeting neuronal guidé par la physique, qui transpose des captures de mouvement à grande échelle vers la morphologie du robot en préservant la plausibilité physique des contacts, et un contrôleur multimodal unique traitant références denses et consignes de tâches éparses, à partir d'un état précis ou d'une vision égocentrique bruitée. La méthode distille une politique de suivi universelle, compresse les compétences motrices dans un espace latent compact, puis l'affine par apprentissage par renforcement pour améliorer la robustesse hors distribution. ULTRA a été validé en simulation et sur un robot humanoïde réel Unitree G1.

L'apport central est de faire passer le contrôle humanoïde du suivi de trajectoires prédéfinies à une génération de comportement pilotée par la perception et des objectifs de haut niveau, sans référence de mouvement au moment du test, un verrou connu du secteur qui tient à la rareté des données de retargeting et à la couverture limitée des répertoires de compétences. En obtenant un comportement coordonné du corps entier à partir d'une intention éparse et d'une perception embarquée seule, sur matériel réel et pas seulement en simulation, les auteurs apportent un élément factuel au débat sur l'écart entre démonstrations scriptées et autonomie réelle, avec des résultats supérieurs aux méthodes de suivi pur à répertoire limité, un signal utile pour intégrateurs et laboratoires.

Ce travail s'inscrit dans la lignée des contrôleurs de suivi par imitation pour humanoïdes, dont les limites sont pointées par les auteurs: données retargetées rares, difficulté à passer à l'échelle, dépendance à des références figées. ULTRA cherche à lever ce verrou en unifiant imitation à grande échelle et apprentissage par renforcement dans un seul contrôleur, validé sur Unitree G1, plateforme de recherche courante dans les laboratoires travaillant sur la loco-manipulation humanoïde. L'article ne précise ni affiliation institutionnelle ni calendrier de déploiement industriel: il s'agit d'une contribution de recherche, à comparer aux prochaines générations de contrôleurs généralistes pour humanoïdes plutôt qu'à un produit commercial.

Dans nos dossiers

À lire aussi

TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact
1arXiv cs.RO 

TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact

Cette étude, publiée sur arXiv en juillet 2026, présente TAC-LOCO, un cadre d'apprentissage par renforcement qui unifie pour la première fois le contrôle corporel complet d'un robot quadrupède doté d'un bras manipulateur en intégrant un retour tactile dans la boucle de commande. Le système encode les données d'un réseau de capteurs tactiles montés sur une pince compliante en une représentation latente compacte, fusionnée avec la proprioception du robot pour piloter simultanément les pattes, le bras et la pince. Les chercheurs ont déployé la politique sans réentraînement supplémentaire (zero-shot) sur un quadrupède Unitree Go2 équipé d'un bras Interbotix WidowX 250 et d'une pince tactile. Les résultats chiffrés sont précis : une réduction de 47% de la force de préhension appliquée et un taux de chute d'objet inférieur à 1%, y compris lors de changements de charge progressifs et de relâchements brusques. L'apport principal tient à ce que le système régule activement la force de préhension en fonction de l'interaction physique réelle, plutôt que de simplement serrer fermement l'objet comme le font la plupart des approches existantes en loco-manipulation dynamique. Pour l'industrie robotique, cela répond à une limite concrète des robots à pattes actuels : la capacité à transporter des charges tout en se déplaçant dynamiquement sans les endommager ni les laisser tomber, un enjeu direct pour la logistique, l'inspection industrielle ou les interventions en environnement non structuré. Ce résultat illustre aussi que l'intégration tactile n'est plus cantonnée aux tâches de manipulation statique en laboratoire, mais devient exploitable dans des scénarios de contrôle corporel complet à haute dynamique, un signal notable pour les intégrateurs qui évaluent la maturité des architectures VLA et RL appliquées à la robotique mobile. Le travail s'inscrit dans la continuité des recherches sur la loco-manipulation, un domaine où la coordination entre stabilité locomotrice et précision de manipulation reste un défi ouvert, généralement traité sans capteurs tactiles faute de méthodes robustes pour exploiter ce signal en temps réel. TAC-LOCO se positionne ainsi face aux approches de contrôle corporel complet sans tactile, en démontrant un gain mesurable sur la robustesse aux perturbations externes. La validation reste toutefois limitée à une plateforme de recherche (Go2 plus bras WidowX), sans indication de calendrier vers un déploiement industriel ou une plateforme commerciale.

RecherchePaper
1 source
M3-Tele : un cadre unifié de téléopération multimodale pour la manipulation mobile souple du corps entier
2arXiv cs.RO 

M3-Tele : un cadre unifié de téléopération multimodale pour la manipulation mobile souple du corps entier

Des chercheurs présentent M3-Tele, un framework unifié de téléopération multimodale conçu pour la manipulation mobile à corps entier avec conformité physique, décrit dans un article déposé sur arXiv (identifiant 2609.07859, version 2, publiée en tant que remplacement d'une version antérieure). Le système capture simultanément des observations visuelles, tactiles, de force et proprioceptives alignées pendant l'exécution de tâches à fort contact physique. Les expériences rapportées montrent que le contrôleur proposé réduit l'erreur de suivi de force de 4,132 N à 0,346 N, fait chuter les pertes de contact de 2,46 à 0,02 événement par essai, et diminue l'erreur de déformation tactile de 65 %. Des études utilisateurs menées sur quatre tâches de manipulation mobile ont également été conduites pour évaluer la fiabilité et l'ergonomie du système. Des expériences complémentaires avec une politique de diffusion (Diffusion Policy) ont par ailleurs été réalisées pour tester la valeur ajoutée du couplage entre détection tactile et détection de force. Ces résultats s'adressent directement à un problème connu dans la robotique de manipulation par apprentissage : la qualité des démonstrations collectées par téléopération conditionne directement la performance des politiques entraînées en aval. Les frameworks de téléopération existants négligent souvent l'articulation conjointe entre perception multimodale et coordination du corps entier, ce qui dégrade la richesse et la fiabilité des données de contact recueillies. En démontrant qu'une meilleure régulation de la conformité physique et de la coordination multimodale améliore mesurablement le suivi de force et réduit les pertes de contact, l'étude apporte un argument concret en faveur de pipelines de collecte de données plus rigoureux avant l'entraînement de politiques, un enjeu central pour les équipes qui développent des politiques de manipulation apprises par imitation pour des tâches industrielles à fort contact. Le travail s'inscrit dans un contexte de recherche où l'apprentissage de politiques par imitation, via des approches comme Diffusion Policy, dépend de plus en plus de la qualité des démonstrations humaines télé-opérées plutôt que de la seule quantité. Il ne s'agit pas d'un produit commercial ni d'un déploiement industriel, mais d'une contribution méthodologique testée en conditions expérimentales contrôlées, avec des utilisateurs humains évaluant le système sur des tâches définies en laboratoire. Le fait qu'il s'agisse d'une version 2 d'un article déjà soumis suggère une itération après retours, sans que les auteurs, l'institution ou une feuille de route de déploiement ne soient précisés dans le résumé disponible.

RecherchePaper
1 source
KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
3arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
4arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source