Aller au contenu principal
Sumo : la loco-manipulation dynamique et généralisable du corps entier
RecherchearXiv cs.RO 

Sumo : la loco-manipulation dynamique et généralisable du corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un institut de recherche a publié via arXiv (article 2604.08508, troisième révision) un travail intitulé "Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation", mené sur les serveurs du RAI Institute (ex-Boston Dynamics AI Institute, hébergé sur rai-inst.com). La méthode combine sim-to-real et pilotage en temps réel: une politique de contrôle corps entier pré-entraînée est guidée au moment de l'exécution par un planificateur basé sur l'échantillonnage, sans réentraînement supplémentaire. Les chercheurs ont testé l'approche sur un robot quadrupède Spot (Boston Dynamics) dans le monde réel, avec deux tâches marquantes: redresser un pneu plus lourd que la capacité de levage nominale du robot, et traîner une barrière anti-émeute plus grande et plus haute que l'engin lui-même. Le système s'est aussi montré capable de généraliser à une variété d'objets et de tâches sans réglage additionnel, la fonction de coût pouvant être ajustée à la volée. En simulation uniquement, les auteurs étendent la méthode à un humanoïde pour ouvrir une porte et pousser une table. Code et vidéos sont publiés sur sumo.rai-inst.com.

L'intérêt principal tient à la généralisation obtenue sans réentraînement par objet: une seule politique, pilotée différemment selon le contexte, remplace la logique habituelle d'entraînement dédié à chaque tâche de manipulation. Pour les intégrateurs et les équipes de R&D en robotique mobile, cela suggère une voie pour dépasser les limites de charge utile nominale annoncées par les constructeurs, un enjeu concret en logistique, chantier ou intervention d'urgence où les objets à déplacer dépassent souvent les specs du robot. Il faut toutefois noter que les résultats humanoïdes ne sont validés qu'en simulation, sans transfert réel démontré, et qu'aucun chiffre précis de masse, de temps de cycle ou de taux de réussite n'est communiqué dans le résumé, ce qui invite à la prudence avant de parler de percée généralisée.

Le RAI Institute a été fondé par Marc Raibert, également fondateur de Boston Dynamics, comme structure de recherche indépendante à but non lucratif détachée de la feuille de route produit de Boston Dynamics. Spot reste la plateforme quadrupède commerciale de Boston Dynamics, ici réutilisée comme banc d'essai académique plutôt que comme produit vendu. Ce travail se distingue des approches dominantes du moment fondées sur des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, en misant sur la planification par échantillonnage plutôt que sur un grand modèle appris de bout en bout. Les prochaines étapes attendues concernent la validation réelle du volet humanoïde, actuellement cantonné à la simulation.

À lire aussi

HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral
1arXiv cs.RO 

HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral

Une équipe de recherche a publié le 18 août 2026 sur arXiv (arXiv:2608.16837v1) HAF (Humanoid Adaptation Framework), un système en deux modules destiné à adapter des modèles génératifs vision-langage-action (VLA) déjà entraînés au pilotage complet d'un robot humanoïde, locomotion, posture du buste et manipulation bimanuelle comprises. Le premier module, HAF-VLA, s'appuie sur un modèle VLA pré-entraîné à flow-matching et découpe le débruitage de l'action corps entier en trois étapes successives, reliées par des caches clé-valeur qui préservent les dépendances cinématiques entre les segments du corps, là où une génération en un seul bloc produit des mouvements incohérents. Par-dessus ce module gelé, HAF-Steer applique un apprentissage par renforcement hors ligne puis en ligne: il exploite l'inversibilité du flow-matching et une réduction de dimension par transformée en cosinus discrète pour confiner l'optimisation à un sous-espace de bruit compact, avant d'entraîner une politique SAC régularisée. Testé sur sept tâches réelles de loco-manipulation humanoïde, HAF dépasse les architectures VLA à étage unique classiques en coordination corps entier, avec un site de démonstration à grange007.github.io/HAF. L'enjeu dépasse la prouesse technique: les VLA généralistes, entraînés surtout sur des bras fixes ou mobiles, butent sur la haute dimensionnalité et l'interdépendance des mouvements dès qu'il s'agit de piloter un corps humanoïde entier. En évitant de réentraîner l'intégralité du gros modèle VLA, HAF réduit le coût de calcul et le risque de l'exploration en ligne sur un robot réel, un point sensible pour tout intégrateur visant un déploiement en usine ou en environnement humain. Les résultats, obtenus sur seulement sept tâches en conditions de laboratoire, restent toutefois un signal de faisabilité plutôt qu'une preuve de généralisation à grande échelle. Ce travail s'inscrit dans la lignée des modèles VLA à flow-matching type Pi-0, GR00T N2 ou Helix, conçus d'abord pour des bras ou robots à roues plutôt que pour la bipédie complète, et plusieurs laboratoires cherchent en parallèle à combler cet écart. HAF reste à ce stade une contribution académique assortie d'un site de démonstration, sans partenaire industriel ni calendrier de déploiement annoncé; la suite attendue est la publication du code et des poids, puis une validation sur davantage de plateformes avant toute reprise par des acteurs commerciaux.

RechercheOpinion
1 source
HumanoidMimicGen : génération de données pour la loco-manipulation par planification corps entier
2arXiv cs.RO 

HumanoidMimicGen : génération de données pour la loco-manipulation par planification corps entier

Des chercheurs ont présenté HumanoidMimicGen (arXiv:2605.27724), une méthode de génération automatique de données d'apprentissage par imitation pour robots humanoïdes devant à la fois marcher et manipuler des objets. Le problème central: la téléopération pour collecter ces démonstrations est lente et coûteuse, particulièrement difficile pour des humanoïdes dont l'espace d'action composite intègre bras, jambes et torse simultanément. Le système adapte des compétences corps entier riches en contacts à partir d'un petit nombre de démonstrations sources vers de nouveaux états et configurations d'objets, en combinant planification de la locomotion et de la manipulation à un ou deux bras. Un benchmark de simulation en 9 tâches de loco-manipulation valide l'approche: les politiques visuomotrices co-entraînées avec les données générées surpassent de 20% celles entraînées uniquement sur des données réelles. La rareté des données d'entraînement reste le principal verrou au déploiement des humanoïdes en contexte industriel. Les méthodes existantes de génération de données, conçues pour bras fixes, échouent sur les humanoïdes en raison de la coordination complexe entre locomotion et manipulation dans un espace d'état de haute dimension. HumanoidMimicGen apporte un argument concret: multiplier automatiquement les démonstrations à partir de quelques exemples et gagner 20% sur les politiques apprises conteste directement l'hypothèse que les humanoïdes nécessitent obligatoirement des milliers d'heures de téléopération. Pour les décideurs industriels et les intégrateurs, c'est un signal que le goulot des données pourrait être levé par simulation, compressant potentiellement les cycles de développement. HumanoidMimicGen prolonge directement MimicGen, publié en 2023 pour des bras manipulateurs à base fixe. L'extension aux humanoïdes répond à la pression commerciale entre Figure (modèles 01, 02), Agility Robotics (Digit), 1X, Unitree (G1, H1) et Boston Dynamics (Atlas), tous en quête de méthodes d'apprentissage scalables sans exploser les budgets de téléopération. Du côté recherche, Physical Intelligence (pi0) et NVIDIA (GR00T N2) travaillent également sur des politiques visuomotrices corps entier généralisables. Ce travail demeure un résultat académique pré-publication sur arXiv, sans déploiement industriel annoncé et avec des expériences exclusivement en simulation. La robustesse du transfert sim-to-real, non abordée dans ce papier, constituera l'étape critique avant tout passage en conditions réelles.

RecherchePaper
1 source
TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact
3arXiv cs.RO 

TAC-LOCO : contrôle unifié du corps entier pour la loco-manipulation quadrupède guidée par le tact

Cette étude, publiée sur arXiv en juillet 2026, présente TAC-LOCO, un cadre d'apprentissage par renforcement qui unifie pour la première fois le contrôle corporel complet d'un robot quadrupède doté d'un bras manipulateur en intégrant un retour tactile dans la boucle de commande. Le système encode les données d'un réseau de capteurs tactiles montés sur une pince compliante en une représentation latente compacte, fusionnée avec la proprioception du robot pour piloter simultanément les pattes, le bras et la pince. Les chercheurs ont déployé la politique sans réentraînement supplémentaire (zero-shot) sur un quadrupède Unitree Go2 équipé d'un bras Interbotix WidowX 250 et d'une pince tactile. Les résultats chiffrés sont précis : une réduction de 47% de la force de préhension appliquée et un taux de chute d'objet inférieur à 1%, y compris lors de changements de charge progressifs et de relâchements brusques. L'apport principal tient à ce que le système régule activement la force de préhension en fonction de l'interaction physique réelle, plutôt que de simplement serrer fermement l'objet comme le font la plupart des approches existantes en loco-manipulation dynamique. Pour l'industrie robotique, cela répond à une limite concrète des robots à pattes actuels : la capacité à transporter des charges tout en se déplaçant dynamiquement sans les endommager ni les laisser tomber, un enjeu direct pour la logistique, l'inspection industrielle ou les interventions en environnement non structuré. Ce résultat illustre aussi que l'intégration tactile n'est plus cantonnée aux tâches de manipulation statique en laboratoire, mais devient exploitable dans des scénarios de contrôle corporel complet à haute dynamique, un signal notable pour les intégrateurs qui évaluent la maturité des architectures VLA et RL appliquées à la robotique mobile. Le travail s'inscrit dans la continuité des recherches sur la loco-manipulation, un domaine où la coordination entre stabilité locomotrice et précision de manipulation reste un défi ouvert, généralement traité sans capteurs tactiles faute de méthodes robustes pour exploiter ce signal en temps réel. TAC-LOCO se positionne ainsi face aux approches de contrôle corporel complet sans tactile, en démontrant un gain mesurable sur la robustesse aux perturbations externes. La validation reste toutefois limitée à une plateforme de recherche (Go2 plus bras WidowX), sans indication de calendrier vers un déploiement industriel ou une plateforme commerciale.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
4arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source