Aller au contenu principal
WB-WAM : pré-entraînement hétérogène corps-main pour la locomanipulation humanoïde
RecherchearXiv cs.RO 

WB-WAM : pré-entraînement hétérogène corps-main pour la locomanipulation humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient WB-WAM, un « World Action Model » (modèle qui prédit conjointement la vidéo future et les actions) conçu pour la manipulation mobile des humanoïdes (loco-manipulation). Il apprend à partir de 1 880,2 heures de vidéos et de données de mouvement annotées de façon partielle. Un espace d'action physique commun fusionne des annotations hétérogènes : articulations du corps, déplacement de la base (root) et doigts de la main dextre. Les priors ainsi obtenus sont affinés par une étape intermédiaire baptisée PICO, puis adaptés aux tâches robotiques avec une supervision auxiliaire par cinématique directe. Les auteurs ont construit WB-Datasets, qui combine démonstrations humaines égocentriques retargetées sur le robot et trajectoires robotiques. En simulation, le modèle atteint 81,9 % de réussite sur HumanoidArena. En conditions réelles, il affiche 84,0 % de succès moyen sur cinq tâches. L'article ne précise ni le robot utilisé, ni le nombre d'essais par tâche, ni les modèles de référence comparés dans ces chiffres.

Le point central tient à la donnée. Les corpus de pré-entraînement robotique couvrent mal les mouvements du corps entier, alors que les humanoïdes doivent coordonner jambes, torse, bras et mains dans une même tâche. WB-WAM suggère qu'on peut combler ce manque en réutilisant des démonstrations humaines égocentriques, plus faciles à collecter que la téléopération sur robot. Les auteurs affirment que la mi-formation PICO alignée sur la tâche améliore les performances et réduit le nombre de démonstrations réelles nécessaires. Pour un intégrateur, c'est un levier de coût : le goulot d'étranglement actuel est le volume de données robot, pas l'architecture. À nuancer : 84 % de réussite sur cinq tâches reste un chiffre de laboratoire, sans information sur la durée de cycle, la robustesse hors distribution ou la fiabilité sur de longues périodes, qui comptent pour un déploiement industriel. Le résultat soutient la voie des modèles vidéo-action, sans prouver qu'elle passe à l'échelle en production.

Ce travail s'inscrit dans la montée des modèles d'action fondés sur la vidéo générative, en parallèle des VLA (vision-langage-action) comme Pi-0, GR00T ou Helix. Ces derniers se concentrent souvent sur la manipulation à bras fixes ou semi-mobile, tandis que WB-WAM vise le corps entier, mains dextres comprises. Les acteurs de l'humanoïde industriel (Figure, Tesla avec Optimus, Agility, ainsi que les acteurs européens comme Wandercraft ou Enchanted Tools) font face au même problème de données, ce qui rend les approches de transfert depuis l'humain stratégiques. Il s'agit ici d'une prépublication arXiv (version 2), sans produit ni pilote annoncé. La suite à surveiller : la publication du code et des jeux de données WB-Datasets, la reproduction par d'autres équipes, et la validation sur des tâches plus longues et plus variées.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
1arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier
2arXiv cs.RO 

ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier

Une équipe de recherche présente ULTRA, un framework unifié pour le contrôle autonome de la loco-manipulation du corps entier chez les humanoïdes, publié en version révisée sur arXiv (2603.03279v2). Le système combine un algorithme de retargeting neuronal guidé par la physique, qui transpose des captures de mouvement à grande échelle vers la morphologie du robot en préservant la plausibilité physique des contacts, et un contrôleur multimodal unique traitant références denses et consignes de tâches éparses, à partir d'un état précis ou d'une vision égocentrique bruitée. La méthode distille une politique de suivi universelle, compresse les compétences motrices dans un espace latent compact, puis l'affine par apprentissage par renforcement pour améliorer la robustesse hors distribution. ULTRA a été validé en simulation et sur un robot humanoïde réel Unitree G1. L'apport central est de faire passer le contrôle humanoïde du suivi de trajectoires prédéfinies à une génération de comportement pilotée par la perception et des objectifs de haut niveau, sans référence de mouvement au moment du test, un verrou connu du secteur qui tient à la rareté des données de retargeting et à la couverture limitée des répertoires de compétences. En obtenant un comportement coordonné du corps entier à partir d'une intention éparse et d'une perception embarquée seule, sur matériel réel et pas seulement en simulation, les auteurs apportent un élément factuel au débat sur l'écart entre démonstrations scriptées et autonomie réelle, avec des résultats supérieurs aux méthodes de suivi pur à répertoire limité, un signal utile pour intégrateurs et laboratoires. Ce travail s'inscrit dans la lignée des contrôleurs de suivi par imitation pour humanoïdes, dont les limites sont pointées par les auteurs: données retargetées rares, difficulté à passer à l'échelle, dépendance à des références figées. ULTRA cherche à lever ce verrou en unifiant imitation à grande échelle et apprentissage par renforcement dans un seul contrôleur, validé sur Unitree G1, plateforme de recherche courante dans les laboratoires travaillant sur la loco-manipulation humanoïde. L'article ne précise ni affiliation institutionnelle ni calendrier de déploiement industriel: il s'agit d'une contribution de recherche, à comparer aux prochaines générations de contrôleurs généralistes pour humanoïdes plutôt qu'à un produit commercial.

RecherchePaper
1 source
HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde
3arXiv cs.RO 

HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde

Le laboratoire ICON Lab, associé à Negar Mehr et présenté sur iconlab.negarmehr.com, publie sur arXiv (2609.30594) une méthode nommée HuGo, pour Humanoid policy code Generation. Un grand modèle de langage y génère, à partir d'une description de tâche, du code exécutable en boucle fermée qui pilote un humanoïde au-dessus d'une politique de contrôle corps entier bas niveau laissée figée. Ce code est ensuite affiné automatiquement grâce aux trajectoires numériques et à des images vidéo sélectionnées des essais, sans récompense ni démonstration spécifiques à la tâche. Sur cinq tâches de loco-manipulation simulées et deux politiques bas niveau, HuGo dépasse nettement une base d'apprentissage par renforcement et se rapproche d'une base fondée sur des démonstrations ; un transfert zero-shot vers du matériel réel est également rapporté, amélioré par la même boucle d'affinement appliquée aux essais réels, sans démonstration experte ni réentraînement. Ce travail cible un goulot d'étranglement connu de la robotique humanoïde : produire une politique de loco-manipulation par tâche exige aujourd'hui une ingénierie de récompense coûteuse ou la collecte de démonstrations suivie d'un entraînement dédié, deux voies difficiles à faire passer à l'échelle. En déplaçant la logique de tâche vers du code généré par un LLM plutôt que vers des poids appris, HuGo se positionne comme une alternative aux modèles vision-langage-action tels que Pi-0, GR00T N2 ou Helix, qui reposent sur de vastes jeux de démonstrations pour entraîner des politiques bout en bout. Si l'approche se confirme à plus grande échelle, elle ouvrirait une voie moins gourmande en données pour ajouter des tâches à un humanoïde déjà déployé, un enjeu que suivent de près les intégrateurs. Le périmètre testé, cinq tâches simulées, reste restreint et appelle vérification sur des benchmarks plus larges. Cette publication s'inscrit dans une lignée de recherches sur le contrôle hiérarchique, où une couche bas niveau entraînée une fois reste figée pendant qu'une couche supérieure générée par LLM pilote la tâche. Il s'agit pour l'instant d'un preprint arXiv classé comme nouvelle soumission, sans robot ni entreprise commerciale nommés ni pilote industriel annoncé. Les auteurs renvoient vers le site du projet, iconlab.negarmehr.com/HuGo, pour les démonstrations, sans calendrier pour une extension à davantage de tâches ou de plateformes.

RecherchePaper
1 source
Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique
4arXiv cs.RO 

Transfert pré-entraînement tactile transférable centré sur l'humain pour la manipulation robotique dextérique

Les auteurs de cette étude publient H-Tac, un jeu de données tactile-action à grande échelle constitué de 160 heures de vidéos humaines à la première personne, couvrant plus de 300 tâches et totalisant 135 000 épisodes. À partir de cette base, ils proposent Transferable Tactile Pre-Training (TTP), un système de pré-entraînement fondé sur le sens tactile humain, destiné à transférer des compétences de manipulation fine vers des robots. La méthode s'appuie sur des espaces tactiles et d'action unifiés, maintenus identiques pendant les phases de pré-entraînement et de post-entraînement, afin de préserver les connaissances acquises lors du passage de l'humain au robot. Un module expert dédié prédit l'évolution future du signal tactile, ce qui permet de modéliser explicitement la dynamique de contact et les interactions physiques fines. Les auteurs rapportent des performances supérieures aux approches existantes, en simulation comme sur robots réels, avec une bonne capacité de généralisation. Ce travail cible un verrou connu du secteur robotique: le toucher reste la modalité la moins exploitée dans les modèles Vision-Language-Action, alors qu'il est indispensable pour les tâches riches en contact où la vision seule ne suffit pas à estimer une force appliquée. Les jeux de données tactiles existants restent petits et couvrent peu de types de contacts, ce qui limite le plafond de performance des modèles VLA tactiles, dont le post-entraînement reste largement indifférent à la dynamique physique. En s'appuyant sur des vidéos humaines plutôt que sur de la téléopération robotique coûteuse à collecter, H-Tac vise à lever ce goulot d'étranglement de données, une stratégie déjà explorée pour le pré-entraînement d'actions mais rarement appliquée au tactile à cette échelle. Si les résultats se confirment sur d'autres plateformes, cela pourrait rapprocher les robots manipulateurs dextres de tâches fines comme l'insertion de précision ou la manipulation d'objets déformables, au-delà des démonstrations scénarisées. L'article s'inscrit dans la lignée des modèles VLA récents (Pi-0, GR00T N2, Helix) qui combinent perception visuelle et langage mais négligent généralement le retour tactile faute de données adaptées. Publié sur arXiv (2607.01067v1) début juillet 2026, ce travail reste au stade de la recherche académique: aucun partenariat industriel ni déploiement commercial n'est mentionné, et les auteurs présentent TTP comme une preuve de concept ouvrant la voie à un pré-entraînement tactile transférable et passant à l'échelle, plutôt que comme un produit prêt à l'emploi.

RecherchePaper
1 source