Aller au contenu principal
RecherchearXiv cs.RO 

Vers un modèle généraliste de locomanipulation humanoïde par préentraînement sur des données humaines égocentriques du corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient λ0, une politique vision-langage-action (VLA) pour humanoïde qui pilote l'ensemble du corps, c'est-à-dire la locomotion, la posture, la manipulation à deux mains et les mouvements de doigts. Le travail repose sur HumanVerse-500, un jeu de données de 500 heures de comportements humains de locomanipulation en environnements ouverts. Il a été collecté avec un système portable léger qui synchronise la vidéo égocentrique avec les mouvements du corps et des mains. L'entraînement se fait en trois étapes. La première apprend l'interaction à partir de jeux de données égocentriques variés. La deuxième coordonne corps et mains grâce à HumanVerse-500. La troisième adapte la politique à des tâches et à des robots précis. λ0 apprend un espace de représentation commun pour transférer l'expérience humaine, tandis que des interfaces propres à chaque domaine gèrent les écarts entre états et actions de l'humain et du robot. L'évaluation porte sur le benchmark SIMPLE et sur quatre tâches réelles de locomanipulation. Les auteurs revendiquent des performances « état de l'art » et analysent aussi le comportement à l'échelle, la généralisation et l'apport de chaque étape. Ils annoncent la publication du code, des modèles et des données. L'article précise toutefois ni le robot utilisé, ni les taux de réussite, ni les concurrents comparés.

L'enjeu est le coût de la donnée. Les vidéos égocentriques sont abondantes mais couvrent mal le mouvement du corps entier et sa coordination avec la manipulation. La téléopération d'humanoïdes produit la bonne donnée, mais elle est chère et difficile à passer à l'échelle. Cette étude teste une voie médiane : capter des humains équipés de capteurs légers, puis transférer vers le robot. Si les résultats tiennent, la collecte de démonstrations par téléopération deviendrait moins déterminante, et la capacité à capter du mouvement humain en conditions réelles le deviendrait davantage. Pour un intégrateur, cela pourrait réduire le coût d'adaptation à une nouvelle tâche ou à un nouveau robot, ce que la troisième étape cherche à démontrer. Il faut rester prudent : quatre tâches réelles, sans taux de réussite publiés dans le résumé, restent une base étroite. Le « état de l'art » dépend entièrement des références choisies. L'écart entre démonstration de laboratoire et déploiement industriel n'est pas traité ici.

Ce travail s'inscrit dans le mouvement des modèles fondation pour humanoïdes. Les VLA de type Pi-0, GR00T ou Helix ont d'abord ciblé des bras et des mains, avant de s'étendre au corps entier. En parallèle, le pré-entraînement sur vidéo humaine devient une piste majeure pour contourner la rareté des données robotiques. Les acteurs industriels qui ont leurs propres flottes de téléopération, comme Tesla, Figure ou Agility, ont un avantage en données propriétaires, que des corpus ouverts comme HumanVerse-500 pourraient réduire pour les laboratoires académiques et les petites équipes, y compris en Europe. La suite dépend de la publication effective du code, des modèles et des données, puis de reproductions indépendantes sur d'autres plateformes. Ce sont elles qui diront si le transfert humain vers robot résiste hors du cadre des auteurs.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain
1arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source
WB-WAM : pré-entraînement hétérogène corps-main pour la locomanipulation humanoïde
2arXiv cs.RO 

WB-WAM : pré-entraînement hétérogène corps-main pour la locomanipulation humanoïde

Des chercheurs publient WB-WAM, un « World Action Model » (modèle qui prédit conjointement la vidéo future et les actions) conçu pour la manipulation mobile des humanoïdes (loco-manipulation). Il apprend à partir de 1 880,2 heures de vidéos et de données de mouvement annotées de façon partielle. Un espace d'action physique commun fusionne des annotations hétérogènes : articulations du corps, déplacement de la base (root) et doigts de la main dextre. Les priors ainsi obtenus sont affinés par une étape intermédiaire baptisée PICO, puis adaptés aux tâches robotiques avec une supervision auxiliaire par cinématique directe. Les auteurs ont construit WB-Datasets, qui combine démonstrations humaines égocentriques retargetées sur le robot et trajectoires robotiques. En simulation, le modèle atteint 81,9 % de réussite sur HumanoidArena. En conditions réelles, il affiche 84,0 % de succès moyen sur cinq tâches. L'article ne précise ni le robot utilisé, ni le nombre d'essais par tâche, ni les modèles de référence comparés dans ces chiffres. Le point central tient à la donnée. Les corpus de pré-entraînement robotique couvrent mal les mouvements du corps entier, alors que les humanoïdes doivent coordonner jambes, torse, bras et mains dans une même tâche. WB-WAM suggère qu'on peut combler ce manque en réutilisant des démonstrations humaines égocentriques, plus faciles à collecter que la téléopération sur robot. Les auteurs affirment que la mi-formation PICO alignée sur la tâche améliore les performances et réduit le nombre de démonstrations réelles nécessaires. Pour un intégrateur, c'est un levier de coût : le goulot d'étranglement actuel est le volume de données robot, pas l'architecture. À nuancer : 84 % de réussite sur cinq tâches reste un chiffre de laboratoire, sans information sur la durée de cycle, la robustesse hors distribution ou la fiabilité sur de longues périodes, qui comptent pour un déploiement industriel. Le résultat soutient la voie des modèles vidéo-action, sans prouver qu'elle passe à l'échelle en production. Ce travail s'inscrit dans la montée des modèles d'action fondés sur la vidéo générative, en parallèle des VLA (vision-langage-action) comme Pi-0, GR00T ou Helix. Ces derniers se concentrent souvent sur la manipulation à bras fixes ou semi-mobile, tandis que WB-WAM vise le corps entier, mains dextres comprises. Les acteurs de l'humanoïde industriel (Figure, Tesla avec Optimus, Agility, ainsi que les acteurs européens comme Wandercraft ou Enchanted Tools) font face au même problème de données, ce qui rend les approches de transfert depuis l'humain stratégiques. Il s'agit ici d'une prépublication arXiv (version 2), sans produit ni pilote annoncé. La suite à surveiller : la publication du code et des jeux de données WB-Datasets, la reproduction par d'autres équipes, et la validation sur des tâches plus longues et plus variées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral
3arXiv cs.RO 

HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral

Une équipe de recherche a publié le 18 août 2026 sur arXiv (arXiv:2608.16837v1) HAF (Humanoid Adaptation Framework), un système en deux modules destiné à adapter des modèles génératifs vision-langage-action (VLA) déjà entraînés au pilotage complet d'un robot humanoïde, locomotion, posture du buste et manipulation bimanuelle comprises. Le premier module, HAF-VLA, s'appuie sur un modèle VLA pré-entraîné à flow-matching et découpe le débruitage de l'action corps entier en trois étapes successives, reliées par des caches clé-valeur qui préservent les dépendances cinématiques entre les segments du corps, là où une génération en un seul bloc produit des mouvements incohérents. Par-dessus ce module gelé, HAF-Steer applique un apprentissage par renforcement hors ligne puis en ligne: il exploite l'inversibilité du flow-matching et une réduction de dimension par transformée en cosinus discrète pour confiner l'optimisation à un sous-espace de bruit compact, avant d'entraîner une politique SAC régularisée. Testé sur sept tâches réelles de loco-manipulation humanoïde, HAF dépasse les architectures VLA à étage unique classiques en coordination corps entier, avec un site de démonstration à grange007.github.io/HAF. L'enjeu dépasse la prouesse technique: les VLA généralistes, entraînés surtout sur des bras fixes ou mobiles, butent sur la haute dimensionnalité et l'interdépendance des mouvements dès qu'il s'agit de piloter un corps humanoïde entier. En évitant de réentraîner l'intégralité du gros modèle VLA, HAF réduit le coût de calcul et le risque de l'exploration en ligne sur un robot réel, un point sensible pour tout intégrateur visant un déploiement en usine ou en environnement humain. Les résultats, obtenus sur seulement sept tâches en conditions de laboratoire, restent toutefois un signal de faisabilité plutôt qu'une preuve de généralisation à grande échelle. Ce travail s'inscrit dans la lignée des modèles VLA à flow-matching type Pi-0, GR00T N2 ou Helix, conçus d'abord pour des bras ou robots à roues plutôt que pour la bipédie complète, et plusieurs laboratoires cherchent en parallèle à combler cet écart. HAF reste à ce stade une contribution académique assortie d'un site de démonstration, sans partenaire industriel ni calendrier de déploiement annoncé; la suite attendue est la publication du code et des poids, puis une validation sur davantage de plateformes avant toute reprise par des acteurs commerciaux.

RechercheOpinion
1 source
Praxis : des a priori d'interaction physique de vidéos égocentriques pour une manipulation généralisable du corps entier
4arXiv cs.RO 

Praxis : des a priori d'interaction physique de vidéos égocentriques pour une manipulation généralisable du corps entier

Un preprint publié le 28 septembre 2026 sur arXiv (2609.30735) décrit Praxis, un framework de manipulation corps-entier pour robots humanoïdes mobiles, capable d'apprendre une compétence à partir d'une seule démonstration vidéo égocentrique, sans réentraînement de politique spécifique à la tâche. Le système enchaîne trois étapes : une navigation guidée par un modèle vision-langage vers l'objet cible, une calibration de posture en boucle fermée qui aligne l'espace de travail bras-main, puis une manipulation dextre avec coordination synchronisée du haut et du bas du corps. Un retour visuel en ligne réajuste la géométrie d'interaction démontrée face à de nouvelles poses d'objets, tandis qu'un retour tactile adapte les mouvements de la main aux conditions de contact réelles. Testé sur cinq tâches de manipulation à horizon long, le système montre une généralisation spatiale, visuelle et inter-objets, ainsi qu'une récupération après perturbation physique externe à chacune des trois étapes. L'intérêt pour l'industrie tient à la réduction du coût de collecte de données : la plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action ou sur l'apprentissage par renforcement, exigent des centaines de démonstrations téléopérées par tâche pour généraliser correctement. En ne nécessitant qu'un seul enregistrement vidéo humain par compétence et aucune caméra embarquée sur robot pendant la collecte, Praxis s'attaque directement au goulot d'étranglement qui freine le déploiement d'humanoïdes polyvalents chez les intégrateurs. La combinaison de retours visuel et tactile pour récupérer d'une perturbation en conditions réelles, plutôt que de rejouer une trajectoire figée, touche un point sensible du secteur : l'écart persistant entre démonstrations soignées et robustesse en usage industriel réel. Praxis s'inscrit dans la lignée des recherches sur l'apprentissage par imitation à partir de vidéos humaines, une alternative moins coûteuse à la téléopération massive utilisée par les grands modèles vision-langage-action. Il s'agit à ce stade d'un résultat de recherche publié en preprint, sans nom de produit ni partenaire industriel annoncé, testé sur cinq tâches en conditions expérimentales contrôlées et non en déploiement réel chez un client. L'étape suivante, non détaillée dans le résumé, consisterait à étendre le nombre de compétences apprises simultanément et à valider l'approche sur des plateformes robotiques commerciales avant toute évaluation par des intégrateurs.

RecherchePaper
1 source