Aller au contenu principal
HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral
RecherchearXiv cs.RO 

HAF : adapter des VLA généralistes à la loco-manipulation corps entier humanoïde par flux d'action hiérarchique et RL latent spectral

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié le 18 août 2026 sur arXiv (arXiv:2608.16837v1) HAF (Humanoid Adaptation Framework), un système en deux modules destiné à adapter des modèles génératifs vision-langage-action (VLA) déjà entraînés au pilotage complet d'un robot humanoïde, locomotion, posture du buste et manipulation bimanuelle comprises. Le premier module, HAF-VLA, s'appuie sur un modèle VLA pré-entraîné à flow-matching et découpe le débruitage de l'action corps entier en trois étapes successives, reliées par des caches clé-valeur qui préservent les dépendances cinématiques entre les segments du corps, là où une génération en un seul bloc produit des mouvements incohérents. Par-dessus ce module gelé, HAF-Steer applique un apprentissage par renforcement hors ligne puis en ligne: il exploite l'inversibilité du flow-matching et une réduction de dimension par transformée en cosinus discrète pour confiner l'optimisation à un sous-espace de bruit compact, avant d'entraîner une politique SAC régularisée. Testé sur sept tâches réelles de loco-manipulation humanoïde, HAF dépasse les architectures VLA à étage unique classiques en coordination corps entier, avec un site de démonstration à grange007.github.io/HAF.

L'enjeu dépasse la prouesse technique: les VLA généralistes, entraînés surtout sur des bras fixes ou mobiles, butent sur la haute dimensionnalité et l'interdépendance des mouvements dès qu'il s'agit de piloter un corps humanoïde entier. En évitant de réentraîner l'intégralité du gros modèle VLA, HAF réduit le coût de calcul et le risque de l'exploration en ligne sur un robot réel, un point sensible pour tout intégrateur visant un déploiement en usine ou en environnement humain. Les résultats, obtenus sur seulement sept tâches en conditions de laboratoire, restent toutefois un signal de faisabilité plutôt qu'une preuve de généralisation à grande échelle.

Ce travail s'inscrit dans la lignée des modèles VLA à flow-matching type Pi-0, GR00T N2 ou Helix, conçus d'abord pour des bras ou robots à roues plutôt que pour la bipédie complète, et plusieurs laboratoires cherchent en parallèle à combler cet écart. HAF reste à ce stade une contribution académique assortie d'un site de démonstration, sans partenaire industriel ni calendrier de déploiement annoncé; la suite attendue est la publication du code et des poids, puis une validation sur davantage de plateformes avant toute reprise par des acteurs commerciaux.

À lire aussi

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
1arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
2arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source
Sumo : la loco-manipulation dynamique et généralisable du corps entier
3arXiv cs.RO 

Sumo : la loco-manipulation dynamique et généralisable du corps entier

Un institut de recherche a publié via arXiv (article 2604.08508, troisième révision) un travail intitulé "Sumo: Dynamic and Generalizable Whole-Body Loco-Manipulation", mené sur les serveurs du RAI Institute (ex-Boston Dynamics AI Institute, hébergé sur rai-inst.com). La méthode combine sim-to-real et pilotage en temps réel: une politique de contrôle corps entier pré-entraînée est guidée au moment de l'exécution par un planificateur basé sur l'échantillonnage, sans réentraînement supplémentaire. Les chercheurs ont testé l'approche sur un robot quadrupède Spot (Boston Dynamics) dans le monde réel, avec deux tâches marquantes: redresser un pneu plus lourd que la capacité de levage nominale du robot, et traîner une barrière anti-émeute plus grande et plus haute que l'engin lui-même. Le système s'est aussi montré capable de généraliser à une variété d'objets et de tâches sans réglage additionnel, la fonction de coût pouvant être ajustée à la volée. En simulation uniquement, les auteurs étendent la méthode à un humanoïde pour ouvrir une porte et pousser une table. Code et vidéos sont publiés sur sumo.rai-inst.com. L'intérêt principal tient à la généralisation obtenue sans réentraînement par objet: une seule politique, pilotée différemment selon le contexte, remplace la logique habituelle d'entraînement dédié à chaque tâche de manipulation. Pour les intégrateurs et les équipes de R&D en robotique mobile, cela suggère une voie pour dépasser les limites de charge utile nominale annoncées par les constructeurs, un enjeu concret en logistique, chantier ou intervention d'urgence où les objets à déplacer dépassent souvent les specs du robot. Il faut toutefois noter que les résultats humanoïdes ne sont validés qu'en simulation, sans transfert réel démontré, et qu'aucun chiffre précis de masse, de temps de cycle ou de taux de réussite n'est communiqué dans le résumé, ce qui invite à la prudence avant de parler de percée généralisée. Le RAI Institute a été fondé par Marc Raibert, également fondateur de Boston Dynamics, comme structure de recherche indépendante à but non lucratif détachée de la feuille de route produit de Boston Dynamics. Spot reste la plateforme quadrupède commerciale de Boston Dynamics, ici réutilisée comme banc d'essai académique plutôt que comme produit vendu. Ce travail se distingue des approches dominantes du moment fondées sur des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, en misant sur la planification par échantillonnage plutôt que sur un grand modèle appris de bout en bout. Les prochaines étapes attendues concernent la validation réelle du volet humanoïde, actuellement cantonné à la simulation.

RecherchePaper
1 source
GRAIL : génération de loco-manipulation pour humanoïdes à partir d'actifs 3D et de vidéos
4arXiv cs.RO 

GRAIL : génération de loco-manipulation pour humanoïdes à partir d'actifs 3D et de vidéos

Une équipe de chercheurs publie GRAIL (Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors, arXiv:2606.05160), un pipeline entièrement virtuel qui génère des données d'entraînement en loco-manipulation humanoïde sans télé-opération ni capture de mouvement physique. La méthode compose des actifs 3D paramétrés, des scènes simulées et des modèles fondamentaux vidéo (VFM) pour reconstruire des trajectoires d'interaction humain-objet (HOI) en 4D à l'échelle métrique, en conditionnant la génération vidéo sur des configurations entièrement spécifiées : géométrie, paramètres caméra, profondeur de scène et personnage aux proportions humanoïdes, ce qui réduit l'ambiguïté de profondeur et le mismatch morphologique habituels. Le pipeline produit plus de 20 000 séquences couvrant ramassage d'objets, manipulation, assise et traversée de terrains variés. Entraîné uniquement sur ces données synthétiques via un pipeline sim-to-real, le système atteint 84 % de succès en préhension d'objets divers et 90 % en montée d'escaliers sur un Unitree G1 en conditions réelles ; l'article, soumis sur arXiv en juin 2026, est une prépublication non encore évaluée par les pairs. Ce travail s'attaque au principal goulot d'étranglement de la robotique humanoïde : générer des données de démonstration diversifiées à grande échelle sans mobiliser de temps-robot ni d'opérateurs spécialisés. La télé-opération et la mocap exigent des configurations physiques dédiées et un robot disponible à chaque session, ce qui plafonne le débit de production de données ; GRAIL déplace intégralement ce coût vers la simulation, rendant possible la composition de données pour des objets, scènes et mouvements corporels inédits. Les résultats de 84 % et 90 % en conditions réelles constituent un signal positif sur la réduction du gap sim-to-real, du moins pour ces classes de tâches. Une réserve s'impose cependant : le résumé ne détaille ni les objets testés ni le protocole de sélection des séquences d'évaluation, ce qui rend toute comparaison indépendante prématurée avant la publication complète. GRAIL s'inscrit dans une course à la donnée synthétique que se livrent les principaux laboratoires de robotique humanoïde, aux côtés des pipelines World Model de Figure AI et 1X Technologies, de RoboVerse (Microsoft Research) et des environnements Genesis pour la simulation physique générative. La distinction de GRAIL réside dans le conditionnement fort sur des actifs 3D préalables, un choix qui améliore la précision de la reconstruction 4D mais suppose la disponibilité d'assets de qualité pour chaque objet cible. Le robot retenu, l'Unitree G1, est commercialisé autour de 16 000 dollars, rendant la reproduction des résultats accessible à de nombreuses équipes académiques, contrairement aux plateformes propriétaires des acteurs industriels. Les affiliations des auteurs ne figurant pas dans le résumé arXiv disponible, les suites naturelles annoncées comprennent les tâches bimanuelles, les environnements dynamiques et l'intégration dans des pipelines VLA (Vision-Language-Action) pour la généralisation à des objets et contextes non vus lors de l'entraînement.

UELes laboratoires académiques européens spécialisés en robotique humanoïde (INRIA, CEA-List) pourraient adopter ce pipeline de génération de données synthétiques pour réduire leur dépendance à la télé-opération et à la mocap, mais aucun acteur FR/UE n'est directement impliqué dans ces travaux.

RecherchePaper
1 source