Aller au contenu principal
RecherchearXiv cs.RO 

EgoAlign : combler l'écart entre humains et robots humanoïdes pour la loco-manipulation à longue portée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de Lambda Humanoid présentent EgoAlign, un cadre de construction de données qui transforme des démonstrations humaines filmées en vue égocentrique en supervision d'actions et d'états exploitable par un humanoïde, sans aucune démonstration collectée sur robot physique. Le système s'appuie sur le modèle et le simulateur du robot cible, dont le retour d'exécution guide la collecte. Il conserve les références de locomotion pour la marche périodique guidée par la vision, et adapte la géométrie d'interaction du haut du corps par alignement d'échelle puis raffinement en boucle avec le contrôleur. Un rejeu causal reconstruit ensuite les états du robot et les étiquettes de tokens de mouvement, appariés aux observations humaines. Un modèle vision-langage-action (VLA) est affiné uniquement sur ces données adaptées, puis déployé en zero-shot sur un humanoïde réel. Les politiques réalisent des déplacements d'objets sur longue distance, la navigation vers des positions d'arrivée jamais vues et une interaction avec le pied évaluée de façon indépendante. Le travail, publié sur arXiv (2609.38046), est accompagné d'une page de projet.

L'enjeu est celui de la donnée, principal goulot d'étranglement des VLA humanoïdes. La téléopération produit des démonstrations propres mais reste coûteuse et immobilise un robot sur site. Les vidéos égocentriques humaines sont bien moins chères, mais elles souffrent de différences d'échelle corporelle, de réponse du contrôleur et d'états robot manquants. Les auteurs affirment que le raffinement améliore l'alignement des mains en simulation et le taux de réussite de saisie sur robot réel par rapport à un simple alignement cinématique, et que la collecte humaine réduit le temps d'acquisition sur site face à la téléopération. Ces résultats vont dans le sens d'un transfert humain vers humanoïde exploitable pour la locomotion-manipulation, un domaine où la marche et la manipulation sont rarement apprises ensemble. Le résumé ne chiffre toutefois ni les taux de réussite, ni le gain de temps, ni le nombre de démonstrations, ni le modèle de robot ou de VLA utilisés. Sans ces données, difficile de juger la robustesse hors des tâches choisies pour la démonstration.

Ce travail s'inscrit dans une course à la donnée humaine qui mobilise plusieurs acteurs. Des projets comme GR00T chez Nvidia, Pi-0 chez Physical Intelligence ou Helix chez Figure explorent des pistes voisines, mêlant téléopération, simulation et vidéo humaine à grande échelle. La spécificité d'EgoAlign tient à l'usage d'un contrôleur du corps entier continu et polyvalent, et à l'absence totale de données robot physiques. Il s'agit ici d'un résultat de recherche, sans produit ni déploiement industriel annoncé. La prochaine étape logique serait une validation sur davantage de tâches, de morphologies et de volumes de données, avec des comparaisons chiffrées à la téléopération. Aucun acteur français ou européen n'est cité dans ce travail.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
1arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
2arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source
MotionDisco : découverte de mouvements pour la loco-manipulation extrême des robots humanoïdes
3arXiv cs.RO 

MotionDisco : découverte de mouvements pour la loco-manipulation extrême des robots humanoïdes

Des chercheurs ont publié sur arXiv (réf. 2606.06139, juin 2026) MotionDisco, un cadre méthodologique capable de générer automatiquement des séquences de mouvements corps entier pour robots humanoïdes, sans recourir à la téleopération ni au retargeting de mouvements humains. Le système couple une recherche évolutionnaire guidée par un grand modèle de langage (LLM) sur des séquences d'interactions de contact, un optimiseur de trajectoire cinodynamique séquentiel et une stratégie d'élagage. Les trajectoires ainsi découvertes servent à entraîner des politiques de suivi par apprentissage par renforcement (RL), déployées ensuite sur un robot humanoïde physique dans des tâches de loco-manipulation longue durée. Des études d'ablation documentent que la recherche guidée par LLM produit des trajectoires corps entier cohérentes sur plusieurs tâches à long horizon impliquant des contacts riches avec l'environnement. L'enjeu principal est de contourner la téleopération, aujourd'hui le principal mode d'acquisition de données pour les humanoïdes en manipulation, approche coûteuse et difficile à passer à l'échelle. La difficulté est fondamentalement combinatoire: le nombre d'interactions de contact possibles croît exponentiellement avec l'horizon temporel et le nombre d'objets en scène. En automatisant la découverte de compétences, MotionDisco ouvre une voie potentiellement scalable pour les intégrateurs industriels sans infrastructure de téleopération. Le transfert sim-to-real sur robot physique est démontré, ce qui distingue ce travail de nombreuses contributions demeurant en simulation. Les auteurs revendiquent une première mondiale: la découverte et le déploiement de compétences humanoïdes loco-manipulation longue durée par recherche évolutionnaire entièrement automatisée, une affirmation qui reste à valider indépendamment par la communauté. Ce travail s'inscrit dans un paysage où les principaux acteurs humanoïdes, tels que Figure (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0), Unitree et NVIDIA (GR00T N2), misent massivement sur la téleopération et les démonstrations humaines pour entraîner leurs politiques de manipulation. L'utilisation d'un LLM comme moteur de recherche pour guider l'exploration de contacts s'apparente aux travaux récents sur les VLA (Vision-Language-Action models), mais positionnée en amont comme générateur de curriculum plutôt que comme politique de contrôle direct. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article, qui demeure une contribution de recherche fondamentale sans affiliation ou plateforme matérielle spécifiée. Les extensions naturelles porteraient sur des scènes multi-objets plus complexes et la validation sur une gamme élargie de plateformes humanoïdes commerciales.

RecherchePaper
1 source
4arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source