EgoAlign : combler l'écart entre humains et robots humanoïdes pour la loco-manipulation à longue portée
Des chercheurs de Lambda Humanoid présentent EgoAlign, un cadre de construction de données qui transforme des démonstrations humaines filmées en vue égocentrique en supervision d'actions et d'états exploitable par un humanoïde, sans aucune démonstration collectée sur robot physique. Le système s'appuie sur le modèle et le simulateur du robot cible, dont le retour d'exécution guide la collecte. Il conserve les références de locomotion pour la marche périodique guidée par la vision, et adapte la géométrie d'interaction du haut du corps par alignement d'échelle puis raffinement en boucle avec le contrôleur. Un rejeu causal reconstruit ensuite les états du robot et les étiquettes de tokens de mouvement, appariés aux observations humaines. Un modèle vision-langage-action (VLA) est affiné uniquement sur ces données adaptées, puis déployé en zero-shot sur un humanoïde réel. Les politiques réalisent des déplacements d'objets sur longue distance, la navigation vers des positions d'arrivée jamais vues et une interaction avec le pied évaluée de façon indépendante. Le travail, publié sur arXiv (2609.38046), est accompagné d'une page de projet.
L'enjeu est celui de la donnée, principal goulot d'étranglement des VLA humanoïdes. La téléopération produit des démonstrations propres mais reste coûteuse et immobilise un robot sur site. Les vidéos égocentriques humaines sont bien moins chères, mais elles souffrent de différences d'échelle corporelle, de réponse du contrôleur et d'états robot manquants. Les auteurs affirment que le raffinement améliore l'alignement des mains en simulation et le taux de réussite de saisie sur robot réel par rapport à un simple alignement cinématique, et que la collecte humaine réduit le temps d'acquisition sur site face à la téléopération. Ces résultats vont dans le sens d'un transfert humain vers humanoïde exploitable pour la locomotion-manipulation, un domaine où la marche et la manipulation sont rarement apprises ensemble. Le résumé ne chiffre toutefois ni les taux de réussite, ni le gain de temps, ni le nombre de démonstrations, ni le modèle de robot ou de VLA utilisés. Sans ces données, difficile de juger la robustesse hors des tâches choisies pour la démonstration.
Ce travail s'inscrit dans une course à la donnée humaine qui mobilise plusieurs acteurs. Des projets comme GR00T chez Nvidia, Pi-0 chez Physical Intelligence ou Helix chez Figure explorent des pistes voisines, mêlant téléopération, simulation et vidéo humaine à grande échelle. La spécificité d'EgoAlign tient à l'usage d'un contrôleur du corps entier continu et polyvalent, et à l'absence totale de données robot physiques. Il s'agit ici d'un résultat de recherche, sans produit ni déploiement industriel annoncé. La prochaine étape logique serait une validation sur davantage de tâches, de morphologies et de volumes de données, avec des comparaisons chiffrées à la téléopération. Aucun acteur français ou européen n'est cité dans ce travail.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



