Aller au contenu principal
EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
RecherchearXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%.

Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel.

Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

À lire aussi

Ego4WAM : quels facteurs comptent pour le passage à l'échelle des données humaines égocentriques en apprentissage robotique ?
1arXiv cs.RO 

Ego4WAM : quels facteurs comptent pour le passage à l'échelle des données humaines égocentriques en apprentissage robotique ?

Des chercheurs publient Ego4WAM, une étude systématique sur l'usage des données humaines égocentriques (captées en vue subjective, typiquement par caméra portée) pour entraîner des robots. Le travail s'appuie sur un cadre unifié de « world-action model » (WAM), dont le backbone reste fixe afin d'isoler l'effet de chaque variable. Quatre facteurs sont disséqués : l'alignement entre démonstrations humaines et tâche robotique, la durée des données, la diversité des tâches, et le type de supervision (avec ou sans étiquettes d'action), ainsi que la façon d'employer ces données dans le pipeline d'entraînement. Les résultats sont validés en boucle fermée sur robots réels et sur RoboDojo, un environnement d'évaluation. Les auteurs ne communiquent dans le résumé ni volumes en heures, ni taux de réussite chiffrés, ni plateformes robotiques précises. Trois constats ressortent. Les démonstrations humaines alignées améliorent nettement la généralisation hors distribution et réduisent la quantité de données robot nécessaires sur la tâche cible. La durée et la diversité des tâches n'agissent pas sur les mêmes capacités en aval. Enfin, une supervision vidéo seule, sans action annotée, reste efficace et constitue une bonne base avant un entraînement vidéo-action. Il s'agit d'un preprint arXiv (v1), non relu par les pairs, et l'absence de chiffres dans le résumé impose de consulter l'article complet pour mesurer l'ampleur des gains. L'enjeu est pratique pour les équipes qui constituent des jeux de données de manipulation. Jusqu'ici, les travaux montraient surtout qu'ajouter des données humaines améliorait les performances, sans dire lesquelles comptaient. Ego4WAM suggère que la course aux heures de vidéo est un indicateur trop grossier : un volume modeste de démonstrations bien alignées avec la tâche peut valoir davantage qu'un grand corpus générique. Pour un intégrateur ou un industriel, cela oriente la collecte vers des captations ciblées, moins coûteuses que la téléopération robotique, et valide l'intérêt des vidéos sans actions, bien plus faciles à obtenir à grande échelle. Cela nuance aussi l'hypothèse d'un passage à l'échelle par simple accumulation. Le contexte est celui d'une ruée vers les données humaines : Ego4D a fourni un large corpus égocentrique, tandis que plusieurs acteurs de la robotique humanoïde et des modèles VLA (vision-langage-action) misent sur la capture humaine pour contourner le coût de la téléopération. Les modèles du monde orientés action prolongent cette tendance en prédisant conjointement vidéo et actions. Les prochaines étapes probables sont des comparaisons sur davantage de plateformes et de tâches longues, ainsi qu'une reproduction par d'autres laboratoires. Aucun déploiement industriel ni acteur français ou européen n'est mentionné à ce stade.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques
2arXiv cs.RO 

Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques

Une équipe de recherche publie Ego2Robot, un pipeline conçu pour transformer des vidéos de manipulation humaine filmées à la première personne (égocentriques) en données d'entraînement robotique. La méthode combine trois étapes : le retargeting des actions humaines vers des trajectoires robotiques, la synthèse visuelle d'un bras robotique inséré dans la scène, et une curation de qualité à plusieurs niveaux pour filtrer les séquences exploitables. Le résultat annoncé est un jeu de données de 18 561 heures de données robotiques synthétisées, couvrant 15 morphologies de robots différentes, ce qui en ferait le plus grand corpus ego-vers-robot jamais constitué. Pour évaluer la capacité de généralisation des modèles entraînés sur ces données, les auteurs étendent le benchmark RoboTwin2.0 avec des axes de perturbation dissociés : apparence visuelle, disposition de la scène, morphologie du robot et sémantique de la tâche. L'article, déposé sur arXiv (2608.02580), reste à ce stade un preprint non encore relu par les pairs. L'enjeu dépasse la simple taille du jeu de données. Les travaux précédents avaient montré que le retargeting vidéo pouvait produire des politiques efficaces mais limitées à une seule tâche, à petite échelle. Ego2Robot teste pour la première fois si cette approche apporte un bénéfice en pré-entraînement à grande échelle pour des modèles vision-langage-action (VLA), la brique centrale des robots généralistes actuels type Pi-0, GR00T N2 ou Helix. Les auteurs rapportent que le pré-entraînement conjoint sur données synthétisées et données robotiques réelles améliore de façon consistante la généralisation hors distribution, avec une validation sur déploiement réel. Si ces résultats se confirment, cela renforcerait l'idée que la vidéo humaine égocentrique, abondante et bien moins coûteuse à collecter que la téléopération, peut combler une partie du déficit de données qui freine l'entraînement des modèles robotiques généralistes. Le goulot d'étranglement des données reste le frein numéro un des modèles de manipulation généralistes : la téléopération reste coûteuse à grande échelle, et la simulation pure souffre encore d'un écart sim-to-real. Ego2Robot s'inscrit dans une lignée de travaux cherchant des sources de données alternatives, aux côtés d'approches par simulation ou par vidéos web génériques. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs mettent à disposition une page projet dédiée, sans calendrier annoncé pour une éventuelle mise à disposition publique du jeu de données complet.

RecherchePaper
1 source
EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique
3arXiv cs.RO 

EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique

Des chercheurs présentent EgoTac, un modèle capable de prédire des signaux tactiles directement à partir de vidéos égocentriques humaines, sans capteur physique de toucher. Publié sur arXiv (2608.15060v1) en août 2026, le modèle est entraîné sur un corpus unifié de plus de 5,7 millions de paires image-tactile, combinant mesures de force continues et contacts binaires. En prédiction intra-domaine, EgoTac atteint une erreur de force moyenne inférieure à 0,06 newton. Sur des benchmarks de prédiction de contact hors domaine, il dépasse l'estimateur de contact considéré jusqu'ici comme référence de l'état de l'art. Le modèle reproduit aussi les courbes de montée et de descente des signaux tactiles réels, et parvient à des prédictions en zero-shot sur des vidéos du monde réel non contraintes, c'est-à-dire filmées hors laboratoire. Cette approche répond à un goulot d'étranglement bien identifié dans l'apprentissage robotique : les données vidéo égocentriques humaines, de plus en plus utilisées pour entraîner des modèles vision-langage-action, sont abondantes et riches en contacts, mais dépourvues d'information tactile, faute de capteurs adaptés à une collecte à grande échelle. En démontrant qu'un signal tactile plausible peut être inféré par la seule vision, EgoTac ouvre une voie pour injecter des a priori tactiles dans l'apprentissage de la manipulation dextre sans multiplier les déploiements de capteurs physiques coûteux et fragiles. Pour les intégrateurs et laboratoires travaillant sur la manipulation fine, cela pourrait réduire la dépendance aux gants ou capteurs tactiles embarqués lors de la collecte de données, tout en conservant un signal exploitable pour entraîner des politiques robotiques. Le travail s'inscrit dans la lignée des efforts de collecte de données égocentriques massives pour la robotique, où la vision domine largement le toucher faute de standardisation des capteurs tactiles. Les auteurs comparent EgoTac à un estimateur de contact jugé état de l'art, qu'il surpasse sur les benchmarks hors domaine testés. Leurs analyses de passage à l'échelle montrent que la diversité des interactions et le volume de données améliorent tous deux la performance de façon régulière, suggérant une marge de progression via l'extension future du corpus d'entraînement et une possible intégration dans des pipelines d'apprentissage robotique tactile plus larges.

RecherchePaper
1 source
Vers un modèle généraliste de locomanipulation humanoïde par préentraînement sur des données humaines égocentriques du corps entier
4arXiv cs.RO 

Vers un modèle généraliste de locomanipulation humanoïde par préentraînement sur des données humaines égocentriques du corps entier

Des chercheurs publient λ0, une politique vision-langage-action (VLA) pour humanoïde qui pilote l'ensemble du corps, c'est-à-dire la locomotion, la posture, la manipulation à deux mains et les mouvements de doigts. Le travail repose sur HumanVerse-500, un jeu de données de 500 heures de comportements humains de locomanipulation en environnements ouverts. Il a été collecté avec un système portable léger qui synchronise la vidéo égocentrique avec les mouvements du corps et des mains. L'entraînement se fait en trois étapes. La première apprend l'interaction à partir de jeux de données égocentriques variés. La deuxième coordonne corps et mains grâce à HumanVerse-500. La troisième adapte la politique à des tâches et à des robots précis. λ0 apprend un espace de représentation commun pour transférer l'expérience humaine, tandis que des interfaces propres à chaque domaine gèrent les écarts entre états et actions de l'humain et du robot. L'évaluation porte sur le benchmark SIMPLE et sur quatre tâches réelles de locomanipulation. Les auteurs revendiquent des performances « état de l'art » et analysent aussi le comportement à l'échelle, la généralisation et l'apport de chaque étape. Ils annoncent la publication du code, des modèles et des données. L'article précise toutefois ni le robot utilisé, ni les taux de réussite, ni les concurrents comparés. L'enjeu est le coût de la donnée. Les vidéos égocentriques sont abondantes mais couvrent mal le mouvement du corps entier et sa coordination avec la manipulation. La téléopération d'humanoïdes produit la bonne donnée, mais elle est chère et difficile à passer à l'échelle. Cette étude teste une voie médiane : capter des humains équipés de capteurs légers, puis transférer vers le robot. Si les résultats tiennent, la collecte de démonstrations par téléopération deviendrait moins déterminante, et la capacité à capter du mouvement humain en conditions réelles le deviendrait davantage. Pour un intégrateur, cela pourrait réduire le coût d'adaptation à une nouvelle tâche ou à un nouveau robot, ce que la troisième étape cherche à démontrer. Il faut rester prudent : quatre tâches réelles, sans taux de réussite publiés dans le résumé, restent une base étroite. Le « état de l'art » dépend entièrement des références choisies. L'écart entre démonstration de laboratoire et déploiement industriel n'est pas traité ici. Ce travail s'inscrit dans le mouvement des modèles fondation pour humanoïdes. Les VLA de type Pi-0, GR00T ou Helix ont d'abord ciblé des bras et des mains, avant de s'étendre au corps entier. En parallèle, le pré-entraînement sur vidéo humaine devient une piste majeure pour contourner la rareté des données robotiques. Les acteurs industriels qui ont leurs propres flottes de téléopération, comme Tesla, Figure ou Agility, ont un avantage en données propriétaires, que des corpus ouverts comme HumanVerse-500 pourraient réduire pour les laboratoires académiques et les petites équipes, y compris en Europe. La suite dépend de la publication effective du code, des modèles et des données, puis de reproductions indépendantes sur d'autres plateformes. Ce sont elles qui diront si le transfert humain vers robot résiste hors du cadre des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source