Aller au contenu principal
EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles
RecherchearXiv cs.RO 

EgoWAM : des modèles monde-action au-delà des pixels grâce à des données humaines égocentriques en conditions réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire RL2 de Georgia Tech publient EgoWAM, un cadre de "World Action Models" qui exploite des vidéos égocentriques humaines filmées en conditions réelles pour entraîner des politiques de manipulation robotique. Le problème identifié: le clonage de comportement classique mélange des éléments transférables comme les objets, les scènes et la sémantique des tâches, avec des facteurs propres à l'humain (morphologie, mouvements de tête, style gestuel) qui n'ont rien à voir avec un bras robotique. Les auteurs testent trois cibles de prédiction du monde différentes, à backbone de politique, tête d'action et mélange de données identiques: la prédiction de pixels bruts, des caractéristiques visuelles DINO, et le flux de mouvement 3D. Sur trois tâches bimanuelles réelles, la prédiction pixel se révèle peu efficace pour le transfert humain-robot, tandis que DINO améliore la généralisation hors distribution (nouveaux objets, nouvelles scènes) jusqu'à 4 fois, et le flux 3D augmente la performance en distribution de 20 à 30%.

Le résultat tranche un débat central pour l'industrie robotique: peut-on utiliser la masse de vidéos humaines disponibles sur le web comme signal d'entraînement bon marché, à la manière dont les modèles VLA (vision-langage-action) type Pi-0 de Physical Intelligence ou GR00T de NVIDIA cherchent à le faire? EgoWAM montre que oui, mais pas en imitant les pixels tels quels: il faut une représentation qui abstrait l'apparence et isole les effets physiques indépendants de l'agent, en séparant le mouvement de caméra du changement réel de l'environnement. Pour les intégrateurs et laboratoires qui misent sur la vidéo à l'échelle pour réduire le coût de collecte de données robotiques, cela oriente concrètement le choix des représentations à privilégier plutôt que la simple accumulation de séquences pixel.

Le travail s'inscrit dans la lignée des modèles du monde appliqués à la robotique et des jeux de données égocentriques type Ego4D, en réponse aux limites connues du clonage de comportement pur. Le code, les tâches et les détails expérimentaux sont publiés sur gatech-rl2.github.io/egowam.github.io, sans annonce de déploiement industriel à ce stade: il s'agit d'un résultat de recherche contrôlé, pas d'un produit prêt à intégrer.

À lire aussi

Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques
1arXiv cs.RO 

Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques

Une équipe de recherche publie Ego2Robot, un pipeline conçu pour transformer des vidéos de manipulation humaine filmées à la première personne (égocentriques) en données d'entraînement robotique. La méthode combine trois étapes : le retargeting des actions humaines vers des trajectoires robotiques, la synthèse visuelle d'un bras robotique inséré dans la scène, et une curation de qualité à plusieurs niveaux pour filtrer les séquences exploitables. Le résultat annoncé est un jeu de données de 18 561 heures de données robotiques synthétisées, couvrant 15 morphologies de robots différentes, ce qui en ferait le plus grand corpus ego-vers-robot jamais constitué. Pour évaluer la capacité de généralisation des modèles entraînés sur ces données, les auteurs étendent le benchmark RoboTwin2.0 avec des axes de perturbation dissociés : apparence visuelle, disposition de la scène, morphologie du robot et sémantique de la tâche. L'article, déposé sur arXiv (2608.02580), reste à ce stade un preprint non encore relu par les pairs. L'enjeu dépasse la simple taille du jeu de données. Les travaux précédents avaient montré que le retargeting vidéo pouvait produire des politiques efficaces mais limitées à une seule tâche, à petite échelle. Ego2Robot teste pour la première fois si cette approche apporte un bénéfice en pré-entraînement à grande échelle pour des modèles vision-langage-action (VLA), la brique centrale des robots généralistes actuels type Pi-0, GR00T N2 ou Helix. Les auteurs rapportent que le pré-entraînement conjoint sur données synthétisées et données robotiques réelles améliore de façon consistante la généralisation hors distribution, avec une validation sur déploiement réel. Si ces résultats se confirment, cela renforcerait l'idée que la vidéo humaine égocentrique, abondante et bien moins coûteuse à collecter que la téléopération, peut combler une partie du déficit de données qui freine l'entraînement des modèles robotiques généralistes. Le goulot d'étranglement des données reste le frein numéro un des modèles de manipulation généralistes : la téléopération reste coûteuse à grande échelle, et la simulation pure souffre encore d'un écart sim-to-real. Ego2Robot s'inscrit dans une lignée de travaux cherchant des sources de données alternatives, aux côtés d'approches par simulation ou par vidéos web génériques. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs mettent à disposition une page projet dédiée, sans calendrier annoncé pour une éventuelle mise à disposition publique du jeu de données complet.

RecherchePaper
1 source
EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique
2arXiv cs.RO 

EgoTac : prédiction tactile en conditions réelles à partir d'une vision égocentrique

Des chercheurs présentent EgoTac, un modèle capable de prédire des signaux tactiles directement à partir de vidéos égocentriques humaines, sans capteur physique de toucher. Publié sur arXiv (2608.15060v1) en août 2026, le modèle est entraîné sur un corpus unifié de plus de 5,7 millions de paires image-tactile, combinant mesures de force continues et contacts binaires. En prédiction intra-domaine, EgoTac atteint une erreur de force moyenne inférieure à 0,06 newton. Sur des benchmarks de prédiction de contact hors domaine, il dépasse l'estimateur de contact considéré jusqu'ici comme référence de l'état de l'art. Le modèle reproduit aussi les courbes de montée et de descente des signaux tactiles réels, et parvient à des prédictions en zero-shot sur des vidéos du monde réel non contraintes, c'est-à-dire filmées hors laboratoire. Cette approche répond à un goulot d'étranglement bien identifié dans l'apprentissage robotique : les données vidéo égocentriques humaines, de plus en plus utilisées pour entraîner des modèles vision-langage-action, sont abondantes et riches en contacts, mais dépourvues d'information tactile, faute de capteurs adaptés à une collecte à grande échelle. En démontrant qu'un signal tactile plausible peut être inféré par la seule vision, EgoTac ouvre une voie pour injecter des a priori tactiles dans l'apprentissage de la manipulation dextre sans multiplier les déploiements de capteurs physiques coûteux et fragiles. Pour les intégrateurs et laboratoires travaillant sur la manipulation fine, cela pourrait réduire la dépendance aux gants ou capteurs tactiles embarqués lors de la collecte de données, tout en conservant un signal exploitable pour entraîner des politiques robotiques. Le travail s'inscrit dans la lignée des efforts de collecte de données égocentriques massives pour la robotique, où la vision domine largement le toucher faute de standardisation des capteurs tactiles. Les auteurs comparent EgoTac à un estimateur de contact jugé état de l'art, qu'il surpasse sur les benchmarks hors domaine testés. Leurs analyses de passage à l'échelle montrent que la diversité des interactions et le volume de données améliorent tous deux la performance de façon régulière, suggérant une marge de progression via l'extension future du corpus d'entraînement et une possible intégration dans des pipelines d'apprentissage robotique tactile plus larges.

RecherchePaper
1 source
Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle
3arXiv cs.RO 

Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle

Un article de robotique/IA en français, prêt à publier : CoMe-VLA (Cognitive and Memory-aware Vision-Language-Action) est un nouveau framework de recherche présenté dans un article arXiv (version révisée, réf. 2602.04600v2) qui s'attaque à la perception active en robotique manipulatrice, c'est-à-dire la capacité d'un robot à chercher activement de l'information plutôt que d'agir sur des données figées. Le système combine une tête cognitive auxiliaire chargée de gérer les transitions entre sous-tâches de façon autonome, et une mémoire à double piste qui fusionne les signaux proprioceptifs (position, effort) et visuels dans le temps pour maintenir une conscience cohérente de soi et de l'environnement. L'entraînement se déroule en trois étapes progressives et s'appuie sur de larges volumes de données égocentriques humaines (vidéos captées à la première personne), alignées avec l'espace d'action du robot pour transférer la coordination main-œil humaine vers la machine. Les tests ont été menés sur un humanoïde à roues, sur des tâches longues et variées impliquant plusieurs scénarios de perception active. L'enjeu dépasse la démonstration technique isolée. La plupart des modèles VLA actuellement médiatisés, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, fonctionnent principalement en supposant une observabilité quasi complète de la scène, ce qui limite leur robustesse dès que l'environnement devient incertain ou partiellement caché, un cas fréquent en usine ou en entrepôt réel. En formalisant la perception active comme une boucle perception-action dépendante de l'historique, cet article propose une catégorisation structurée utile à toute l'industrie pour comparer les approches, et illustre une piste concrète pour réduire l'écart entre démonstrations en laboratoire et déploiement en environnement non contrôlé, un point sensible que les intégrateurs surveillent de près. Ce travail s'inscrit dans une tendance de fond de la recherche en robotique généraliste : exploiter les vidéos humaines à grande échelle, bien plus abondantes que les données de téléopération robotique, pour apprendre des priors d'exploration et de manipulation. Il ne s'agit ici que d'un article de recherche à un stade préliminaire, sans partenaire industriel ni déploiement annoncé, à distinguer clairement des annonces produits de type Figure ou Tesla Optimus. Les prochaines étapes attendues concernent l'extension à des plateformes bipèdes et la validation sur des tâches manipulatrices plus complexes en conditions réelles.

RechercheOpinion
1 source
EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier
4arXiv cs.RO 

EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier

Une équipe de chercheurs vient de publier une nouvelle version de son article sur arXiv (2604.07607v2) présentant EgoVerse, une plateforme collaborative de données humaines égocentriques destinée à l'apprentissage robotique. La version actuelle du jeu de données regroupe 1 362 heures d'enregistrements, soit environ 80 000 épisodes de démonstrations humaines, couvrant 1 965 tâches différentes réalisées dans 240 environnements distincts par 2 087 démonstrateurs uniques. Les données sont standardisées avec des annotations pertinentes pour la manipulation et des outils dédiés à l'entraînement de modèles en aval. Le projet est conçu pour recevoir des contributions aussi bien de chercheurs individuels que de laboratoires académiques et d'acteurs industriels, dans un cadre commun de collecte et de traitement. Ce travail répond à un problème concret du secteur robotique : la collecte de données réelles sur robot reste coûteuse et difficile à faire passer à l'échelle, tandis que les données humaines égocentriques offrent une alternative bien moins onéreuse pour capturer des comportements de manipulation dans des environnements du quotidien. Les auteurs ont mené une étude à grande échelle sur le transfert humain-vers-robot, avec des expériences répliquées dans plusieurs laboratoires, sur différentes tâches et différentes plateformes robotiques, selon des protocoles partagés. Résultat notable : la performance des politiques s'améliore globalement avec davantage de données humaines, mais ce passage à l'échelle n'est efficace que si ces données sont alignées avec les objectifs d'apprentissage du robot ciblé, un nuance importante pour les équipes qui espèrent simplement empiler du volume de données sans questionner leur pertinence. Le problème que EgoVerse cherche à résoudre est la fragmentation des jeux de données humains existants, souvent limités en portée et difficiles à étendre au-delà de l'institution qui les a produits. En unifiant collecte, traitement et accès sous un même cadre partagé, la plateforme se positionne comme une infrastructure de recherche reproductible plutôt qu'un simple jeu de données figé, avec vocation à s'enrichir au fil des contributions externes. Les vidéos et informations complémentaires sont disponibles sur egoverse.ai.

RecherchePaper
1 source