Aller au contenu principal
RecherchearXiv cs.RO 

Ego4WAM : quels facteurs comptent pour le passage à l'échelle des données humaines égocentriques en apprentissage robotique ?

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient Ego4WAM, une étude systématique sur l'usage des données humaines égocentriques (captées en vue subjective, typiquement par caméra portée) pour entraîner des robots. Le travail s'appuie sur un cadre unifié de « world-action model » (WAM), dont le backbone reste fixe afin d'isoler l'effet de chaque variable. Quatre facteurs sont disséqués : l'alignement entre démonstrations humaines et tâche robotique, la durée des données, la diversité des tâches, et le type de supervision (avec ou sans étiquettes d'action), ainsi que la façon d'employer ces données dans le pipeline d'entraînement. Les résultats sont validés en boucle fermée sur robots réels et sur RoboDojo, un environnement d'évaluation. Les auteurs ne communiquent dans le résumé ni volumes en heures, ni taux de réussite chiffrés, ni plateformes robotiques précises.

Trois constats ressortent. Les démonstrations humaines alignées améliorent nettement la généralisation hors distribution et réduisent la quantité de données robot nécessaires sur la tâche cible. La durée et la diversité des tâches n'agissent pas sur les mêmes capacités en aval. Enfin, une supervision vidéo seule, sans action annotée, reste efficace et constitue une bonne base avant un entraînement vidéo-action. Il s'agit d'un preprint arXiv (v1), non relu par les pairs, et l'absence de chiffres dans le résumé impose de consulter l'article complet pour mesurer l'ampleur des gains.

L'enjeu est pratique pour les équipes qui constituent des jeux de données de manipulation. Jusqu'ici, les travaux montraient surtout qu'ajouter des données humaines améliorait les performances, sans dire lesquelles comptaient. Ego4WAM suggère que la course aux heures de vidéo est un indicateur trop grossier : un volume modeste de démonstrations bien alignées avec la tâche peut valoir davantage qu'un grand corpus générique. Pour un intégrateur ou un industriel, cela oriente la collecte vers des captations ciblées, moins coûteuses que la téléopération robotique, et valide l'intérêt des vidéos sans actions, bien plus faciles à obtenir à grande échelle. Cela nuance aussi l'hypothèse d'un passage à l'échelle par simple accumulation.

Le contexte est celui d'une ruée vers les données humaines : Ego4D a fourni un large corpus égocentrique, tandis que plusieurs acteurs de la robotique humanoïde et des modèles VLA (vision-langage-action) misent sur la capture humaine pour contourner le coût de la téléopération. Les modèles du monde orientés action prolongent cette tendance en prédisant conjointement vidéo et actions. Les prochaines étapes probables sont des comparaisons sur davantage de plateformes et de tâches longues, ainsi qu'une reproduction par d'autres laboratoires. Aucun déploiement industriel ni acteur français ou européen n'est mentionné à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier
1arXiv cs.RO 

EgoVerse : un ensemble de données humaines égocentriques pour l'apprentissage des robots, venu du monde entier

Une équipe de chercheurs vient de publier une nouvelle version de son article sur arXiv (2604.07607v2) présentant EgoVerse, une plateforme collaborative de données humaines égocentriques destinée à l'apprentissage robotique. La version actuelle du jeu de données regroupe 1 362 heures d'enregistrements, soit environ 80 000 épisodes de démonstrations humaines, couvrant 1 965 tâches différentes réalisées dans 240 environnements distincts par 2 087 démonstrateurs uniques. Les données sont standardisées avec des annotations pertinentes pour la manipulation et des outils dédiés à l'entraînement de modèles en aval. Le projet est conçu pour recevoir des contributions aussi bien de chercheurs individuels que de laboratoires académiques et d'acteurs industriels, dans un cadre commun de collecte et de traitement. Ce travail répond à un problème concret du secteur robotique : la collecte de données réelles sur robot reste coûteuse et difficile à faire passer à l'échelle, tandis que les données humaines égocentriques offrent une alternative bien moins onéreuse pour capturer des comportements de manipulation dans des environnements du quotidien. Les auteurs ont mené une étude à grande échelle sur le transfert humain-vers-robot, avec des expériences répliquées dans plusieurs laboratoires, sur différentes tâches et différentes plateformes robotiques, selon des protocoles partagés. Résultat notable : la performance des politiques s'améliore globalement avec davantage de données humaines, mais ce passage à l'échelle n'est efficace que si ces données sont alignées avec les objectifs d'apprentissage du robot ciblé, un nuance importante pour les équipes qui espèrent simplement empiler du volume de données sans questionner leur pertinence. Le problème que EgoVerse cherche à résoudre est la fragmentation des jeux de données humains existants, souvent limités en portée et difficiles à étendre au-delà de l'institution qui les a produits. En unifiant collecte, traitement et accès sous un même cadre partagé, la plateforme se positionne comme une infrastructure de recherche reproductible plutôt qu'un simple jeu de données figé, avec vocation à s'enrichir au fil des contributions externes. Les vidéos et informations complémentaires sont disponibles sur egoverse.ai.

RecherchePaper
1 source
Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle
2arXiv cs.RO 

Acte, ressent, agit : l'apprentissage de la perception active à partir de données égocentriques humaines à grande échelle

Un article de robotique/IA en français, prêt à publier : CoMe-VLA (Cognitive and Memory-aware Vision-Language-Action) est un nouveau framework de recherche présenté dans un article arXiv (version révisée, réf. 2602.04600v2) qui s'attaque à la perception active en robotique manipulatrice, c'est-à-dire la capacité d'un robot à chercher activement de l'information plutôt que d'agir sur des données figées. Le système combine une tête cognitive auxiliaire chargée de gérer les transitions entre sous-tâches de façon autonome, et une mémoire à double piste qui fusionne les signaux proprioceptifs (position, effort) et visuels dans le temps pour maintenir une conscience cohérente de soi et de l'environnement. L'entraînement se déroule en trois étapes progressives et s'appuie sur de larges volumes de données égocentriques humaines (vidéos captées à la première personne), alignées avec l'espace d'action du robot pour transférer la coordination main-œil humaine vers la machine. Les tests ont été menés sur un humanoïde à roues, sur des tâches longues et variées impliquant plusieurs scénarios de perception active. L'enjeu dépasse la démonstration technique isolée. La plupart des modèles VLA actuellement médiatisés, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, fonctionnent principalement en supposant une observabilité quasi complète de la scène, ce qui limite leur robustesse dès que l'environnement devient incertain ou partiellement caché, un cas fréquent en usine ou en entrepôt réel. En formalisant la perception active comme une boucle perception-action dépendante de l'historique, cet article propose une catégorisation structurée utile à toute l'industrie pour comparer les approches, et illustre une piste concrète pour réduire l'écart entre démonstrations en laboratoire et déploiement en environnement non contrôlé, un point sensible que les intégrateurs surveillent de près. Ce travail s'inscrit dans une tendance de fond de la recherche en robotique généraliste : exploiter les vidéos humaines à grande échelle, bien plus abondantes que les données de téléopération robotique, pour apprendre des priors d'exploration et de manipulation. Il ne s'agit ici que d'un article de recherche à un stade préliminaire, sans partenaire industriel ni déploiement annoncé, à distinguer clairement des annonces produits de type Figure ou Tesla Optimus. Les prochaines étapes attendues concernent l'extension à des plateformes bipèdes et la validation sur des tâches manipulatrices plus complexes en conditions réelles.

RechercheOpinion
1 source
Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques
3arXiv cs.RO 

Ego2Robot : synthèse de données robotiques à grande échelle à partir de données humaines égocentriques

Une équipe de recherche publie Ego2Robot, un pipeline conçu pour transformer des vidéos de manipulation humaine filmées à la première personne (égocentriques) en données d'entraînement robotique. La méthode combine trois étapes : le retargeting des actions humaines vers des trajectoires robotiques, la synthèse visuelle d'un bras robotique inséré dans la scène, et une curation de qualité à plusieurs niveaux pour filtrer les séquences exploitables. Le résultat annoncé est un jeu de données de 18 561 heures de données robotiques synthétisées, couvrant 15 morphologies de robots différentes, ce qui en ferait le plus grand corpus ego-vers-robot jamais constitué. Pour évaluer la capacité de généralisation des modèles entraînés sur ces données, les auteurs étendent le benchmark RoboTwin2.0 avec des axes de perturbation dissociés : apparence visuelle, disposition de la scène, morphologie du robot et sémantique de la tâche. L'article, déposé sur arXiv (2608.02580), reste à ce stade un preprint non encore relu par les pairs. L'enjeu dépasse la simple taille du jeu de données. Les travaux précédents avaient montré que le retargeting vidéo pouvait produire des politiques efficaces mais limitées à une seule tâche, à petite échelle. Ego2Robot teste pour la première fois si cette approche apporte un bénéfice en pré-entraînement à grande échelle pour des modèles vision-langage-action (VLA), la brique centrale des robots généralistes actuels type Pi-0, GR00T N2 ou Helix. Les auteurs rapportent que le pré-entraînement conjoint sur données synthétisées et données robotiques réelles améliore de façon consistante la généralisation hors distribution, avec une validation sur déploiement réel. Si ces résultats se confirment, cela renforcerait l'idée que la vidéo humaine égocentrique, abondante et bien moins coûteuse à collecter que la téléopération, peut combler une partie du déficit de données qui freine l'entraînement des modèles robotiques généralistes. Le goulot d'étranglement des données reste le frein numéro un des modèles de manipulation généralistes : la téléopération reste coûteuse à grande échelle, et la simulation pure souffre encore d'un écart sim-to-real. Ego2Robot s'inscrit dans une lignée de travaux cherchant des sources de données alternatives, aux côtés d'approches par simulation ou par vidéos web génériques. Aucun acteur français ou européen n'apparaît dans cette publication. Les auteurs mettent à disposition une page projet dédiée, sans calendrier annoncé pour une éventuelle mise à disposition publique du jeu de données complet.

RecherchePaper
1 source
Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique
4arXiv cs.RO 

Lois d'échelle des données en apprentissage par imitation pour la manipulation robotique

Une équipe de chercheurs publie sur arXiv (référence 2410.18647, désormais à sa quatrième révision) une étude empirique sur les lois d'échelle des données appliquées à l'apprentissage par imitation en manipulation robotique. Le protocole est rigoureux : plus de 40 000 démonstrations collectées dans de nombreux environnements et avec des objets variés, suivies de plus de 15 000 exécutions réelles sur robot, ce qui en fait l'une des études de scaling en manipulation les plus extensives à ce jour. Résultat central : la performance de généralisation d'une politique d'imitation suit une relation en loi de puissance avec le nombre d'environnements et d'objets d'entraînement. Surtout, quatre collecteurs de données travaillant une seule après-midi ont suffi pour obtenir environ 90 % de taux de réussite en déploiement zéro-shot sur des objets inconnus dans des environnements non vus, sur deux tâches distinctes. Ce que cette recherche établit, c'est que la diversité des environnements et des objets prime largement sur le volume brut de démonstrations : au-delà d'un certain seuil de démonstrations par environnement ou par objet, en ajouter davantage n'améliore plus la généralisation. Ce résultat remet en cause la stratégie intuitive qui consiste à multiplier les répétitions dans un même contexte, et oriente clairement la priorité vers la couverture de distribution plutôt que la densité d'annotation. Pour les intégrateurs industriels et les équipes robotique qui budgètent la collecte de données, l'implication est directe : mieux vaut disperser les efforts sur des scènes variées que d'accumuler des trajectoires dans un seul setup. Le fait d'atteindre 90 % de succès en zéro-shot sur des objets inédits est également un signal fort sur la maturité du paradigme VLA (Vision-Language-Action) en manipulation monomode. Ce travail s'inscrit dans le sillage des succès de scaling en NLP et vision par ordinateur, que des équipes comme DeepMind (RT-2), Physical Intelligence avec Pi-0, ou encore NVIDIA avec GR00T cherchent à transposer en robotique. L'étude reste purement académique pour l'instant, aucun déploiement industriel n'étant annoncé, et les tâches testées demeurent mono-bras sur périmètre contrôlé. Une limite à noter : les vidéos de démonstration et les protocoles d'évaluation exacts ne sont pas tous publics dans la version arXiv, ce qui rend difficile la comparaison directe avec d'autres benchmarks. Les prochaines étapes logiques seront d'étendre ces lois d'échelle aux politiques multi-tâches et de tester leur robustesse sur des plateformes humanoïdes comme Figure 03 ou Optimus Gen 3, où la distribution des états physiques est bien plus large.

RecherchePaper
1 source