Aller au contenu principal
HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle
IA physiquearXiv cs.RO 

HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 10 septembre 2026 sur arXiv (2609.10706), HuRo est un pipeline qui transforme des vidéos humaines hétérogènes en données d'entraînement pour des politiques vision-langage-action (VLA), en réalignant observations et trajectoires d'action sur la morphologie d'un robot et en reconstruisant les signaux intermédiaires absents des vidéos brutes. À partir de cinq sources de vidéos humaines, les auteurs ont constitué le jeu de données HuRo : environ 630 000 épisodes robotisés et 142 millions de frames traitées. Sur quatre tâches réelles de manipulation, ce pré-entraînement fait passer le taux de réussite global de 51,5% à 80,3% avec l'augmentation du volume de données, et le taux de réussite hors distribution, sous des variations spatiales et visuelles inédites, de 34,9% à 72,2%. Code et données sont publiés sur le site du projet.

Le résultat cible un goulot d'étranglement connu du secteur : la collecte de données réelles par téléopération coûte cher et ne passe pas à l'échelle, alors que les vidéos humaines abondent sur internet. En montrant que la robotisation systématique de ces vidéos améliore les performances de façon quasi monotone avec le volume, HuRo apporte une preuve empirique qu'une loi d'échelle s'applique aussi à ce type de pré-entraînement, un point jusqu'ici débattu dans la communauté VLA. Le gain de robustesse hors distribution, plus marqué que le gain en distribution, répond directement à la critique récurrente faite aux démonstrations de robots humanoïdes, qui échouent souvent dès que l'éclairage ou la position d'un objet change. Les auteurs montrent aussi qu'un pré-entraînement de bout en bout avec des actions retargetées surpasse un simple transfert visuel, nuançant l'idée que la vision seule suffirait à combler l'écart d'incarnation entre humain et robot.

Le problème n'est pas nouveau : les approches précédentes robotisaient des vidéos humaines soit dans des contextes déjà appariés à une tâche précise, soit en traitant séparément, à grande échelle, l'alignement des observations et celui des actions. HuRo comble ce vide en unifiant robotisation visuelle et retargeting d'action sur cinq sources vidéo hétérogènes, s'inscrivant dans un mouvement plus large de la recherche en robotique visant à réduire la dépendance des politiques VLA à la téléopération réelle. Aucun partenariat industriel ni déploiement sur du matériel commercial n'est mentionné à ce stade : il s'agit d'un travail de recherche publié en preprint, code et données ouverts, sans calendrier annoncé de transfert vers un produit ou un robot physique précis.

À lire aussi

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle
1Interesting Engineering 

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle

Genesis AI a présenté GENE-26.5, un modèle de fondation robotique conçu pour doter les robots de capacités de manipulation au niveau humain. La vidéo de démonstration publiée par l'entreprise montre des robots accomplissant une séquence culinaire de 20 étapes (couper des tomates, casser un oeuf d'une seule main, coordonner les deux bras pendant la cuisson), ainsi que la préparation d'un smoothie avec service en l'air, des tâches de laboratoire (pipettage, transfert de liquides), du câblage pour assemblage électronique, la résolution d'un Rubik's Cube en manipulation aérienne continue, et l'interprétation d'une pièce de piano rapide. Pour alimenter l'entraînement du modèle, l'entreprise a développé un gant haptique équipé d'une peau électronique à capteurs tactiles, établissant une correspondance 1:1:1 entre la main humaine, le gant et la main robotique. Genesis revendique un coût matériel cent fois inférieur aux solutions de télé-opération conventionnelles, et une efficacité de collecte de données cinq fois supérieure. Le moteur de données associé intègre également des vidéos égocentriques issues de caméras portables et des vidéos publiques centrées sur l'activité humaine. Ces résultats, s'ils se confirment en environnement réel non contrôlé, représentent une avancée potentiellement significative sur l'un des verrous les plus tenaces de la robotique : l'écart d'incarnation (embodiment gap) entre les mains humaines et robotiques, qui limite depuis des années la transférabilité des données d'entraînement. La cartographie 1:1 glove-to-robot est une approche déjà explorée par des acteurs comme Physical Intelligence (pi-0) et plusieurs laboratoires académiques, mais Genesis revendique une démonstration à une échelle et une polyvalence inédites. Pour les intégrateurs industriels et les décideurs cherchant à automatiser des tâches non structurées (assemblage fin, préparation culinaire en volume, logistique d'entrepôt), la promesse d'un système généraliste capable d'apprendre directement des gestes humains quotidiens, sans retraining extensif, représenterait un changement de paradigme. Il faut toutefois noter que les démonstrations sont des vidéos éditées, sans données indépendantes sur le taux d'échec, les conditions d'éclairage, ou la reproductibilité en cycle de production continu. Genesis AI s'inscrit dans un segment en forte concurrence avec Physical Intelligence (pi-0, Berkeley), Figure AI (Figure 03, déployé avec BMW), Tesla (Optimus Gen 3), NVIDIA (GR00T N2) et Apptronik (Apollo). L'approche par gant haptique à bas coût rappelle les travaux d'Enchanted Tools, acteur français du service robotique, qui mise également sur la capture de mouvement humain pour réduire le coût d'entraînement. Genesis n'a pas encore annoncé de déploiements industriels confirmés ni de partenariats nominatifs : GENE-26.5 reste à ce stade une annonce de produit accompagnée d'une démonstration vidéo, pas un système disponible commercialement. L'entreprise indique prévoir le déploiement de ses gants en milieu de travail réel via des partenariats industriels, avec pour objectif de constituer une bibliothèque de compétences humaines à grande échelle pour l'entraînement robotique.

IA physiqueActu
1 source
RoboEdit : transformer des vidéos de manipulation humaine en expérience robotique à grande échelle
2arXiv cs.RO 

RoboEdit : transformer des vidéos de manipulation humaine en expérience robotique à grande échelle

Un preprint arXiv publie en aout 2026 (2608.18948) présente RoboEdit, une suite logicielle qui convertit des vidéos de manipulation humaine en vidéos robotiques exploitables pour l'entrainement de politiques de contrôle. Son pipeline automatique, RoboEdit-ADC, reconstruit et retarget des interactions 3D main-objet a partir de simples vidéos RGB, et a génère RoboEdit-14M : 174 000 paires de vidéos alignées, soit 14 millions de frames, couvrant sept embodiments robotiques et des scènes variées. Le moteur d'édition, RoboEdit-Trans, applique des modules d'adaptation cross-embodiment pour préserver la cohérence temporelle en changeant apparence et mouvement, tandis qu'un décodeur d'état 3D reconstruit image par image la position de la main pour une supervision structurée. Les auteurs rapportent une qualité d'édition supérieure aux méthodes existantes et des politiques de contrôle entraînées sur ces vidéos, testées avec succès en manipulation réelle. La collecte de données robot-objet reste couteuse et spécifique a chaque plateforme matérielle, un goulot d'étranglement central pour l'entrainement de modèles vision-langage-action généralistes de type GR00T N2, Pi-0 ou Helix. En transformant la masse de vidéos humaines disponibles, jusqu'ici inutilisables a cause du décalage d'embodiment, en données synthétiques alignées sur sept morphologies robotiques, RoboEdit propose une alternative directe a la téléopération massive. Si les gains se confirment hors des benchmarks des auteurs, l'approche pourrait réduire la dépendance des laboratoires et intégrateurs a la collecte manuelle. Il s'agit toutefois d'un résultat de recherche en preprint, évalué par ses propres auteurs, sans validation industrielle indépendante a ce stade. Cette publication s'inscrit dans une tendance de deux ans ou plusieurs équipes cherchent a réutiliser les vidéos humaines abondantes plutôt que de multiplier les collectes téléopérées embodiment par embodiment. RoboEdit se distingue par un pipeline entièrement automatique de reconstruction et de retargeting 3D et par l'échelle de son jeu de données, RoboEdit-14M, pense pour sept embodiments simultanément plutôt qu'un seul robot cible. Le résume ne précise ni l'institution porteuse ni de calendrier de publication du code, ni de partenariat industriel. La suite logique attendue est la publication des données et des évaluations indépendantes sur des plateformes tierces, pour vérifier que ces gains se traduisent hors du cadre expérimental des auteurs.

IA physiquePaper
1 source
ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA
3arXiv cs.RO 

ACE-Ego-0 : unification des données égocentrées humaines et robotiques pour le préentraînement VLA

Pré-publiée sur arXiv en juin 2026 (identifiant 2606.17200), ACE-EGO-0 est un cadre de pretraining pour modèles Vision-Langage-Action (VLA) qui exploite conjointement 4 530 heures de données robotiques et de simulation, et 1 480 heures de vidéos égocentrées humaines converties en pseudo-trajectoires robot. Le pipeline automatise la transformation de vidéos à la première personne en séquences d'actions au format démonstration téléopérée, en représentant les mouvements dans l'espace caméra plutôt que dans un référentiel corporel. Pour atténuer le bruit inhérent à ces pseudo-labels, un objectif d'entraînement reliability-aware concentre la supervision sur les segments les plus fiables via une perte auxiliaire dédiée. Évalué sur RoboCasa GR1 TableTop (robot humanoïde GR1 de Fourier Intelligence) et RoboTwin 2.0, ACE-EGO-0 atteint les meilleures performances publiées sur les deux benchmarks et démontre, selon les auteurs, un transfert vers la manipulation bimanuelle en conditions réelles. L'apport central est la résolution d'un problème structurel : les divergences d'espaces d'action, de morphologie et de dynamiques temporelles entre humains et robots rendaient jusqu'ici l'entraînement conjoint instable ou contre-productif. En unifiant la représentation via des actions caméra-space et un time-aligned action chunking avec morphology conditioning, les auteurs montrent que des jeux de données égocentrés existants comme Ego4D ou EPIC-Kitchens peuvent fournir un signal complémentaire valide à grande échelle. Pour les équipes R&D en robotique, l'implication pratique est directe : réduire significativement le coût de collecte de trajectoires robot, l'un des principaux goulots d'étranglement du déploiement VLA à l'échelle industrielle. La course aux politiques robotiques généralisables s'est accélérée depuis Pi-0 de Physical Intelligence (novembre 2024), OpenVLA et RT-2 de Google DeepMind. Des travaux antérieurs comme Dobb-E ou Human2Robot avaient déjà exploré les données humaines égocentrées comme supervision complémentaire, mais sans framework unifié à cette échelle ni évaluation systématique. ACE-EGO-0 propose une recette reproductible évaluée sur deux benchmarks de référence, dont RoboTwin 2.0, particulièrement pertinent car la manipulation bimanuelle reste un défi ouvert pour les humanoïdes commerciaux tels que Figure 03, Optimus Gen 3 ou Unitree H1. La prépublication ne mentionne ni partenaire industriel ni déploiement annoncé : ACE-EGO-0 est pour l'instant une contribution de recherche, pas un produit livrable.

IA physiqueOpinion
1 source
CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines
4arXiv cs.RO 

CLAP : pré-entraînement contrastif par actions latentes pour l'apprentissage de modèles VLA à partir de vidéos humaines

Des chercheurs ont soumis sur arXiv (2601.04061v2, janvier 2026) un framework appelé CLAP, pour Contrastive Latent Action Pretraining, conçu pour entraîner des modèles Vision-Language-Action (VLA) généralistes à partir de vidéos humaines non étiquetées. Le pipeline repose sur deux étapes: un module Act-VAE construit d'abord un vocabulaire d'actions exécutables à partir de trajectoires robotiques existantes, puis un apprentissage contrastif aligne les transitions visuelles extraites de vidéos humaines sur ce vocabulaire latent, pseudo-étiquetant ainsi ces vidéos sans collecte téléopérée supplémentaire. Sur cette base, CLAP-NTP est entraîné comme VLA autorégressif combinant démonstrations robotiques réelles et vidéos humaines étiquetées. Pour le déploiement, CLAP-RF ajoute une tête à flux rectifié (Rectified Flow) permettant la prédiction de chunks d'actions continus à faible latence, couplée à une régularisation dite Knowledge Matching qui préserve les connaissances sémantiques préentraînées lors du fine-tuning sur domaine cible. L'obstacle central des VLA généralistes reste la rareté des données robotiques étiquetées face à l'abondance de vidéos humaines disponibles en ligne. Les approches antérieures de type Latent Action Models tentaient d'exploiter ces vidéos mais encodaient du bruit visuel plutôt que des compétences de manipulation réelles, un problème qualifié d'enchevêtrement visuel (visual entanglement). CLAP contourne cette limitation en ancrant l'espace latent sur des trajectoires physiquement fondées via l'apprentissage contrastif, sans reconstruire l'apparence. Pour les intégrateurs industriels, la promesse concrète est de réduire le coût de collecte téléopérée, estimé à plusieurs milliers de dollars par heure, tout en améliorant la généralisation à de nouveaux objets sans démonstrations robotiques exhaustives. Les résultats expérimentaux rapportés montrent de bonnes performances face aux baselines comparatives, mais la validation externe reste à confirmer. Le domaine des VLA est en pleine effervescence depuis l'émergence de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et Helix (Figure AI), tous confrontés à la même pénurie de données étiquetées exploitables. Google DeepMind a exploré des voies similaires avec des travaux comme UniSim. CLAP se distingue en proposant une approche plus physiquement ancrée que les méthodes purement génératives ou reconstructrices. Ce preprint n'a pas encore été évalué par les pairs et n'annonce aucun déploiement en production. Les prochaines étapes naturelles seraient une validation sur un éventail plus large de plateformes robotiques ainsi qu'une comparaison systématique avec les Diffusion Policies, méthodes actuellement dominantes sur les benchmarks Open X-Embodiment.

IA physiqueActu
1 source