Aller au contenu principal
RoboEdit : transformer des vidéos de manipulation humaine en expérience robotique à grande échelle
IA physiquearXiv cs.RO 

RoboEdit : transformer des vidéos de manipulation humaine en expérience robotique à grande échelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint arXiv publie en aout 2026 (2608.18948) présente RoboEdit, une suite logicielle qui convertit des vidéos de manipulation humaine en vidéos robotiques exploitables pour l'entrainement de politiques de contrôle. Son pipeline automatique, RoboEdit-ADC, reconstruit et retarget des interactions 3D main-objet a partir de simples vidéos RGB, et a génère RoboEdit-14M : 174 000 paires de vidéos alignées, soit 14 millions de frames, couvrant sept embodiments robotiques et des scènes variées. Le moteur d'édition, RoboEdit-Trans, applique des modules d'adaptation cross-embodiment pour préserver la cohérence temporelle en changeant apparence et mouvement, tandis qu'un décodeur d'état 3D reconstruit image par image la position de la main pour une supervision structurée. Les auteurs rapportent une qualité d'édition supérieure aux méthodes existantes et des politiques de contrôle entraînées sur ces vidéos, testées avec succès en manipulation réelle.

La collecte de données robot-objet reste couteuse et spécifique a chaque plateforme matérielle, un goulot d'étranglement central pour l'entrainement de modèles vision-langage-action généralistes de type GR00T N2, Pi-0 ou Helix. En transformant la masse de vidéos humaines disponibles, jusqu'ici inutilisables a cause du décalage d'embodiment, en données synthétiques alignées sur sept morphologies robotiques, RoboEdit propose une alternative directe a la téléopération massive. Si les gains se confirment hors des benchmarks des auteurs, l'approche pourrait réduire la dépendance des laboratoires et intégrateurs a la collecte manuelle. Il s'agit toutefois d'un résultat de recherche en preprint, évalué par ses propres auteurs, sans validation industrielle indépendante a ce stade.

Cette publication s'inscrit dans une tendance de deux ans ou plusieurs équipes cherchent a réutiliser les vidéos humaines abondantes plutôt que de multiplier les collectes téléopérées embodiment par embodiment. RoboEdit se distingue par un pipeline entièrement automatique de reconstruction et de retargeting 3D et par l'échelle de son jeu de données, RoboEdit-14M, pense pour sept embodiments simultanément plutôt qu'un seul robot cible. Le résume ne précise ni l'institution porteuse ni de calendrier de publication du code, ni de partenariat industriel. La suite logique attendue est la publication des données et des évaluations indépendantes sur des plateformes tierces, pour vérifier que ces gains se traduisent hors du cadre expérimental des auteurs.

À lire aussi

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle
1Interesting Engineering 

Vidéo : le cerveau robotique de Genesis permet une manipulation au niveau humain et un entraînement à grande échelle

Genesis AI a présenté GENE-26.5, un modèle de fondation robotique conçu pour doter les robots de capacités de manipulation au niveau humain. La vidéo de démonstration publiée par l'entreprise montre des robots accomplissant une séquence culinaire de 20 étapes (couper des tomates, casser un oeuf d'une seule main, coordonner les deux bras pendant la cuisson), ainsi que la préparation d'un smoothie avec service en l'air, des tâches de laboratoire (pipettage, transfert de liquides), du câblage pour assemblage électronique, la résolution d'un Rubik's Cube en manipulation aérienne continue, et l'interprétation d'une pièce de piano rapide. Pour alimenter l'entraînement du modèle, l'entreprise a développé un gant haptique équipé d'une peau électronique à capteurs tactiles, établissant une correspondance 1:1:1 entre la main humaine, le gant et la main robotique. Genesis revendique un coût matériel cent fois inférieur aux solutions de télé-opération conventionnelles, et une efficacité de collecte de données cinq fois supérieure. Le moteur de données associé intègre également des vidéos égocentriques issues de caméras portables et des vidéos publiques centrées sur l'activité humaine. Ces résultats, s'ils se confirment en environnement réel non contrôlé, représentent une avancée potentiellement significative sur l'un des verrous les plus tenaces de la robotique : l'écart d'incarnation (embodiment gap) entre les mains humaines et robotiques, qui limite depuis des années la transférabilité des données d'entraînement. La cartographie 1:1 glove-to-robot est une approche déjà explorée par des acteurs comme Physical Intelligence (pi-0) et plusieurs laboratoires académiques, mais Genesis revendique une démonstration à une échelle et une polyvalence inédites. Pour les intégrateurs industriels et les décideurs cherchant à automatiser des tâches non structurées (assemblage fin, préparation culinaire en volume, logistique d'entrepôt), la promesse d'un système généraliste capable d'apprendre directement des gestes humains quotidiens, sans retraining extensif, représenterait un changement de paradigme. Il faut toutefois noter que les démonstrations sont des vidéos éditées, sans données indépendantes sur le taux d'échec, les conditions d'éclairage, ou la reproductibilité en cycle de production continu. Genesis AI s'inscrit dans un segment en forte concurrence avec Physical Intelligence (pi-0, Berkeley), Figure AI (Figure 03, déployé avec BMW), Tesla (Optimus Gen 3), NVIDIA (GR00T N2) et Apptronik (Apollo). L'approche par gant haptique à bas coût rappelle les travaux d'Enchanted Tools, acteur français du service robotique, qui mise également sur la capture de mouvement humain pour réduire le coût d'entraînement. Genesis n'a pas encore annoncé de déploiements industriels confirmés ni de partenariats nominatifs : GENE-26.5 reste à ce stade une annonce de produit accompagnée d'une démonstration vidéo, pas un système disponible commercialement. L'entreprise indique prévoir le déploiement de ses gants en milieu de travail réel via des partenariats industriels, avec pour objectif de constituer une bibliothèque de compétences humaines à grande échelle pour l'entraînement robotique.

IA physiqueActu
1 source
HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle
2arXiv cs.RO 

HuRo : robotiser des vidéos humaines pour un pré-entraînement VLA à grande échelle

Publié le 10 septembre 2026 sur arXiv (2609.10706), HuRo est un pipeline qui transforme des vidéos humaines hétérogènes en données d'entraînement pour des politiques vision-langage-action (VLA), en réalignant observations et trajectoires d'action sur la morphologie d'un robot et en reconstruisant les signaux intermédiaires absents des vidéos brutes. À partir de cinq sources de vidéos humaines, les auteurs ont constitué le jeu de données HuRo : environ 630 000 épisodes robotisés et 142 millions de frames traitées. Sur quatre tâches réelles de manipulation, ce pré-entraînement fait passer le taux de réussite global de 51,5% à 80,3% avec l'augmentation du volume de données, et le taux de réussite hors distribution, sous des variations spatiales et visuelles inédites, de 34,9% à 72,2%. Code et données sont publiés sur le site du projet. Le résultat cible un goulot d'étranglement connu du secteur : la collecte de données réelles par téléopération coûte cher et ne passe pas à l'échelle, alors que les vidéos humaines abondent sur internet. En montrant que la robotisation systématique de ces vidéos améliore les performances de façon quasi monotone avec le volume, HuRo apporte une preuve empirique qu'une loi d'échelle s'applique aussi à ce type de pré-entraînement, un point jusqu'ici débattu dans la communauté VLA. Le gain de robustesse hors distribution, plus marqué que le gain en distribution, répond directement à la critique récurrente faite aux démonstrations de robots humanoïdes, qui échouent souvent dès que l'éclairage ou la position d'un objet change. Les auteurs montrent aussi qu'un pré-entraînement de bout en bout avec des actions retargetées surpasse un simple transfert visuel, nuançant l'idée que la vision seule suffirait à combler l'écart d'incarnation entre humain et robot. Le problème n'est pas nouveau : les approches précédentes robotisaient des vidéos humaines soit dans des contextes déjà appariés à une tâche précise, soit en traitant séparément, à grande échelle, l'alignement des observations et celui des actions. HuRo comble ce vide en unifiant robotisation visuelle et retargeting d'action sur cinq sources vidéo hétérogènes, s'inscrivant dans un mouvement plus large de la recherche en robotique visant à réduire la dépendance des politiques VLA à la téléopération réelle. Aucun partenariat industriel ni déploiement sur du matériel commercial n'est mentionné à ce stade : il s'agit d'un travail de recherche publié en preprint, code et données ouverts, sans calendrier annoncé de transfert vers un produit ou un robot physique précis.

IA physiqueActu
1 source
Le monde entre vos mains : un écosystème open source à grande échelle pour l'apprentissage de la manipulation centrée sur l'humain en conditions réelles
3arXiv cs.RO 

Le monde entre vos mains : un écosystème open source à grande échelle pour l'apprentissage de la manipulation centrée sur l'humain en conditions réelles

Un article déposé sur arXiv (version 4) présente World In Your Hands (WIYH), un écosystème open source comprenant plus de 1 000 heures de données de manipulation humaine collectées en conditions réelles, avec une précision de mouvement à l'échelle millimétrique. Il s'articule autour de trois éléments : l'Oracle Suite, un kit de capture portable doté d'un pipeline d'auto-étiquetage pour un suivi de mouvement précis hors laboratoire ; le WIYH Dataset, qui couvre des centaines de compétences de manipulation dans des scénarios réels variés et de multiples modalités ; et un ensemble d'annotations et de benchmarks allant de la perception à l'action. Les auteurs précisent que toutes les données et les plans matériels seront publiés en open source. Le résultat central des expériences menées avec WIYH montre que l'intégration de ces données humaines dans l'entraînement de politiques robotiques fait passer le taux de réussite de manipulation en environnement encombré de 8% à 60%. Cet écart souligne que le goulot d'étranglement des politiques vision-langage-action reste la quantité et la qualité des démonstrations, plus que l'architecture des modèles. Pour les équipes travaillant sur l'apprentissage cross-embodiment, transférable d'une morphologie de robot à une autre voire de la main humaine vers un bras robotique, WIYH offre une alternative aux campagnes de téléopération propriétaires coûteuses. Publier données et matériel en open source tranche avec la logique de plusieurs acteurs commerciaux qui gardent leurs jeux de données fermés. Ce travail s'inscrit dans une série d'efforts visant à exploiter vidéo et geste humains comme alternative aux données de téléopération, face au coût et à la lenteur de la collecte robot par robot. La difficulté historique tenait à la précision du tracking et à l'hétérogénéité des conditions de capture, ce que l'Oracle Suite cherche à résoudre avec son pipeline d'auto-étiquetage millimétrique déployable hors studio. À ce stade, WIYH reste une publication de recherche accompagnée d'un jeu de données et de benchmarks, pas un produit commercialisé ni un déploiement industriel ; son impact dépendra de la mise en ligne effective des données et des plans matériels, ainsi que de la reproductibilité du gain de 8% à 60% sur d'autres tâches que celles testées par les auteurs.

IA physiqueActu
1 source
Génération de vidéo 4D intégrant la géométrie pour la manipulation robotique
4arXiv cs.RO 

Génération de vidéo 4D intégrant la géométrie pour la manipulation robotique

Des chercheurs ont publié sur arXiv (référence 2507.01099, version 4) un modèle de génération vidéo 4D destiné à améliorer la planification et la manipulation robotique. L'approche prend en entrée une seule image RGB-D par point de vue, c'est-à-dire une image couleur couplée à une carte de profondeur, et génère des séquences vidéo futures alignées spatialement et temporellement depuis de nouveaux angles de caméra, sans nécessiter la connaissance préalable des poses de caméra. La cohérence géométrique multi-vue est imposée pendant l'entraînement par une supervision fondée sur l'alignement de nuages de points inter-vues (cross-view pointmap alignment), forçant le modèle à construire une représentation 3D partagée de la scène. Les vidéos 4D prédites sont ensuite exploitées par un tracker de pose 6DoF disponible sur étagère pour reconstituer les trajectoires de l'effecteur terminal du robot, produisant des politiques de manipulation qui généralisent à des points de vue inédits. Les expériences portent sur plusieurs jeux de données robotiques simulés et réels, avec de meilleures performances visuelles et spatiales que les approches de référence. Ce résultat s'attaque directement à l'un des verrous majeurs du déploiement industriel de la manipulation robotique : la dépendance à une calibration précise des caméras et à leur positionnement fixe. En apprenant implicitement la géométrie de la scène plutôt qu'en la recevant comme entrée explicite, le modèle produit des prédictions visuellement stables là où les approches concurrentes dérivent dès qu'on change l'angle de vue. Pour un intégrateur ou un COO industriel, cela signifie qu'une cellule robotisée pourrait potentiellement réutiliser une politique apprise sans reconfigurer l'ensemble du système de vision si une caméra est déplacée. L'utilisation d'un tracker 6DoF hors catalogue pour extraire les trajectoires limite par ailleurs le besoin d'infrastructure propriétaire et simplifie l'intégration. Ce travail s'inscrit dans la vague des "world models" appliqués à la robotique, aux côtés d'approches comme UniSim ou des modèles VLA (Vision-Language-Action) à grande échelle qui cherchent eux aussi à donner aux robots une compréhension prédictive de leur environnement. La principale réserve est que le papier est une prépublication arXiv, sans validation industrielle annoncée ni partenaire de déploiement identifié : c'est de la recherche amont, pas un produit expédié. Les méthodes concurrentes s'appuyant sur des poses de caméra explicites, comme les approches NeRF ou 3D Gaussian Splatting pour la manipulation, offrent parfois une précision supérieure dans des environnements très contrôlés, mais au prix d'une configuration plus contraignante. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation plus complexes, une montée en échelle sur des plateformes comme les bras Franka ou UR, et une intégration dans des pipelines de politique complète de type diffusion ou transformer.

IA physiquePaper
1 source