La génération vidéo contrefactuelle permet le passage à l'échelle de la loco-manipulation humanoïde
Des chercheurs publient sur arXiv (2609.38172) PRISM, un cadre « real-to-sim-to-real » qui vise à apprendre à un humanoïde des tâches de loco-manipulation, comme porter des objets variés, à partir de quelques vidéos réelles seulement. Le procédé démarre d'une poignée de vidéos d'exemple, à partir desquelles un modèle de génération vidéo-à-vidéo (V2V) produit des centaines de vidéos « contrefactuelles » d'interactions humain-objet. Un pipeline de reconstruction ancré sur les contacts en extrait ensuite les mouvements de la personne et de l'objet, puis les retarget en trajectoires physiquement plausibles pour le robot, malgré l'imperfection des vidéos synthétiques. Une seule politique est entraînée sur l'ensemble. Elle est déployée sur un robot réel sans aucun réglage fin en conditions réelles, avec pour seule entrée des observations de profondeur embarquées. Les auteurs affirment qu'elle saisit, transporte et dépose boîtes, barils, bacs et balles, y compris des instances jamais vues, de tailles et de configurations initiales différentes. Le résumé ne donne ni modèle d'humanoïde, ni taux de réussite, ni nombre d'objets testés, ni temps de cycle.
L'intérêt tient au goulot que ce travail cible. L'imitation visuelle est séduisante pour former des robots généralistes, mais il est difficile de réunir des vidéos qui montrent le corps entier sans occlusion et les contacts avec l'objet. Si l'approche tient à plus grande échelle, la diversité des données cesserait de dépendre de la captation humaine et passerait par la génération, ce qui réduirait le coût d'un jeu d'entraînement pour des tâches de manutention comme le déplacement de bacs ou de cartons. Le résultat sans réglage fin réel va dans le sens d'un transfert sim-to-real de plus en plus fiable pour la locomanipulation. Il faut toutefois rester prudent : il s'agit d'un preprint sans validation externe, la démonstration porte sur quatre catégories d'objets, et l'absence de chiffres publiés dans le résumé empêche d'évaluer la robustesse, la cadence ou l'écart avec une démonstration soigneusement choisie. On ne parle ni de produit ni de déploiement industriel.
Ces travaux s'inscrivent dans une course où les acteurs cherchent à contourner la rareté des données de téléopération. Des approches concurrentes s'appuient sur la capture de mouvement humain, sur de grandes politiques vision-langage-action (VLA) telles que Pi-0, GR00T ou Helix, ou sur la simulation massive avec randomisation de domaine. PRISM ajoute la génération vidéo comme multiplicateur de données. Les prochaines étapes à surveiller sont la publication du code et des métriques détaillées, des tests sur des tâches à contacts plus complexes et des objets déformables, et une comparaison directe avec des données de téléopération. Aucun pilote ni calendrier commercial n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



