Aller au contenu principal
RecherchearXiv cs.RO 

La génération vidéo contrefactuelle permet le passage à l'échelle de la loco-manipulation humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.38172) PRISM, un cadre « real-to-sim-to-real » qui vise à apprendre à un humanoïde des tâches de loco-manipulation, comme porter des objets variés, à partir de quelques vidéos réelles seulement. Le procédé démarre d'une poignée de vidéos d'exemple, à partir desquelles un modèle de génération vidéo-à-vidéo (V2V) produit des centaines de vidéos « contrefactuelles » d'interactions humain-objet. Un pipeline de reconstruction ancré sur les contacts en extrait ensuite les mouvements de la personne et de l'objet, puis les retarget en trajectoires physiquement plausibles pour le robot, malgré l'imperfection des vidéos synthétiques. Une seule politique est entraînée sur l'ensemble. Elle est déployée sur un robot réel sans aucun réglage fin en conditions réelles, avec pour seule entrée des observations de profondeur embarquées. Les auteurs affirment qu'elle saisit, transporte et dépose boîtes, barils, bacs et balles, y compris des instances jamais vues, de tailles et de configurations initiales différentes. Le résumé ne donne ni modèle d'humanoïde, ni taux de réussite, ni nombre d'objets testés, ni temps de cycle.

L'intérêt tient au goulot que ce travail cible. L'imitation visuelle est séduisante pour former des robots généralistes, mais il est difficile de réunir des vidéos qui montrent le corps entier sans occlusion et les contacts avec l'objet. Si l'approche tient à plus grande échelle, la diversité des données cesserait de dépendre de la captation humaine et passerait par la génération, ce qui réduirait le coût d'un jeu d'entraînement pour des tâches de manutention comme le déplacement de bacs ou de cartons. Le résultat sans réglage fin réel va dans le sens d'un transfert sim-to-real de plus en plus fiable pour la locomanipulation. Il faut toutefois rester prudent : il s'agit d'un preprint sans validation externe, la démonstration porte sur quatre catégories d'objets, et l'absence de chiffres publiés dans le résumé empêche d'évaluer la robustesse, la cadence ou l'écart avec une démonstration soigneusement choisie. On ne parle ni de produit ni de déploiement industriel.

Ces travaux s'inscrivent dans une course où les acteurs cherchent à contourner la rareté des données de téléopération. Des approches concurrentes s'appuient sur la capture de mouvement humain, sur de grandes politiques vision-langage-action (VLA) telles que Pi-0, GR00T ou Helix, ou sur la simulation massive avec randomisation de domaine. PRISM ajoute la génération vidéo comme multiplicateur de données. Les prochaines étapes à surveiller sont la publication du code et des métriques détaillées, des tests sur des tâches à contacts plus complexes et des objets déformables, et une comparaison directe avec des données de téléopération. Aucun pilote ni calendrier commercial n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

GRAIL : génération de loco-manipulation pour humanoïdes à partir d'actifs 3D et de vidéos
1arXiv cs.RO 

GRAIL : génération de loco-manipulation pour humanoïdes à partir d'actifs 3D et de vidéos

Une équipe de chercheurs publie GRAIL (Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors, arXiv:2606.05160), un pipeline entièrement virtuel qui génère des données d'entraînement en loco-manipulation humanoïde sans télé-opération ni capture de mouvement physique. La méthode compose des actifs 3D paramétrés, des scènes simulées et des modèles fondamentaux vidéo (VFM) pour reconstruire des trajectoires d'interaction humain-objet (HOI) en 4D à l'échelle métrique, en conditionnant la génération vidéo sur des configurations entièrement spécifiées : géométrie, paramètres caméra, profondeur de scène et personnage aux proportions humanoïdes, ce qui réduit l'ambiguïté de profondeur et le mismatch morphologique habituels. Le pipeline produit plus de 20 000 séquences couvrant ramassage d'objets, manipulation, assise et traversée de terrains variés. Entraîné uniquement sur ces données synthétiques via un pipeline sim-to-real, le système atteint 84 % de succès en préhension d'objets divers et 90 % en montée d'escaliers sur un Unitree G1 en conditions réelles ; l'article, soumis sur arXiv en juin 2026, est une prépublication non encore évaluée par les pairs. Ce travail s'attaque au principal goulot d'étranglement de la robotique humanoïde : générer des données de démonstration diversifiées à grande échelle sans mobiliser de temps-robot ni d'opérateurs spécialisés. La télé-opération et la mocap exigent des configurations physiques dédiées et un robot disponible à chaque session, ce qui plafonne le débit de production de données ; GRAIL déplace intégralement ce coût vers la simulation, rendant possible la composition de données pour des objets, scènes et mouvements corporels inédits. Les résultats de 84 % et 90 % en conditions réelles constituent un signal positif sur la réduction du gap sim-to-real, du moins pour ces classes de tâches. Une réserve s'impose cependant : le résumé ne détaille ni les objets testés ni le protocole de sélection des séquences d'évaluation, ce qui rend toute comparaison indépendante prématurée avant la publication complète. GRAIL s'inscrit dans une course à la donnée synthétique que se livrent les principaux laboratoires de robotique humanoïde, aux côtés des pipelines World Model de Figure AI et 1X Technologies, de RoboVerse (Microsoft Research) et des environnements Genesis pour la simulation physique générative. La distinction de GRAIL réside dans le conditionnement fort sur des actifs 3D préalables, un choix qui améliore la précision de la reconstruction 4D mais suppose la disponibilité d'assets de qualité pour chaque objet cible. Le robot retenu, l'Unitree G1, est commercialisé autour de 16 000 dollars, rendant la reproduction des résultats accessible à de nombreuses équipes académiques, contrairement aux plateformes propriétaires des acteurs industriels. Les affiliations des auteurs ne figurant pas dans le résumé arXiv disponible, les suites naturelles annoncées comprennent les tâches bimanuelles, les environnements dynamiques et l'intégration dans des pipelines VLA (Vision-Language-Action) pour la généralisation à des objets et contextes non vus lors de l'entraînement.

UELes laboratoires académiques européens spécialisés en robotique humanoïde (INRIA, CEA-List) pourraient adopter ce pipeline de génération de données synthétiques pour réduire leur dépendance à la télé-opération et à la mocap, mais aucun acteur FR/UE n'est directement impliqué dans ces travaux.

RecherchePaper
1 source
ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts
2arXiv cs.RO 

ViTacWorld : passage à l'échelle des modèles du monde visuo-tactiles pour la manipulation robotique riche en contacts

Des chercheurs présentent ViTacWorld, un modèle de monde visuo-tactile conditionné par l'action, conçu pour la manipulation robotique riche en contacts, décrit dans une prépublication arXiv (2607.22530v1). Le système s'appuie sur des jeux de données tactiles réels publics combinés à un environnement de simulation construit spécifiquement pour l'occasion, afin de générer à grande échelle des trajectoires visuo-tactiles-actions. Le modèle est d'abord préentraîné sur de larges volumes de trajectoires réelles et simulées, puis affiné avec des rollouts de politiques collectés en conditions réelles pour mieux coller aux comportements de manipulation visés. À partir d'une séquence d'actions du robot, ViTacWorld prédit conjointement les observations visuelles et le retour tactile correspondants, permettant de générer des rollouts visuo-tactiles-actions complets. Les auteurs présentent cela comme le premier cadre exploitant un modèle de monde pour la génération de trajectoires visuo-tactiles-actions et l'évaluation de politiques robotiques. L'enjeu central est le coût et la rareté des données tactiles réelles, qui freinent l'apprentissage robotique basé sur le toucher : matériel spécifique, collecte coûteuse, diversité de tâches et de scènes limitée. En misant sur le fait que le signal tactile, directement ancré dans le contact physique, souffre d'un écart simulation-vers-réel plus faible que la seule vision, ViTacWorld propose une voie pour combler ce manque de données sans multiplier les campagnes de collecte sur robot réel. Pour les équipes de recherche en manipulation fine (assemblage, insertion, préhension d'objets déformables), cela ouvre deux usages concrets : générer des données synthétiques pour améliorer des politiques tactiles en aval, et évaluer des politiques existantes en prédisant leurs résultats visuo-tactiles sous des séquences d'actions contrôlées, sans passer systématiquement par des essais physiques. C'est un signal de plus que les modèles de monde, déjà répandus en vision, commencent à s'étendre à d'autres modalités sensorielles pour la robotique de contact. Ce travail s'inscrit dans la lignée des modèles de monde appliqués à la robotique, jusqu'ici centrés presque exclusivement sur la modalité visuelle, et dans la continuité des efforts pour réduire la dépendance de l'apprentissage tactile aux capteurs propriétaires et aux collectes sur site. Les expériences menées par les auteurs sur des tâches de manipulation riches en contacts montrent que ViTacWorld génère des rollouts physiquement cohérents, améliore les performances de politiques via une augmentation de données scalable, et permet une évaluation de politiques conditionnée par l'action. Le projet est documenté sur vitacworld.github.io. L'article ne mentionne aucun partenariat industriel ni déploiement commercial à ce stade : il s'agit d'une contribution de recherche dont la portée réelle dépendra de sa reproduction sur des plateformes robotiques variées et de son adoption par des équipes travaillant sur l'assemblage ou la manipulation fine en environnement industriel.

RecherchePaper
1 source
N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches
3arXiv cs.RO 

N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches

Des chercheurs présentent N0-TWAM, un modèle monde-action "tactile natif" conçu pour la manipulation robotique dans des tâches à contact riche, capable de prédire à la fois l'image future et le contact physique futur. Selon les auteurs, il s'agirait du premier modèle monde-action tactile entraîné à grande échelle, une affirmation à prendre avec la prudence habituelle pour ce type de papier arXiv (2607.23783, non encore relu par les pairs). Le pré-entraînement combine vision et tactile sur des démonstrations couvrant six morphologies de robots différentes et 450 tâches. Le système s'appuie sur NeoForce, une représentation tactile unifiée basée sur la force, censée fournir un signal de contact physiquement ancré pour guider la génération d'actions. Pour gérer les tâches longues et multi-étapes, les auteurs introduisent des "événements de contact tactile" qui marquent la progression d'une étape à l'autre. Côté architecture, un Mixture-of-Transformers asymétrique associe un expert large pour la prédiction vidéo à des experts plus légers pour l'action et le tactile, dans un souci d'efficacité temps réel. Le modèle a été évalué sur des benchmarks réels et simulés, et le code ainsi que les poids seront publiés en open source. L'enjeu dépasse la simple prouesse technique. Les modèles vision-langage-action actuels, de π0 à GR00T N2 en passant par Helix, reposent presque exclusivement sur la vision, ce qui explique une bonne partie de leurs échecs sur les tâches fines de contact : insertion de pièces, préhension d'objets déformables, assemblage. Un modèle qui démontre un gain mesurable grâce au passage à l'échelle des données tactiles apporterait un signal utile pour les intégrateurs industriels confrontés à ce fossé entre démonstration en vidéo et fiabilité en production. Le manque de jeux de données tactiles standardisés à grande échelle est resté un frein connu du secteur, contrairement à la vision où les corpus type RT-X abondent. En couvrant six embodiments, N0-TWAM s'inscrit dans cette logique de généralisation multi-robots. La publication annoncée du code et des checkpoints permettra à la communauté de vérifier ces résultats et d'évaluer si l'approche tient face à des déploiements réels sur des tâches d'assemblage ou de manipulation fine.

RecherchePaper
1 source
4arXiv cs.RO 

EgoAlign : combler l'écart entre humains et robots humanoïdes pour la loco-manipulation à longue portée

Des chercheurs de Lambda Humanoid présentent EgoAlign, un cadre de construction de données qui transforme des démonstrations humaines filmées en vue égocentrique en supervision d'actions et d'états exploitable par un humanoïde, sans aucune démonstration collectée sur robot physique. Le système s'appuie sur le modèle et le simulateur du robot cible, dont le retour d'exécution guide la collecte. Il conserve les références de locomotion pour la marche périodique guidée par la vision, et adapte la géométrie d'interaction du haut du corps par alignement d'échelle puis raffinement en boucle avec le contrôleur. Un rejeu causal reconstruit ensuite les états du robot et les étiquettes de tokens de mouvement, appariés aux observations humaines. Un modèle vision-langage-action (VLA) est affiné uniquement sur ces données adaptées, puis déployé en zero-shot sur un humanoïde réel. Les politiques réalisent des déplacements d'objets sur longue distance, la navigation vers des positions d'arrivée jamais vues et une interaction avec le pied évaluée de façon indépendante. Le travail, publié sur arXiv (2609.38046), est accompagné d'une page de projet. L'enjeu est celui de la donnée, principal goulot d'étranglement des VLA humanoïdes. La téléopération produit des démonstrations propres mais reste coûteuse et immobilise un robot sur site. Les vidéos égocentriques humaines sont bien moins chères, mais elles souffrent de différences d'échelle corporelle, de réponse du contrôleur et d'états robot manquants. Les auteurs affirment que le raffinement améliore l'alignement des mains en simulation et le taux de réussite de saisie sur robot réel par rapport à un simple alignement cinématique, et que la collecte humaine réduit le temps d'acquisition sur site face à la téléopération. Ces résultats vont dans le sens d'un transfert humain vers humanoïde exploitable pour la locomotion-manipulation, un domaine où la marche et la manipulation sont rarement apprises ensemble. Le résumé ne chiffre toutefois ni les taux de réussite, ni le gain de temps, ni le nombre de démonstrations, ni le modèle de robot ou de VLA utilisés. Sans ces données, difficile de juger la robustesse hors des tâches choisies pour la démonstration. Ce travail s'inscrit dans une course à la donnée humaine qui mobilise plusieurs acteurs. Des projets comme GR00T chez Nvidia, Pi-0 chez Physical Intelligence ou Helix chez Figure explorent des pistes voisines, mêlant téléopération, simulation et vidéo humaine à grande échelle. La spécificité d'EgoAlign tient à l'usage d'un contrôleur du corps entier continu et polyvalent, et à l'absence totale de données robot physiques. Il s'agit ici d'un résultat de recherche, sans produit ni déploiement industriel annoncé. La prochaine étape logique serait une validation sur davantage de tâches, de morphologies et de volumes de données, avec des comparaisons chiffrées à la téléopération. Aucun acteur français ou européen n'est cité dans ce travail.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source