Aller au contenu principal
AutodidactWAM : auto-distillation intermodale de la vidéo générée vers les actions du robot
RecherchearXiv cs.RO 

AutodidactWAM : auto-distillation intermodale de la vidéo générée vers les actions du robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2610.08119) AutodidactWAM, une méthode d'auto-distillation qui corrige les actions générées par un modèle monde-action (WAM) en s'appuyant sur la vidéo que ce même modèle produit. Le point de départ est Cosmos 3, un WAM qui génère conjointement vidéo future et actions robot à partir d'une observation et d'une instruction. Adapté par un fine-tuning LoRA léger à un humanoïde Unitree G1 doté de mains à cinq doigts BrainCo, il révèle une asymétrie : la vidéo montre des exécutions plausibles, mais l'action co-générée vise systématiquement à côté. En essais réels en boucle fermée, l'action native réussit environ 17 % (pré-saisie), 10 % (saisie) et 7 % (pick-and-place), avec de moins bons résultats sur objets inconnus. La méthode entraîne, sans téléopération, un estimateur de pose de main appliqué à la vidéo générée, puis une cinématique inverse en tire des actions. Ces actions « récupérées » donnent environ 75 %, 47 % et 42 % de réussite sur les trois étapes. Le meilleur objectif combine préférence, ajustement supervisé et ancrage de trajectoire cartésienne (DPO+SFT+DTW). Sur l'Oreo d'entraînement, il atteint 90 % en pré-saisie et 20 % sur la tâche complète. Sur un objet hors entraînement, il atteint 80 % et 30 %.

L'intérêt tient d'abord au diagnostic. Le goulot d'étranglement des WAM n'est pas forcément la compréhension de la tâche, que la vidéo exprime correctement, mais le décodage vers les actions d'un nouvel embodiment. Cela nuance les démonstrations de vidéos plausibles : un rendu convaincant ne garantit pas un contrôle exploitable. Pour les intégrateurs, la piste est séduisante : après une adaptation unique à la morphologie, plus de téléopération par tâche, ce qui réduit le coût principal de collecte de données. Les chiffres appellent toutefois la prudence. Le taux de réussite complet reste de 20 à 30 % sur des essais apparemment peu nombreux, avec un seul type de robot et peu d'objets. Un tel niveau est très loin d'un seuil industriel. L'écart entre pré-saisie (90 %) et tâche complète (20 %) montre que la saisie et le placement restent le point faible.

Un résultat négatif mérite attention : le Flow-DPO seul tombe à 0 % de réussite malgré 1,000 de précision de préférence en validation. L'objectif contrastif n'est donc pas la cause des gains, et une métrique de validation parfaite peut masquer un échec en conditions réelles. Côté contexte, ces travaux s'inscrivent dans la montée des modèles de fondation d'action, des VLA type Pi-0 ou GR00T aux WAM comme Cosmos, qui cherchent à exploiter les priors vidéo pour la robotique. Le G1 d'Unitree est devenu une plateforme de recherche courante, notamment pour son prix relativement bas. Les prochaines étapes probables sont des validations sur d'autres embodiments, davantage de tâches et des statistiques plus solides, ainsi qu'une réduction de l'écart sur la saisie.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde
1arXiv cs.RO 

H2R-Bench : évaluation de la génération vidéo de manipulation humain-robot dans les modèles du monde

Des chercheurs ont publié le 14 août 2026 sur arXiv (2608.13049) un nouveau benchmark baptisé H2R-Bench, conçu pour évaluer la capacité des modèles de génération vidéo à transformer des démonstrations de manipulation humaines filmées à la première personne en vidéos de manipulation robotique correspondant à un embodiment cible. Chaque instance du benchmark associe une vidéo de démonstration humaine, des contraintes d'embodiment robotique, et des annotations ancrées dans la source couvrant les objectifs de tâche, les événements d'action, les contacts fonctionnels et les réactions des objets manipulés. L'évaluation repose sur cinq dimensions : l'atteinte de l'état final visé, la complétude des événements d'action, le transfert des contacts fonctionnels, la cohérence de l'embodiment et la qualité vidéo générale. Les auteurs ont testé onze modèles de génération vidéo de pointe sur six familles de tâches de manipulation et deux embodiments robotiques distincts. Résultat principal : même les modèles les plus performants échouent souvent sur la cohérence d'embodiment, l'interaction fonctionnelle avec les objets et l'exécution correcte de la tâche. Ce constat touche un point sensible de l'apprentissage robotique : la collecte de démonstrations réelles sur robot reste coûteuse et difficile à faire monter en échelle, alors que les vidéos humaines égocentriques sont abondantes et bon marché. Convertir ces vidéos humaines en données d'entraînement robot-centriques via des modèles de monde vidéo est envisagé depuis plusieurs mois comme une voie pour contourner ce goulot d'étranglement, notamment pour entraîner des politiques VLA. H2R-Bench montre que cette promesse reste largement non tenue en pratique : la différence morphologique entre mains humaines et effecteurs robotiques continue de casser la cohérence physique des vidéos générées. Pour les intégrateurs et laboratoires qui envisagent la génération vidéo synthétique comme substitut à la téléopération, ce résultat invite à la prudence sur la maturité réelle de cette approche. Le travail s'inscrit dans la vague plus large des modèles de monde vidéo appliqués à la robotique, où la génération vidéo sert de plus en plus de brique de simulation ou de source de données synthétiques. Jusqu'ici, l'évaluation de ces modèles se limitait souvent à la qualité visuelle brute, sans mesurer si la vidéo générée respecte les contraintes physiques et fonctionnelles d'un robot donné. H2R-Bench comble ce vide avec un cadre diagnostique systématique et réutilisable pour les futurs modèles. Il ne s'agit pas d'une annonce produit ni d'un partenariat industriel, mais d'un travail de recherche évaluative destiné à orienter la prochaine génération de modèles capables de combler l'écart d'embodiment entre humains et robots.

RecherchePaper
1 source
SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente
2arXiv cs.RO 

SC3-Eval : évaluer les modèles fondation pour la robotique via la génération vidéo auto-cohérente

Une équipe de chercheurs a publié fin juin 2026 SC3-Eval (arXiv:2606.18610), un cadre d'évaluation des politiques de manipulation robotique basé sur la génération vidéo cohérente. Le principe : plutôt que de rouler une politique en conditions réelles, un modèle fondamental vidéo pré-entraîné simule les trajectoires du robot et prédit si la tâche aboutit. SC3-Eval repose sur trois mécanismes de cohérence complémentaires. La cohérence dynamique avant-inverse entraîne simultanément le modèle à prédire les images à partir des actions et à récupérer les actions à partir des images, ancrant les rollouts à un espace d'action physiquement plausible. La cohérence multi-vue oblige le modèle à reconstruire chaque caméra depuis les autres, maintenant la cohérence spatiale sur de longs épisodes. Enfin, à l'inférence, un signal d'incertitude par chunk d'actions interrompt les rollouts dont les images générées divergent des actions demandées. Évalué sur sept politiques vision-langage-action (VLA) réelles, SC3-Eval atteint une corrélation de Pearson de 0,929 avec les résultats terrain et un MMRV de 0,119, surpassant trois baselines vidéo existantes. Ce résultat a une portée pratique immédiate : évaluer une politique de manipulation en conditions réelles est coûteux, lent et difficile à paralléliser. Un corrélat simulé à 0,929 constitue un substitut crédible pour filtrer les candidats politiques avant déploiement physique, réduisant potentiellement les cycles d'itération de plusieurs semaines à quelques heures. Fait notable, SC3-Eval reproduit fidèlement les modes d'échec observés en réel, permettant un diagnostic fin au niveau tâche plutôt qu'un classement agrégé, ce qui est plus actionnable pour un intégrateur. Le cadre se généralise par ailleurs à des tâches hors distribution d'entraînement, un point critique pour les équipes qui développent des politiques généralistes. Ce travail s'inscrit dans la vague d'adoption des modèles VLA commerciaux et de recherche, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix, OpenVLA, dont l'évaluation standardisée reste un goulot d'étranglement reconnu. Les approches alternatives passent par des simulateurs physiques classiques (MuJoCo, Isaac Sim) ou des rollouts réels coûteux ; les world models vidéo comme UniSim ou IRASim avaient amorcé cette direction mais se heurtaient à la dérive autorégressiveet à l'incohérence multi-caméras que SC3-Eval adresse directement. Le code et les données ne sont pas encore publiés au moment de la préprint, ce qui limite l'adoption immédiate. La prochaine étape logique sera de valider la méthode sur des plateformes humanoïdes à plus haute dimensionnalité, où le coût d'évaluation réelle est encore plus prohibitif.

RechercheOpinion
1 source
D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot
3arXiv cs.RO 

D3D-GEN : génération interactive de mondes 3D ancrée dans le domaine pour la robotique sociale, consciente du robot

D3D-GEN est un système de génération de mondes 3D interactifs présenté dans un article publié sur arXiv (arXiv:2608.11876v1) et conçu pour l'entraînement et la validation de robots sociaux en navigation autonome. Développé pour résoudre le compromis entre réalisme et simulabilité, le système combine un agent de recherche de domaine avec un pipeline de génération augmentée par récupération (RAG) ancré dans ce domaine. À partir d'une simple description textuelle du domaine visé, l'agent collecte automatiquement des données publiques spécifiques et construit une base de connaissances persistante, sans dépendre d'une bibliothèque fixe de modèles 3D. Le pipeline RAG interroge ensuite dynamiquement une base sémantique fournie par l'utilisateur pour générer des plans d'étage et des placements d'objets plausibles. Les mondes produits sont pleinement interactifs et compatibles avec les simulateurs Isaac Sim et Gazebo, deux outils largement utilisés en robotique. Les chercheurs ont bâti des bases de données pour trois domaines courants (résidentiel, hospitalier, bureau) et généré des dizaines d'environnements distincts pour chacun, le tout accessible via une interface web locale. Pour l'industrie robotique, cet outil s'attaque à un goulot d'étranglement concret : la pénurie d'environnements de simulation à la fois réalistes et diversifiés freine l'entraînement des politiques de navigation sociale, un maillon clé pour les robots amenés à opérer parmi des humains (hôpitaux, bureaux, domicile). En automatisant la collecte de connaissances de domaine et la synthèse de scènes plausibles sans base 3D préexistante, D3D-GEN pourrait réduire le travail manuel de conception d'environnements simulés, un frein connu à l'échelle du sim-to-real pour les intégrateurs et laboratoires de recherche en IA incarnée. Reste que la validation du réalisme et de la généralisation à d'autres domaines n'est démontrée que sur trois cas d'usage, ce qui limite pour l'instant la portée des conclusions. Ce travail s'inscrit dans la lignée des efforts récents visant à combler l'écart entre simulation et réalité pour l'IA incarnée, où des bases de données de scènes 3D figées (comme celles utilisées historiquement avec Isaac Sim ou Gazebo) limitent la diversité des scénarios d'entraînement. En s'appuyant sur des agents de recherche et du RAG plutôt que sur des bibliothèques statiques, D3D-GEN se positionne face à d'autres approches de génération procédurale de scènes pour la robotique. L'article ne précise pas de partenariats industriels ni de calendrier de déploiement au-delà du prototype de recherche présenté avec son interface web locale.

RecherchePaper
1 source
EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action
4arXiv cs.RO 

EVO-WAM : faire évoluer les modèles d'action du monde grâce à la vérification vidéo-action

Des chercheurs proposent EVO-WAM, un cadre d'adaptation de « world action models » (WAM) à des tâches inédites, sans nouvelle démonstration d'expert et sans exécuter les actions candidates dans un environnement externe. Un WAM exploite des priors vidéo à grande échelle pour prédire conjointement les vidéos futures et les actions. Le système repose sur trois briques. D'abord, l'entraînement du WAM est enrichi d'une prédiction d'état et d'un contexte multi-images ancré, ce qui permet des déroulés autorégressifs complets sans retour d'exécution. Ensuite, un modèle vision-langage sélectionne les préfixes de trajectoires où la tâche est accomplie, puis un modèle de dynamique inverse vérifie la cohérence entre vidéo et actions. Enfin, le WAM est réentraîné de façon itérative sur ces préfixes vérifiés, et de nouveaux déroulés sont générés avec le modèle mis à jour. Sur sept tâches inédites de RoboTwin 2.0, le taux de succès moyen de Cosmos3 passe de 26,9 % à 68,0 % (environ 2,5 fois), et celui de DreamZero de 28,5 % à 46,4 % (environ 1,6 fois). Sur trois tâches composites à long horizon en conditions réelles, Cosmos3 passe de 20,0 % à 76,7 %, soit un gain de 56,7 points. L'enjeu porte sur le goulot d'étranglement des démonstrations. Collecter des données d'experts par téléopération reste la principale dépense pour déployer une politique sur une nouvelle tâche. Ici, le modèle génère lui-même sa supervision, filtrée par deux vérificateurs indépendants. Le filtre par dynamique inverse cible un mode d'échec connu des WAM : une vidéo qui semble réussie peut être associée à des actions incompatibles avec elle, ce qui produit un échec à l'exécution. Le résultat suggère que l'auto-amélioration sans interaction avec l'environnement devient praticable pour ces modèles, ce qui réduirait le coût d'adaptation par tâche pour les intégrateurs. Il faut toutefois nuancer. Les gains simulés sont mesurés sur sept tâches. Le test réel ne compte que trois tâches, et le papier ne détaille pas ici le nombre d'essais, ce qui rend l'écart de 56,7 points sensible au bruit statistique. Le point de départ de 20 % en réel est aussi bas. Le papier est un preprint arXiv, non évalué par les pairs, sans déploiement industriel. Ce travail s'inscrit dans la montée des modèles monde et des politiques vision-langage-action (VLA). Ces derniers prédisent des actions directement, tandis que les WAM ajoutent une prédiction vidéo issue de modèles génératifs pré-entraînés. Cosmos3 et DreamZero servent ici de bases, et la méthode s'applique donc à plusieurs architectures. Les approches concurrentes d'amélioration sans démonstration reposent surtout sur l'apprentissage par renforcement en environnement réel ou simulé, plus coûteux en temps robot ou en fidélité de simulation. Le benchmark RoboTwin 2.0, en simulation bimanuelle, sert de référence commune. Les prochaines étapes probables sont des tests sur davantage de tâches réelles, des embodiments variés et des vérificateurs plus fiables, car la qualité du modèle vision-langage et du modèle de dynamique inverse borne ce que la boucle peut apprendre. Une page projet est disponible, mais aucun calendrier de produit n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source