Aller au contenu principal
Video2World : un banc d'essai d'agents de code pour la modélisation interactive du monde à partir de vidéos incarnées
RecherchearXiv cs.RO 

Video2World : un banc d'essai d'agents de code pour la modélisation interactive du monde à partir de vidéos incarnées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie Video2World, un benchmark qui teste si des agents de code adossés à des modèles de fondation peuvent transformer une vidéo embodied en simulateur interactif, sans intervention humaine. La tâche, baptisée « vidéo-to-simulation autonome », est posée comme un problème d'ingénierie logicielle. L'agent observe une vidéo de démonstration (robot ou humain), construit l'environnement simulé et le comportement du robot correspondants, puis affine le résultat grâce au retour d'exécution. Le benchmark compte 222 instances de reconstruction issues de 189 vidéos. Il note les mondes reconstruits selon trois axes : la fidélité géométrique (perception spatiale), la fidélité dynamique (raisonnement physique) et la justesse fonctionnelle (capacité à exécuter une interaction). Neuf systèmes d'agents de code de pointe ont été évalués. Le taux de réussite de la tâche passe de moins de 5 % à plus de 15 % à partir de Claude Opus 5. L'écart avec une reconstruction assistée par des humains reste important.

L'enjeu est direct pour quiconque produit des données d'entraînement pour la robotique. Aujourd'hui, construire un environnement de simulation à partir d'observations réelles demande beaucoup de travail manuel, de modélisation de scène et de calibration. C'est un goulot d'étranglement pour passer à l'échelle des données embodied, par exemple pour entraîner des politiques VLA (vision-langage-action) ou générer des jeux de test reproductibles. Le saut observé suggère que les capacités de génie logiciel agentique commencent à toucher ce problème, mais un taux de succès d'environ 15 % reste très loin d'un pipeline industriel fiable. Le résultat le plus instructif est ailleurs : les mondes qui paraissent meilleurs ne fonctionnent pas forcément mieux, et une fidélité visuelle accrue ne garantit pas un meilleur taux de réussite. Cela rappelle l'écart, déjà connu avec les modèles génératifs, entre réalisme perceptif et exactitude factuelle. Pour les équipes qui évaluent des « world models » ou des simulateurs générés, juger sur le rendu est donc un mauvais indicateur, et il faut mesurer la dynamique et l'exécution.

Ce travail s'inscrit dans la course à l'automatisation de la création de simulateurs, où se croisent les modèles de monde génératifs vidéo, les pipelines de reconstruction 3D et les approches « real-to-sim » encore très manuelles. Le choix de cadrer le problème comme une tâche d'agent de code, avec boucle d'exécution et correction, déplace la question de la génération de pixels vers la production de code de simulation exécutable. Il s'agit d'une publication académique sur arXiv (v2) et non d'un produit livré : aucun déploiement industriel ni acteur européen n'est mentionné dans le résumé. Les suites probables sont l'évaluation de nouveaux agents sur le benchmark, la mesure de l'écart restant avec les humains et, à terme, l'usage de ces mondes reconstruits pour générer des données d'entraînement. La preuve que ces mondes améliorent réellement des politiques robotiques reste à apporter.

À lire aussi

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde
1arXiv cs.RO 

Apprentissage natif de prior d'action à partir de vidéos pour les modèles d'action du monde

Des chercheurs publient sur arXiv (2610.03391) NAVA-WAM, un « world action model » (WAM) qui apprend une politique d'action directement à partir de vidéos sans annotation d'actions. Un WAM combine la prédiction de la dynamique visuelle future et celle des actions du robot. Jusqu'ici, ces modèles dépendaient de trajectoires robotiques annotées avec les actions, rares et coûteuses à collecter. NAVA-WAM s'entraîne en deux étapes. Le pré-entraînement porte sur des vidéos d'observation seule : une supervision par flow matching sur les transitions visuelles futures est propagée, via une attention jointe structurée par transitions, jusqu'à l'Action-DiT, le module de diffusion qui produit les actions. Celui-ci acquiert ainsi des « priors » d'action. La seconde étape affine l'Action-DiT sur des démonstrations étiquetées par un flow matching conjoint vidéo-action. Une attention asymétrique découple la branche visuelle du débruitage itératif des actions, ce qui permet une inférence rapide, limitée aux actions. Les auteurs affirment de meilleurs résultats que les approches antérieures, en distribution comme hors distribution, une bonne efficacité en nombre d'étiquettes d'action et une généralisation sur robot réel. Le résumé ne fournit ni score chiffré, ni liste de tâches, ni nom de plateforme robotique. L'enjeu est celui du goulot d'étranglement des données. Les modèles vision-langage-action (VLA) et leurs variantes à modèle de monde se heurtent au coût de la téléopération. Les vidéos humaines ou robotiques sans étiquettes, elles, existent en grande quantité. Les méthodes actuelles les exploitent par deux voies indirectes : pré-entraîner des représentations visuelles qu'il faut ensuite adapter au contrôle, ou inférer des « actions latentes » à ancrer ensuite sur des commandes robot. NAVA-WAM supprime ces intermédiaires, ce qui limiterait les pertes de transfert et la complexité d'un modèle d'action latente séparé. Si le résultat tient à grande échelle, le volume de données robotiques annotées nécessaires pour une nouvelle tâche ou un nouvel embodiment pourrait baisser. Un intégrateur pourrait alors réutiliser des vidéos de ses propres lignes. Prudence toutefois : il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent à confirmer par des benchmarks indépendants, avec des détails sur la quantité de vidéos et la diversité des tâches réelles testées. Ce travail s'inscrit dans la course aux WAM et aux politiques apprises de vidéo, face aux VLA entraînés sur démonstrations (Pi-0, GR00T) et aux approches par actions latentes. Les prochaines étapes à surveiller sont la publication du code et des poids, des évaluations sur des corpus vidéo plus larges, et une comparaison directe avec les modèles de fondation industriels. Les auteurs ne signalent aucun partenaire industriel ni déploiement.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée
2arXiv cs.RO 

EmbodiedGen V2 : un moteur de monde 3D à base d'agents, prêt pour la simulation, pour l'IA incarnée

Une équipe de recherche a publié EmbodiedGen V2 sur arXiv (2607.07459v1), un moteur génératif de mondes 3D destiné à produire des environnements de simulation directement exploitables pour l'entraînement de robots. Le problème visé est concret : générer des assets 3D "sim-ready" est devenu rapide, mais les assembler en environnements de tâches réellement utilisables pour l'apprentissage reste largement manuel, ce qui limite le passage à l'échelle de l'apprentissage en boucle fermée. EmbodiedGen V2 propose une représentation unifiée qui relie assets compatibles multi-simulateurs, affordances d'interaction, mondes orientés tâches, scènes multi-pièces à grande échelle, et un système de "Vibe Coding" avec état, le tout dans un pipeline génératif, éditable et réutilisable. Les environnements produits couvrent la manipulation, la navigation, la manipulation mobile, le déploiement cross-simulateur et l'entraînement de politiques robotiques. Sur le plan chiffré, le pipeline de génération d'assets atteint 96,5% d'acceptation humaine et 98,6% de réussite de détection de collisions, et 83,3% des mondes orientés tâches sont directement utilisables en simulation sans retouche manuelle. L'intérêt principal tient aux résultats de transfert obtenus grâce à ces environnements générés. Un entraînement par renforcement en ligne fait passer le taux de succès en simulation de 9,7% à 79,8%, et ces gains se transfèrent à des robots réels avec un taux de succès en tâche réelle passant de 21,7% à 75,0%. Pour un secteur où l'écart entre démonstration simulée et comportement réel reste un obstacle majeur à la commercialisation de robots humanoïdes ou mobiles pilotés par des politiques apprises, ce type de résultat constitue un argument concret en faveur de la génération procédurale de mondes comme infrastructure d'entraînement, plutôt qu'une simple preuve de concept de génération d'assets visuels. Le travail s'inscrit dans la lignée des efforts récents de génération de scènes 3D et d'assets simulables pour l'IA incarnée, où la difficulté ne portait plus tant sur la qualité visuelle des objets générés que sur leur intégration fonctionnelle dans des tâches robotiques complètes et transférables entre simulateurs. Le papier ne mentionne pas de partenariat industriel ni de déploiement sur robot commercial identifié, et se positionne comme une contribution d'infrastructure de recherche, dont l'adoption dépendra de sa reproductibilité et de son intégration par d'autres laboratoires travaillant sur l'apprentissage par renforcement pour la robotique.

RechercheActu
1 source
Zero-WAM : modélisation monde-action en contexte à partir de vidéos humaines pour la généralisation de tâches ouvertes
3arXiv cs.RO 

Zero-WAM : modélisation monde-action en contexte à partir de vidéos humaines pour la généralisation de tâches ouvertes

Des chercheurs présentent Zero-WAM, un modèle causal vidéo-action qui exécute des tâches de manipulation robotique inédites en suivant une simple vidéo humaine donnée en contexte, sans réentraînement, sur le principe de l'apprentissage en contexte des grands modèles de langage. Pour pallier le manque de données appariées humain-robot, ils ont construit un pipeline automatique générant HumanGen, 74 200 paires vidéo sur 8 600 tâches, avec un nouvel objectif d'entraînement dit IFP (prédiction de segments futurs en contexte). Sur sept tâches inédites du simulateur RoboTwin 2.0, le modèle atteint 47,0% de réussite, soit +29,5 points face à la meilleure base vidéo-action comparée, et des essais réels montrent une généralisation à des scènes multi-objets et à des insertions fines. L'article, publié sur arXiv (2608.26103), reste une contribution académique sans produit ni partenaire industriel annoncé. L'enjeu dépasse la performance brute : la plupart des modèles vision-langage-action doivent être réentraînés ou finement ajustés pour chaque nouvelle tâche, ce qui alourdit les coûts d'intégration industrielle. En montrant qu'une vidéo de démonstration peut servir de consigne à la volée, Zero-WAM propose une alternative au conditionnement par le langage utilisé par des approches comme Pi-0 ou GR00T N2, et suggère une piste pour réduire la dépendance aux collectes de démonstrations spécifiques par tâche. Le résultat mérite toutefois d'être nuancé : un taux de réussite de 47% reste modeste en absolu, et l'essentiel de la validation chiffrée se fait en simulation, les essais réels n'étant pas quantifiés dans l'abstract. L'apprentissage en contexte, popularisé par les grands modèles de langage généralistes, se heurtait en robotique à la rareté de vidéos humaines et robotiques appariées, problème que ce travail attaque via son pipeline HumanGen. Il se positionne face à l'écosystème des modèles vision-langage-action généralistes tels Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent davantage sur le langage que sur la vidéo comme consigne. Aucun acteur français ou européen n'apparaît dans cette publication, et les auteurs ne fournissent ni pilote industriel ni feuille de route de commercialisation.

RecherchePaper
1 source
Au-delà du placement et de l'articulation : des scènes de code pilotées par l'usage pour l'interaction incarnée
4arXiv cs.RO 

Au-delà du placement et de l'articulation : des scènes de code pilotées par l'usage pour l'interaction incarnée

Des chercheurs présentent RoomWright dans un preprint arXiv (2608.18840v1, catégorie "new", diffusé fin août 2026), un framework agentique de génération de scènes 3D d'intérieur entièrement représentées sous forme de code pour l'interaction incarnée. Le système effectue un raisonnement d'objets piloté par l'usage : chaque point d'ancrage de la scène est traité comme un centre de tâche autour duquel sont ajoutés les objets requis et leurs affordances. Un agent de code compile ensuite chaque interaction en une règle trigger-condition-effet qui met à jour des états d'objets structurés, capturant les dépendances causales entre eux, par exemple ouvrir un meuble avant d'en extraire un objet. Pour lever l'ambiguïté d'orientation des objets manipulables, difficile à déduire de simples pixels, la méthode s'appuie sur une orientation guidée par l'usage et informée par annotation. Les auteurs indiquent avoir mené des expériences extensives validant l'approche, produisant des scènes exécutables, éditables et directement utilisables en simulation. Les méthodes existantes de génération de scènes par code produisent certes des environnements éditables, mais restent focalisées sur la construction visuelle et l'articulation au niveau objet, laissant l'usage fonctionnel des scènes largement non modélisé, un manque que RoomWright cible directement. Pour l'entraînement de modèles vision-langage-action (VLA) tels que Pi-0, GR00T N2 ou Helix, disposer de scènes encodant non seulement le placement des objets mais aussi leurs règles d'usage et leurs dépendances causales représente un enjeu concret : cela permet de générer automatiquement des tâches de manipulation multi-étapes cohérentes, sans scénarisation manuelle systématique. L'approche s'adresse ainsi directement au fossé entre démonstrations statiques et environnements de simulation réellement exploitables pour l'apprentissage de politiques, un point sensible pour les équipes robotique qui peinent à produire des données d'entraînement diversifiées et causalement cohérentes à grande échelle. RoomWright s'inscrit dans la lignée des travaux récents combinant grands modèles de langage et génération de code pour la synthèse procédurale de scènes 3D destinées à l'IA incarnée, à la manipulation robotique et à l'apprentissage de politiques par simulation, un champ où les publications se sont multipliées depuis l'essor des VLA. Le papier, publié en preprint sur arXiv sans mention d'acteur français ou européen, reste à ce stade une contribution de recherche et non un produit déployé : aucune date de mise à disposition du code source ni de jeu de données n'est précisée. Les auteurs présentent les résultats comme une démonstration de faisabilité plutôt qu'un système prêt à l'emploi, la suite logique étant une intégration dans des pipelines de simulation existants pour la robotique de manipulation.

RecherchePaper
1 source