Aller au contenu principal
AnyWorld : des modèles du monde égocentriques factorisés pour généraliser entre différents robots
IA physiquearXiv cs.RO 

AnyWorld : des modèles du monde égocentriques factorisés pour généraliser entre différents robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 29 août 2026 sur arXiv (2608.29242v1) un système baptisé AnyWorld, un modèle de « world modeling » conçu pour transférer l'expérience physique captée dans des vidéos humaines égocentriques vers des robots de morphologies différentes. Le principe consiste à décomposer chaque interaction humaine en trois axes contrôlables séparément : le mouvement, la trajectoire de caméra, et le corps agissant (l'embodiment), afin de régénérer, à partir d'une seule vidéo humaine, de multiples séquences vidéo-action « robot-natives » sans démonstrations appariées homme-robot. Le modèle est entraîné en deux temps : un pré-entraînement à grande échelle sur des vidéos d'interactions humaines, suivi d'un fine-tuning sur données mixtes multi-embodiment. Les auteurs valident l'approche sur deux terrains, le benchmark de manipulation de table RoboCasa avec le robot simulé GR1, et un robot humanoïde réel nommé IRON, sur lequel les données générées par AnyWorld améliorent les performances de manipulation.

Cette contribution vise directement le goulot d'étranglement le plus cité en apprentissage robotique : la collecte à l'échelle d'expériences de manipulation riches en contacts physiques, coûteuse en téléopération et limitée en diversité d'environnements, de points de vue et de corps robotiques. En démontrant qu'une seule vidéo humaine peut être recomposée en données d'entraînement pour plusieurs embodiments et scènes tout en préservant la dynamique physique et les interactions avec les objets, AnyWorld s'attaque à un maillon faible des politiques VLA (vision-language-action) : la rareté de données réelles multi-robots. Le résultat le plus notable pour le secteur n'est pas le gain agrégé de performance mais une expérience contrôlée sur IRON, montrant que corriger un biais de complétion prématurée du modèle et ancrer la sélection spatiale de cible dans le langage nécessite à la fois un recalibrage de l'action et une recomposition visuelle ; une intervention limitée à l'action seule échoue à apprendre ce second comportement de façon fiable. Cela nuance l'hypothèse répandue selon laquelle corriger l'action suffit à combler un écart de politique.

AnyWorld s'inscrit dans la lignée des modèles du monde vidéo appliqués à la robotique, un courant de recherche qui exploite la masse de vidéos humaines disponibles en ligne pour compenser la pénurie de données de téléopération, dans le sillage d'efforts autour de politiques VLA généralistes comme Pi-0 ou GR00T N2. Contrairement à ces systèmes orientés contrôle direct, AnyWorld se positionne en amont, comme une brique de génération de données capable d'alimenter l'entraînement de plusieurs types de robots à partir d'un même corpus vidéo humain. Il s'agit à ce stade d'une publication de recherche déposée sur arXiv, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement commercial : les résultats reposent sur un seul robot humanoïde réel et un benchmark simulé, sans essai pilote à plus grande échelle annoncé pour l'instant. Les auteurs évoquent comme suite logique l'extension du nombre d'embodiments couverts et la validation sur des tâches de manipulation plus complexes.

À lire aussi

HaWMPO : optimisation de politique par modèle du monde conscient des hallucinations pour robots généralistes
1arXiv cs.RO 

HaWMPO : optimisation de politique par modèle du monde conscient des hallucinations pour robots généralistes

Des chercheurs présentent HaWMPO (Hallucination-aware World Model-based Policy Optimization), une méthode de post-entraînement pour les politiques génératives robotiques de type Visual-Language-Action (VLA), décrite dans un article publié le 9 septembre 2026 (arXiv:2609.09941). Le problème visé : entraîner ces politiques par apprentissage par renforcement en ligne directement sur robot réel coûte cher, consomme beaucoup d'interactions physiques et présente des risques matériels et de sécurité. L'alternative, l'usage de "world models" pour simuler des trajectoires imaginées, souffre elle-même d'hallucinations lors de prédictions à long horizon, ce qui biaise les transitions d'état et dégrade l'apprentissage. HaWMPO introduit un modèle conditionné par l'action qui estime la fiabilité des séquences d'images générées, puis injecte ce score d'hallucination dans une optimisation de politique par comparaison de groupe (group relative policy optimization), via un mécanisme "Reward-Soft" qui pénalise les segments d'action jugés peu fiables. Sur le benchmark LIBERO, la méthode obtient le meilleur taux de réussite moyen, avec un gain de 15,0 points par rapport au modèle de base et 2,8 points par rapport à la meilleure méthode concurrente testée. En conditions réelles, sur un robot humanoïde Unitree G1, le taux de réussite moyen sur deux tâches de manipulation passe de 67,5% à 80,0%. Pour l'industrie robotique, ce travail s'attaque directement à un goulot d'étranglement connu des politiques VLA génralistes : leur bon comportement en zero-shot ne se traduit pas en fiabilité sur des tâches longues et complexes, et le raffinement par renforcement réel reste trop coûteux pour être industrialisé. En démontrant qu'un world model peut servir de terrain d'entraînement simulé à condition de filtrer ses propres hallucinations, l'étude apporte un élément concret au débat sur la viabilité du sim-to-real pour les VLA à grande échelle, sans prétendre le résoudre entièrement puisque les gains restent mesurés sur un nombre limité de tâches. HaWMPO s'inscrit dans la lignée des politiques génralistes récentes comme Pi-0, GR00T N2 ou Helix, qui cherchent à généraliser la manipulation robotique au-delà de tâches uniques entraînées spécifiquement. Le choix du G1 de Unitree comme plateforme d'essai réel confirme son adoption croissante comme banc de test académique pour la manipulation bimanuelle. L'article ne mentionne ni acteur français ou européen, ni feuille de route de déploiement industriel ; il s'agit à ce stade d'une contribution de recherche évaluée sur benchmark et sur un nombre restreint d'expériences réelles, sans indication de calendrier vers une intégration commerciale.

IA physiqueActu
1 source
RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique
2arXiv cs.RO 

RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique

Des chercheurs (l'article ne précise pas d'affiliation institutionnelle dans le résume) publient sur arXiv, le 7 juillet 2026, RynnWorld-4D, un modèle génératif de monde en 4D pour la manipulation robotique. Le système produit simultanément, a partir d'une seule image RGB-D et d'une instruction en langage naturel, des images RGB futures, des cartes de profondeur et des flux optiques, le tout dans un unique processus de diffusion. Son architecture a trois branches combine attention cross-modale et RoPE 3D image par image pour que l'apparence visuelle, la géométrie et le mouvement évoluent de manière cohérente. Pour l'entrainer, les auteurs ont constitue Rynn4DDataset 1.0, un jeu de données de plus de 254,4 millions d'images issues de vidéos de manipulation, a la fois humaines en vue égocentrique et robotiques, avec des pseudo-étiquettes de profondeur et de flux optique. Un module dérivé, RynnWorld-4D-Policy, exploite directement les représentations internes du modèle en un seul passage avant, sans les étapes couteuses de debruitage itératif, pour générer des actions robotiques en boucle fermée. L'intérêt de cette approche tient a l'hypothèse qu'elle teste: en combinant RGB, profondeur et flux optique plutôt qu'en travaillant sur de simples pixels 2D, la représentation obtenue se rapprocherait davantage des commandes bas niveau de l'effecteur, réduisant l'écart classique entre prédiction du monde et apprentissage de politique. Sur des taches réelles de manipulation bimanuelle dextérité, les auteurs rapportent des résultats a l'état de l'art, en particulier sur les taches exigeant précision spatiale et coordination temporelle, deux points ou les approches VLA généralistes butent souvent en conditions réelles. Il s'agit pour l'instant d'un travail de recherche publie en preprint, sans déploiement industriel ni produit commercialise. Il s'inscrit dans la lignée des modèles de monde appliques a la robotique, aux cotes d'approches comme GR00T N2 ou Pi-0, mais mise sur une fusion multimodale plus riche et un passage a l'échelle des données d'entrainement. Les prochaines étapes attendues concernent la généralisation a d'autres plateformes robotiques et la validation hors des benchmarks contrôles du laboratoire.

IA physiqueActu
1 source
WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable
3arXiv cs.RO 

WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable

Les chercheurs à l'origine de WSA₁ proposent un nouveau modèle fondation pour la robotique généraliste, construit autour d'un paradigme baptisé "World-Spatial-Action" centré sur la 3D. Contrairement aux modèles robot-fondation (RFM) classiques qui associent directement perception visuelle 2D et instructions langagières à des actions continues, WSA₁ apprend une représentation explicite de l'état spatial 3D du monde et de ses transitions, puis relie ces transitions aux actions du robot. Le modèle a été préentraîné sur 6 000 heures de démonstrations expertes, dont seulement 1 000 heures issues de robots réels, le reste provenant de sources simulées ou synthétiques. Sur le benchmark de simulation RoboTwin2.0, WSA₁ atteint un taux de réussite de 93% en manipulation, et sur des tâches de contrôle robotique en conditions réelles il affiche un gain moyen de 20% par rapport aux meilleurs RFM existants. L'enjeu pour l'industrie robotique est la sobriété en données réelles. La plupart des modèles fondation actuels, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, dépendent de volumes massifs de téléopération et de collecte sur robots physiques, une contrainte coûteuse qui freine leur déploiement à grande échelle chez les intégrateurs. En démontrant qu'une modélisation conjointe 3D monde-action permet d'atteindre une généralisation compétitive avec un ratio de données réelles très faible, WSA₁ ouvre une voie potentiellement plus abordable vers des systèmes robotiques polyvalents, sans nécessiter les flottes de collecte massives déployées par des acteurs comme Figure ou Tesla pour leurs humanoïdes. Ce travail s'inscrit dans la lignée des critiques adressées aux RFM actuels, accusés de manquer d'un raisonnement physique réel sur la dynamique 3D et les effets causaux des actions du robot sur son environnement, un décalage jugé limitant pour la généralisation en conditions réelles. Les auteurs positionnent explicitement WSA₁ face aux modèles VLA (vision-language-action) de référence du secteur. La publication, encore au stade de préprint arXiv, ne détaille pas de calendrier de déploiement industriel ni de partenariat matériel, les prochaines étapes attendues portant vraisemblablement sur une validation élargie hors simulation et sur des comparaisons directes avec davantage de RFM concurrents.

IA physiqueActu
1 source
ExoActor : génération de vidéos exocentriques pour le contrôle généralisable d'humanoïdes interactifs
4arXiv cs.RO 

ExoActor : génération de vidéos exocentriques pour le contrôle généralisable d'humanoïdes interactifs

Un framework de contrôle humanoïde baptisé ExoActor a été publié en preprint sur arXiv (2604.27711, avril 2026) par une équipe proposant d'utiliser la génération vidéo en vue tierce comme interface unifiée de commande robotique. Le principe : à partir d'une instruction textuelle et du contexte visuel de la scène, ExoActor génère une vidéo synthétique d'exécution plausible, extrait les cinématiques humaines correspondantes, puis les transmet à un contrôleur de mouvement généraliste pour produire une séquence comportementale exécutable. Le pipeline complet, implémenté de bout en bout, est évalué sur des scénarios inédits sans collecte additionnelle de données réelles. L'intérêt de l'approche réside dans la manière dont elle attaque un verrou central du contrôle humanoïde : modéliser des comportements riches en interactions entre le robot, son environnement et les objets manipulés, tout en capturant simultanément contexte spatial, dynamiques temporelles et intention de tâche. Plutôt qu'un VLA classique mappant directement observations vers actions, ExoActor intercale une représentation vidéo comme espace latent intermédiaire, dont la capacité de généralisation provient de grands modèles vidéo pré-entraînés à l'échelle. Si les résultats de généralisation sont confirmés sur des benchmarks indépendants, cela ouvrirait une alternative sérieuse à la collecte coûteuse de données de téléopération que supportent actuellement des acteurs comme Figure AI, Agility Robotics ou 1X Technologies. Cette publication s'inscrit dans un courant cherchant à court-circuiter les démonstrations réelles via des modèles génératifs. Elle dialogue avec Pi-0 de Physical Intelligence (diffusion sur flux d'actions), GR00T N2 de NVIDIA (entraîné sur données humaines synthétiques et réelles), ainsi qu'avec UniSim et IRASim qui utilisent la synthèse vidéo comme simulateur de politique. La spécificité d'ExoActor est l'usage explicite d'une perspective exocentrique, vue tierce personne, là où d'autres approches travaillent en vue égocentrique. Les auteurs reconnaissent les limitations actuelles, notamment la qualité de l'estimation de mouvement humain à partir de vidéo synthétique. Aucun déploiement industriel ni partenariat commercial n'est annoncé : ExoActor reste à ce stade une contribution académique.

IA physiqueOpinion
1 source