Aller au contenu principal
Le modèle d'action du monde VPP2 de Robotera domine RoboDojo et atteint 58,5 % en zéro-shot sur de vrais bras ALOHA
IA physiquePandaily 

Le modèle d'action du monde VPP2 de Robotera domine RoboDojo et atteint 58,5 % en zéro-shot sur de vrais bras ALOHA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Robotera, la société robotique issue de Tsinghua, affirme que son modèle VPP2, un world action model (modèle qui prédit l'évolution visuelle de la scène avant d'en déduire les actions), occupe la première place de RoboDojo. Ce benchmark de simulation est piloté par le MMLab de l'Université de Hong Kong avec près de 20 institutions académiques. Selon QbitAI, VPP2 obtient un taux de succès moyen de 32,26 % et un score moyen de 39,26 sur les 42 tâches bimanuelles du test, qui couvre la généralisation, la manipulation de précision, les tâches longues, la mémoire et les instructions en vocabulaire ouvert. Il arrive aussi premier dans les catégories généralisation, précision et mémoire. Robotera précise que ces résultats viennent du seul jeu de données standard, sans données supplémentaires ni ajouts comme l'auto-amélioration récursive par agents. La meilleure référence citée dans son article, GPT-6-Astra en évaluation post-entraînement, atteint 22,48 % et 28,97. Sur un vrai robot bimanuel ALOHA, VPP2 totalise 58,5 % de réussite en zéro-shot sur 10 types de tâches (prise, dépose, empilement, pliage, versement), contre 40 % pour le pi0.5 de Physical Intelligence, et fait mieux sur neuf d'entre elles. Il obtient 45,0 % sur LIBERO-Pro et 63,9 % sur LIBERO-OOD. Associé à un modèle vision-langage comme planificateur de haut niveau, il fait passer certaines tâches longues de RoboDojo de 27,6 % à 57,6 %.

L'intérêt tient à la manière dont le modèle traite la faiblesse connue des world action models : quand la prédiction vidéo est fausse, l'action la suit. Robotera entraîne en trois étapes. Un pré-entraînement vidéo au niveau de l'événement, bâti sur le Wan2.1-I2V-14B open source d'Alibaba, apprend à prédire une manipulation entière à partir de clips légendés de robots, d'humains et de vidéo générale. La prédiction est ensuite limitée à des clips fixes de huit secondes et distillée en une seule étape d'environ 0,12 seconde. Enfin, un Action DiT de 0,9 milliard de paramètres convertit les prédictions en mouvements, tandis que le modèle vidéo reste gelé et ne s'adapte que par LoRA. La latence totale d'un chunk d'actions est d'environ 0,22 seconde, compatible avec un contrôle réactif. Pour les ingénieurs et intégrateurs, le résultat suggère qu'une approche fondée sur la prédiction vidéo peut dépasser des VLA de référence en zéro-shot sur matériel réel. Des réserves s'imposent toutefois : la comparaison réelle ne porte que sur dix familles de tâches et un seul concurrent, et le classement repose sur les chiffres de l'article des auteurs eux-mêmes, non sur une validation indépendante.

Le contexte est celui d'une course où chacun revendique la tête du même benchmark : Simate a annoncé le mois dernier la première place de RoboDojo pour son système Simate-beta, et les deux revendications coexistent sans arbitrage public. Côté industriel, Robotera exploite déjà des robots dans plus de dix centres logistiques répartis dans cinq provinces et municipalités chinoises, avec des partenaires dont China Post et SF Express. Cela ne signifie pas que VPP2 est déployé à grande échelle : il s'agit pour l'instant d'un résultat de recherche. Le code est publié en open source sur GitHub, ce qui permettra une reproduction externe, étape décisive pour confirmer les performances. D'autres acteurs avancent dans la même direction, comme Xiaomi avec son modèle de monde incarné Robotics-U0, également en open source, et Physical Intelligence avec la famille pi0.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Runway présente Praxis-1, un modèle du monde et d'action pour la robotique
1Robotics Business Review 

Runway présente Praxis-1, un modèle du monde et d'action pour la robotique

Runway AI, la société new-yorkaise fondée en 2018 et connue pour ses modèles génératifs vidéo, a présenté cette semaine Praxis-1, un « world action model » à poids ouverts qui convertit son pré-entraînement vidéo à grande échelle en commandes pour robots. Le modèle s'appuie sur la même base que les world models généraux de l'entreprise (GWM-1, Gen-4.5, Aleph 2.0, Act-Two) et apprend surtout à partir de vidéos filmées à la troisième personne, non de démonstrations téléopérées. Il a été entraîné sur des tâches de manipulation allant du simple pick-and-place (soulever des canettes) à la manipulation d'objets déformables (emballer des sacs cadeaux). Runway affirme que la simulation de politiques robotiques dans son world model prédit les résultats réels avec une corrélation de 0,95, mieux que des techniques plus coûteuses fondées sur la reconstruction 3D, sans publier de détails méthodologiques. Des partenaires pilotes (Noble Machines, Standard Bots et Ultra) font tourner Praxis-1 sur leur propre matériel, des bras bimanuels aux humanoïdes, avec un fine-tuning léger. La sortie publique est annoncée « dans les prochains mois », sans date. L'enjeu est de savoir si la vidéo peut remplacer, au moins en partie, la donnée robot, rare et chère à collecter. Selon Kamil Sindi, directeur technique de Runway, la performance progresse avec le volume de vidéo, de sorte que le plafond du modèle dépendrait de la quantité de vidéo disponible plutôt que du nombre de démonstrations. Si cela se confirme, le goulot d'étranglement des politiques généralistes se déplacerait de la collecte téléopérée vers le curage de données vidéo. Pour les intégrateurs, la promesse d'un modèle unique adaptable à plusieurs morphologies avec peu de fine-tuning serait un gain de coût réel. Il faut toutefois rester prudent : aucun taux de réussite, aucun temps de cycle ni aucune comparaison avec des politiques existantes n'a été publié, et les retours des partenaires sont rapportés par Runway elle-même. Le chiffre de 0,95 mesure la fidélité de la simulation, pas la performance sur site. À ce stade, il s'agit d'une annonce avec des tests partenaires, pas d'un produit livré ni d'un déploiement en production. Runway arrive en robotique depuis la vidéo générative, après GWM-1 et des modèles interactifs temps réel comme Solaris et GWM Worlds 2, conçus pour créer des environnements d'entraînement d'agents. L'entreprise, qui a des bureaux à New York, San Francisco, Seattle, Londres, Paris, Tel Aviv et Tokyo, rejoint un champ où les approches VLA (vision-langage-action) et world models se disputent le terrain, face à des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix), qui s'appuient davantage sur des données robot. Le choix des poids ouverts est assumé : Sindi y voit un levier pour que les États-Unis retrouvent leur avance industrielle, en laissant aux fabricants de matériel de la flexibilité. Les prochaines étapes sont l'élargissement du cercle de partenaires avant la sortie publique et la validation sur davantage de robots, pour combler les écarts avant la disponibilité générale. Aucun acteur français ou européen n'est cité parmi les partenaires.

UEPas d\'impact direct sur la France/UE

IA physiqueActu
1 source
Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique
2arXiv cs.RO 

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique

Des chercheurs ont déposé le 1er juin 2026 sur arXiv (réf. 2606.01027) τ₀-WM (tau-zéro World Model), une architecture unifiée vidéo-action pour la manipulation robotique. Le modèle repose sur un backbone de diffusion vidéo partagé qui intègre simultanément apprentissage de politique, prédiction vidéo et évaluation d'actions au sein d'un même cadre prédictif. Il expose deux interfaces complémentaires : un modèle d'action vidéo qui prédit conjointement des représentations visuelles latentes futures et des séquences d'actions continues à partir d'observations multi-caméras, d'instructions en langage naturel et de l'état courant du robot ; et un simulateur vidéo conditionné sur l'action, capable de dérouler des séquences candidates en projections multi-vues tout en attribuant des scores denses de progression de tâche. L'entraînement porte sur environ 27 300 heures de données combinant téléopération réelle, interactions de style UMI (Universal Manipulation Interface, protocole de collecte de données en bimanuel développé par Stanford), vidéos égocentrées humaines, et trajectoires de succès comme d'échecs. L'intérêt principal réside dans la convergence entre politique et modèle de monde au sein d'une architecture commune. Les VLA (Vision-Language-Action models) actuels génèrent des actions sans anticiper leurs conséquences, laissant la gestion des erreurs à des modules séparés. τ₀-WM introduit un mécanisme de rectification à l'inférence : le simulateur évalue chaque séquence candidate via un score dense de progression, et les candidats jugés insuffisants sont corrigés par re-débruitage. Ce test-time scaling structuré pourrait réduire les interventions humaines sur des tâches longue durée, un enjeu clé pour les intégrateurs industriels qui peinent encore à déployer des robots autonomes sur des séquences de plus de quelques étapes. Sur les benchmarks de manipulation fine et longue séquence, les auteurs déclarent surpasser les baselines comparables, sans préciser les conditions expérimentales ni les contraintes matérielles testées. Ce travail s'inscrit dans une course engagée depuis fin 2024 entre Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Figure (Helix) pour des architectures VLA à grande échelle, mais rares sont celles qui intègrent simulation interne et évaluation d'action dans un seul modèle plutôt que dans un pipeline découplé. L'usage de données UMI signale une stratégie d'agrégation multi-source qui dépasse les corpus propriétaires et pourrait favoriser la généralisation à de nouveaux environnements. Le papier reste pour l'instant un preprint non soumis à revue par les pairs : les performances annoncées restent à valider sur robot physique en conditions réelles, et aucune date de déploiement ou partenariat industriel n'est mentionné.

IA physiqueOpinion
1 source
Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions
3arXiv cs.RO 

Modèle vision-langage-action pour la modélisation du monde, le raisonnement et la synthèse d'actions

Des chercheurs présentent WLA (World-Language-Action), une nouvelle classe de modèles de fondation incarnés pour la robotique, dans un preprint arXiv publié début juin 2026. Le modèle prototype WLA-0, fort de 2 milliards de paramètres actifs, prend en entrée des instructions textuelles, des images et l'état du robot pour générer simultanément des sous-tâches textuelles, des images de sous-objectifs et des commandes motrices. Sur l'NVIDIA RTX 5090, le temps d'inférence est de 40 ms par cycle, ce qui reste dans les plages acceptables pour le contrôle temps réel. Les évaluations atteignent 92,94 % de taux de succès sur le benchmark RoboTwin2.0 Clean et 56,5 % sur RMBench, deux protocoles de référence pour les tâches multi-objets et longue portée. L'intérêt architectural réside dans la fusion de deux paradigmes jusqu'ici distincts : le world modeling, qui consiste à apprendre une représentation prédictive du monde à partir de vidéos égocentrées, et le language reasoning propre aux modèles VLA (Vision-Language-Action) tels que Pi-0 ou OpenVLA. WLA opte pour un backbone Transformer autorégressif plutôt que le Transformer de diffusion bidirectionnel utilisé dans les WAM (World-Action Models), ce qui permet de prédire l'état suivant en deux niveaux complémentaires : intention sémantique textuelle d'un côté, dynamiques physiques fines de l'autre. Un mécanisme de meta-queries rend l'influence du world modeling implicite à l'inférence, mais peut être activé pour du test-time scaling, technique qui améliore le contrôle en allouant davantage de calcul à l'exécution. La capacité annoncée d'apprendre de nouvelles tâches à partir de vidéos cross-embodiment sans annotations d'actions est notable, mais reste à valider sur des robots hétérogènes en dehors d'environnements simulés. WLA s'inscrit dans une course dense à l'unification des modèles robotiques. Face à Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui misent chacun sur des architectures diffusion ou VLA, WLA propose une troisième voie autoregressive combinant génération de sous-objectifs visuels et raisonnement linguistique. L'article reste un preprint non validé par les pairs, sans déploiement industriel annoncé. Les prochaines étapes naturelles seraient une évaluation sur des plateformes physiques variées et des benchmarks réels, les performances simulées étant connues pour surestimer les capacités en conditions d'exploitation. Aucun acteur européen n'est impliqué dans ces travaux.

IA physiqueOpinion
1 source
Les modèles d'action du monde généralisent-ils mieux que les VLA ? Une étude sur la robustesse
4arXiv cs.RO 

Les modèles d'action du monde généralisent-ils mieux que les VLA ? Une étude sur la robustesse

Une étude publiée sur arXiv (référence 2603.22078) compare les performances de deux familles d'architectures pour la planification d'actions robotiques : les modèles vision-langage-action (VLA), aujourd'hui dominants dans la recherche, et les world action models (WAM), une approche plus récente fondée sur la prédiction d'états futurs. Les chercheurs ont soumis plusieurs systèmes à des perturbations visuelles et linguistiques sur deux bancs d'essai standardisés, LIBERO-Plus et RoboTwin 2.0-Plus. Les résultats chiffrés montrent que LingBot-VA, un WAM, atteint 74,2 % de taux de succès sur RoboTwin 2.0-Plus, tandis que Cosmos-Policy, développé dans l'écosystème NVIDIA, obtient 82,2 % sur LIBERO-Plus. Le VLA pi-0.5, produit par Physical Intelligence, parvient à des niveaux de robustesse comparables sur certaines tâches, mais au prix d'un entraînement sur des jeux de données robotiques très diversifiés et avec des objectifs d'apprentissage multiples. L'enjeu central de cette comparaison est la généralisation hors distribution : les systèmes robotiques déployés en environnement industriel réel rencontrent des variations d'éclairage, de fond visuel et de formulations d'instructions que leurs données d'entraînement ne couvrent pas. Les WAM tirent leur robustesse de préentraînements massifs sur des vidéos web, qui leur confèrent des priors spatiotemporels sur la dynamique du monde physique. L'étude confirme que cette capacité de prédiction explicite des états futurs améliore effectivement la tenue aux perturbations, sans nécessiter autant de données de démonstration robotique que les VLA. Elle identifie également une classe intermédiaire, les approches hybrides qui intègrent partiellement la prédiction vidéo, et montre qu'elles obtiennent une robustesse intermédiaire, soulignant que la manière d'intégrer ces priors vidéo est aussi importante que leur présence. Les VLA comme pi-0 et pi-0.5 (Physical Intelligence), OpenVLA ou RoboVLMs ont dominé la recherche en manipulation robotique depuis 2023, profitant de la maturité des grands modèles vision-langage. Les WAM s'inscrivent dans un courant plus récent, porté notamment par NVIDIA avec sa famille Cosmos et par plusieurs laboratoires académiques, qui revisitent les world models comme substrat d'action plutôt que comme outil de simulation. Cette étude apporte une validation empirique contrôlée à une hypothèse jusqu'ici surtout théorique, et devrait peser dans les choix d'architecture pour les prochaines générations de systèmes robotiques polyvalents, notamment dans les contextes industriels où la robustesse aux variations non anticipées est un critère de qualification prioritaire.

IA physiqueOpinion
1 source