Aller au contenu principal
InternW0-Δ : un modèle monde-action reliant dynamique prédictive et actions avec plus de 20 000 heures de données ouvertes
IA physiquearXiv cs.RO 

InternW0-Δ : un modèle monde-action reliant dynamique prédictive et actions avec plus de 20 000 heures de données ouvertes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du projet InternRobotics, rattaché au laboratoire chinois Shanghai AI Laboratory (dont dépend la série de modèles Intern), publient sur arXiv (2609.31394v1) InternW0-Δ, un "World Action Model" qui unifie prédiction visuelle et génération d'actions pour la manipulation robotique générale. L'architecture repose sur un cadre Mixture-of-Transformers combinant un expert vidéo et un expert action, guidés sémantiquement par un VLM gelé, auxquels s'ajoutent des a priori géométriques et de mouvement 4D injectés par distillation depuis un modèle fondation 4D préentraîné. Un mécanisme baptisé Causal Imprint apprend, pendant l'entraînement seulement, à anticiper les changements de scène pertinents et fournit ces représentations prédictives à l'expert action sans qu'il soit nécessaire de générer une vidéo future complète au moment de l'inférence. Le modèle est préentraîné sur un corpus hétérogène de plus de 20 000 heures de données, mêlant démonstrations robotiques, données UMI, démonstrations humaines à la première personne et données Ego2Robot, alignées sous une représentation état-action commune. Les auteurs annoncent des performances supérieures aux méthodes existantes sur des benchmarks de simulation et sur plateformes robotiques réelles, et prévoient d'ouvrir le code d'entraînement, les poids, l'infrastructure et le pipeline de traitement de données, sous réserve des licences applicables.

L'intérêt de ce travail tient moins à un déploiement industriel qu'à une proposition architecturale: fusionner prédiction du monde et politique d'action dans un seul modèle, plutôt que d'enchaîner un générateur vidéo et un contrôleur séparés, tout en évitant le coût d'inférence habituel des rollouts vidéo futurs, un goulot d'étranglement connu des approches type modèle du monde. Si le corpus de 20 000 heures est effectivement publié en open source, il représenterait une ressource de référence dans un domaine où les grands jeux de données de manipulation (type Open X-Embodiment) restent souvent plus restreints ou fermés, avec un impact direct pour les intégrateurs et laboratoires cherchant à entraîner des politiques VLA sans dépendre des corpus propriétaires. Ces résultats restent toutefois auto-rapportés, issus d'un article non encore évalué par les pairs, et les comparaisons de benchmarks méritent d'être prises avec prudence.

InternW0-Δ se positionne face aux modèles VLA actuels de l'industrie tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui traitent généralement perception, prédiction et action de façon plus découplée. Aucun acteur français ou européen n'est mentionné dans cette publication. Le statut reste celui d'une publication de recherche: aucune date précise d'ouverture du code ni de pilote industriel n'est annoncée, seule une intention de publication progressive selon les licences des données utilisées.

Impact France/UE

Si le corpus de plus de 20 000 heures est effectivement publié en open source, il pourrait bénéficier aux intégrateurs et laboratoires européens entraînant des modèles VLA sans dépendre de données propriétaires, mais aucun acteur français ou européen n'est impliqué dans cette publication.

À lire aussi

InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel
1arXiv cs.RO 

InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel

Shanghai AI Laboratory a publié le 24 septembre 2026 sur arXiv (2609.27656) InternW0, premier modèle de sa série InternW dédiée à la modélisation du monde physique. L'architecture associe un expert vidéo lourd, qui prédit la dynamique visuelle à long horizon, et un expert d'action léger cadencé plus vite, entraînés conjointement par flow matching ; plutôt que de tout recalculer à chaque action, le modèle réutilise ses caches clé/valeur et les met à jour selon les nouvelles observations. Des interfaces par domaine gèrent les morphologies robotiques hétérogènes, complétées par un post-entraînement sensible au contact exploitant force et tactile. L'entraînement mobilise 7 200 heures de données robot et égocentriques, dont EgoLab (275 heures, laboratoire réel), et les tests réels incluent une synthèse de charpentes métallo-organiques en 15 étapes et un pipetage dextre en 5 étapes sensible au contact. L'enjeu pour les intégrateurs tient à l'efficacité : la plupart des modèles vision-langage-action recalculent une passe complète à chaque étape de contrôle, ce qui plafonne la fréquence de commande utilisable, alors que la réutilisation du cache clé/valeur d'InternW0 vise justement ce goulot d'étranglement. Le choix de tâches scientifiques (chimie, pipetage) plutôt que la manipulation domestique privilégiée par la plupart des démonstrations humanoïdes déplace la preuve vers un usage B2B vérifiable en laboratoire et dans l'industrie pharmaceutique ou des matériaux, où comptent la répétabilité et la sensibilité au contact plus que la polyvalence spectaculaire. Le texte reste un preprint, sans taux de réussite chiffré ni preuve de généralisation au delà de ces scénarios. InternW0 prolonge la famille Intern de Shanghai AI Laboratory, déjà connue pour InternLM (langage) et InternVL/InternVideo (multimodal), vers la modélisation du monde physique et le contrôle robotique. Il se positionne face aux modèles vision-langage-action généralistes d'autres laboratoires, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, avec une orientation explicitement scientifique plutôt que domestique. Aucun déploiement commercial n'est annoncé : le papier, classé comme nouvelle publication arXiv, décrit une preuve de concept validée en simulation et sur un nombre restreint de scénarios réels, sans calendrier communiqué pour une ouverture du modèle ou du jeu de données EgoLab.

IA physiqueOpinion
1 source
À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique
2Robotics Business Review 

À l'intérieur de XRZero-G0, un nouveau jeu de données ouvert de 2 000 heures pour la recherche en robotique

X Square Robot a mis en open source XRZero-G0, un système de collecte de données robotiques combinant un casque VR PICO 4 à tracking spatial inside-out, une caméra frontale et deux caméras poignet, ainsi qu'une paire de grippers physiques duals, un gripper en H à actionnement par pression et un gripper en G à entraînement digital. Le dispositif assure une estimation de pose 6-DOF à précision millimétrique et intègre un parsing spatiotemporel embarqué pour synchroniser flux visuels, données de trajectoire et annotations langagières. En parallèle, la société publie le G0-Dataset : 2 000 heures de démonstrations humaines multimodales, disponibles sur HuggingFace avec le code source sur GitHub. Sous conditions expérimentales contrôlées, X Square Robot annonce une réduction des besoins en données réelles pouvant atteindre un facteur 20x : environ 10 épisodes collectés sans robot, combinés à un seul épisode sur robot réel, suffiraient à égaler les performances d'un entraînement purement issu de données robotiques. L'enjeu est direct pour les équipes qui développent des politiques de manipulation dextre : le goulot d'étranglement de l'embodied AI n'est pas le compute, c'est la donnée de qualité à grande échelle. XRZero-G0 formalise ce que le secteur cherche depuis plusieurs années, une pipeline fermée "collecte-inspection-entraînement-évaluation" qui filtre automatiquement les trajectoires invalides via cinématique inverse corps entier avec contraintes de collision et de limites articulaires, et valide par rejeu réel sur robot avant d'intégrer les épisodes à l'entraînement. Si les chiffres de réduction 20x se confirment sur des tâches variées hors conditions de labo, cela change structurellement l'économie de déploiement des VLA (Vision-Language-Action models) : les industriels pourraient composer leurs datasets sans immobiliser de flotte robotique pendant des semaines. Le transfert cross-embodiment revendiqué, démontration humaine transférable à des plateformes non vues à l'entraînement, reste la promesse la plus forte, et la plus à vérifier indépendamment. X Square Robot s'inscrit dans un mouvement plus large de standardisation de la collecte de données robotiques, aux côtés d'initiatives comme Open-X Embodiment (Google DeepMind, 2023), DROID (Berkeley, 2024) ou les efforts de Physical Intelligence autour de pi0. Le positionnement open source du G0-Dataset rappelle la stratégie d'Hugging Face avec LeRobot, visant à créer une infrastructure commune de benchmarking. Aucun concurrent européen direct n'est impliqué ici, bien qu'Enchanted Tools et Wandercraft opèrent sur des segments adjacents (interaction et mobilité bipède) qui pourraient bénéficier de telles ressources de préentraînement. Les prochaines étapes annoncées incluent l'utilisation du dataset pour du préentraînement à grande échelle et des expériences de transfert cross-embodiment, sans timeline commerciale précisée, ce projet reste pour l'instant dans le périmètre recherche.

UELes équipes R&D françaises et européennes (Enchanted Tools, Wandercraft) pourraient exploiter le G0-Dataset open source pour le préentraînement de leurs modèles VLA, réduisant potentiellement leur dépendance à la collecte de données robotiques en flotte, si le facteur 20x se confirme hors conditions contrôlées.

IA physiqueOpinion
1 source
AgiBot dévoile GE-Act 2.0, son modèle monde-action natif avec un passage à l'échelle des données x100
3Pandaily 

AgiBot dévoile GE-Act 2.0, son modèle monde-action natif avec un passage à l'échelle des données x100

Paragraphe 1: AgiBot a présenté GE-Act 2.0, un modèle "world-action" entraîné depuis une initialisation aléatoire sur des données de manipulation robotique, plutôt qu'adapté d'un générateur vidéo préexistant, en entraînant conjointement représentation visuelle, prédiction du futur et prédiction d'action. La société en fait le premier test systématique de la mise à l'échelle des données: le volume d'entraînement passe de 300 à 30 000 heures, sans réglage fin par tâche ni démonstration au moment de l'évaluation. Sur un protocole zéro-shot, avec scènes, éclairages et objets inédits, couvrant 100 tâches élémentaires et environ 20 familles de compétences sur deux robots, le taux de réussite grimpe de 17,1% à 44,1% sur la plateforme G1-OP et de 13,4% à 31,1% sur G2-90D, avec des progrès encore mesurables entre les paliers de 5 000 et 30 000 heures. Le nombre de tâches réussies au moins une fois passe de 39 à 76 sur G1-OP et de 24 à 72 sur G2-90D; des gestes fins comme plier une serviette, empiler des gobelets en papier, reposer un capuchon de stylo ou arranger des fleurs dans des scènes inédites n'apparaissent de façon fiable qu'au plus haut palier de données. G2-90D, qui ne représente que 2% des données contre plus de la moitié pour G1-OP, gagne malgré tout 17,7 points grâce au transfert entre robots. Un encodeur CoAE compresse chaque image de 256 par 384 pixels en 24 tokens, un planificateur visuel prédit un segment de futur et un modèle de dynamique inverse le traduit en actions, pour un temps de cycle d'environ 104 millisecondes sur une RTX 5090. Après réglage fin, AgiBot revendique 60,52% sur les tests hors distribution de RoboTwin et 0,770 sur le suivi d'instructions de GenieSim, devant plusieurs modèles comparés; les documents sont publiés sur ge-act-v2.github.io. Paragraphe 2: Ces résultats visent le débat sur la généralisation des modèles VLA (vision-language-action) et l'écart entre démonstration et déploiement réel: une architecture native, plutôt qu'un empilement de modules pré-entraînés séparément, passerait mieux à l'échelle des données. Pour les intégrateurs et décideurs industriels, l'enjeu est la robustesse hors distribution, qui réduit le coût de reconfiguration site par site, frein majeur à l'adoption des humanoïdes en usine ou en logistique. L'apparition tardive des compétences fines suggère que la course entre AgiBot, Figure, 1X ou Physical Intelligence se joue autant sur le volume et la diversité des données de téléopération que sur l'architecture du modèle. Le transfert observé entre G1-OP et G2-90D appuie l'idée qu'un apprentissage partagé entre robots différents peut compenser la rareté de données propre à chaque plateforme. Ces chiffres restent toutefois auto-publiés par AgiBot, sans validation indépendante ni comparaison en conditions réelles avec des modèles concurrents comme GR00T N2 de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Paragraphe 3: GE-Act 2.0 s'inscrit dans la pile logicielle GE d'AgiBot, où GE-Sim gère l'évaluation de politiques et la construction d'environnements simulés, tandis que GE-Act convertit les futurs prédits en mouvements robotiques. La société chinoise, déjà connue pour ses humanoïdes commerciaux et ses jeux de données de téléopération à grande échelle, présente cette publication comme une étape de recherche plutôt qu'un produit livré: les documents techniques sont diffusés sur une simple page de projet, sans partenaire industriel, site pilote ni calendrier de commercialisation annoncés pour ce modèle précis. La comparaison revendiquée face à RoboTwin et GenieSim, deux bancs d'essai utilisés par les laboratoires chinois et occidentaux, vise à positionner AgiBot dans une compétition où les vidéos soigneusement sélectionnées restent souvent difficiles à distinguer d'une capacité réellement généralisable en production.

IA physiqueOpinion
1 source
Modèle du monde prédictif en espace latent pour la manipulation dynamique par VLA
4arXiv cs.RO 

Modèle du monde prédictif en espace latent pour la manipulation dynamique par VLA

Des chercheurs ont publié le 2 juin 2026 sur arXiv (réf. 2606.02486) AHEAD, un module d'anticipation conçu pour corriger un angle mort majeur des modèles Vision-Language-Action : leur incapacité à saisir des objets en mouvement. Les VLA actuels, dont OpenVLA (7 milliards de paramètres), capturent une observation instantanée et génèrent une action en supposant que la scène restera immobile, ce qui introduit une latence incompatible avec toute dynamique réelle. AHEAD (Anticipatory Horizon Extrapolation with Adaptive Dynamics) greffe un modèle de monde latent de seulement 4,9 millions de paramètres sur le VLA gelé : ce module prédit l'état futur de la scène dans l'espace de features du VLA, en s'appuyant sur les champs de vitesse et d'accélération par token extraits par flux optique, puis filtre les patchs pertinents via un masque combinant saillance linguistique et cinématique. Le décodeur d'action reçoit ces tokens futurs en lieu et place des tokens présents. En simulation, AHEAD atteint 79 à 97 % de succès sur 20 scénarios dynamiques, contre 31 à 58 % pour le meilleur concurrent. Sur robot physique (UFactory xArm 7), le système réussit 29 à 30 essais sur 30 pour des tâches de tapis roulant et de balle roulante, 23/30 pour l'interception de pagaie, et 19/30 pour l'interception de projectile, là où tous les baselines atteignent 0/30. Ce résultat est notable car il démontre un transfert sim-to-real fonctionnel sur des tâches dynamiques, un écueil historique des approches VLA : non seulement la prédiction dans l'espace latent se généralise à du matériel réel, mais le module léger (4,9 M de paramètres) n'impose aucune modification du modèle de base, ce qui ouvre la voie à une adoption modulaire sur n'importe quel VLA existant. Pour un intégrateur industriel, cela signifie qu'un bras robotisé équipé d'un VLA standard pourrait, sans réentraînement complet, traiter des pièces sur convoyeur ou dans des environnements non structurés, un verrou majeur pour la robotisation flexible de lignes d'assemblage ou de tri. Les VLA ont émergé comme paradigme dominant en manipulation robotique depuis 2023, portés par des travaux comme RT-2 (Google DeepMind) et la série OpenVLA (Berkeley). La manipulation statique étant désormais largement résolue par ces modèles, le front de recherche se déplace vers le dynamique, le déformable et l'incertain. AHEAD s'inscrit dans cette tendance, en compétition implicite avec des approches comme ACT (Action Chunking Transformer) ou les méthodes de replanning rapide à base de diffusion. L'article reste un preprint de laboratoire académique sans déploiement industriel annoncé, et les conditions de test physique (30 essais par tâche, environnement contrôlé) restent loin d'une validation en conditions de production ; les performances sur projectile (19/30) méritent un regard critique. La prochaine étape naturelle serait une évaluation sur des benchmarks standardisés comme RoboSuite ou une collaboration avec un partenaire industriel pour valider la robustesse hors-labo.

UEAucun acteur européen impliqué ; les intégrateurs industriels EU travaillant sur la robotisation de lignes de convoyage ou de tri pourraient à terme bénéficier de cette approche modulaire compatible avec tout VLA existant, sans réentraînement du modèle de base.

IA physiqueOpinion
1 source