
InternW0-Δ : un modèle monde-action reliant dynamique prédictive et actions avec plus de 20 000 heures de données ouvertes
Des chercheurs du projet InternRobotics, rattaché au laboratoire chinois Shanghai AI Laboratory (dont dépend la série de modèles Intern), publient sur arXiv (2609.31394v1) InternW0-Δ, un "World Action Model" qui unifie prédiction visuelle et génération d'actions pour la manipulation robotique générale. L'architecture repose sur un cadre Mixture-of-Transformers combinant un expert vidéo et un expert action, guidés sémantiquement par un VLM gelé, auxquels s'ajoutent des a priori géométriques et de mouvement 4D injectés par distillation depuis un modèle fondation 4D préentraîné. Un mécanisme baptisé Causal Imprint apprend, pendant l'entraînement seulement, à anticiper les changements de scène pertinents et fournit ces représentations prédictives à l'expert action sans qu'il soit nécessaire de générer une vidéo future complète au moment de l'inférence. Le modèle est préentraîné sur un corpus hétérogène de plus de 20 000 heures de données, mêlant démonstrations robotiques, données UMI, démonstrations humaines à la première personne et données Ego2Robot, alignées sous une représentation état-action commune. Les auteurs annoncent des performances supérieures aux méthodes existantes sur des benchmarks de simulation et sur plateformes robotiques réelles, et prévoient d'ouvrir le code d'entraînement, les poids, l'infrastructure et le pipeline de traitement de données, sous réserve des licences applicables.
L'intérêt de ce travail tient moins à un déploiement industriel qu'à une proposition architecturale: fusionner prédiction du monde et politique d'action dans un seul modèle, plutôt que d'enchaîner un générateur vidéo et un contrôleur séparés, tout en évitant le coût d'inférence habituel des rollouts vidéo futurs, un goulot d'étranglement connu des approches type modèle du monde. Si le corpus de 20 000 heures est effectivement publié en open source, il représenterait une ressource de référence dans un domaine où les grands jeux de données de manipulation (type Open X-Embodiment) restent souvent plus restreints ou fermés, avec un impact direct pour les intégrateurs et laboratoires cherchant à entraîner des politiques VLA sans dépendre des corpus propriétaires. Ces résultats restent toutefois auto-rapportés, issus d'un article non encore évalué par les pairs, et les comparaisons de benchmarks méritent d'être prises avec prudence.
InternW0-Δ se positionne face aux modèles VLA actuels de l'industrie tels que Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui traitent généralement perception, prédiction et action de façon plus découplée. Aucun acteur français ou européen n'est mentionné dans cette publication. Le statut reste celui d'une publication de recherche: aucune date précise d'ouverture du code ni de pilote industriel n'est annoncée, seule une intention de publication progressive selon les licences des données utilisées.
Si le corpus de plus de 20 000 heures est effectivement publié en open source, il pourrait bénéficier aux intégrateurs et laboratoires européens entraînant des modèles VLA sans dépendre de données propriétaires, mais aucun acteur français ou européen n'est impliqué dans cette publication.




