InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel
Shanghai AI Laboratory a publié le 24 septembre 2026 sur arXiv (2609.27656) InternW0, premier modèle de sa série InternW dédiée à la modélisation du monde physique. L'architecture associe un expert vidéo lourd, qui prédit la dynamique visuelle à long horizon, et un expert d'action léger cadencé plus vite, entraînés conjointement par flow matching ; plutôt que de tout recalculer à chaque action, le modèle réutilise ses caches clé/valeur et les met à jour selon les nouvelles observations. Des interfaces par domaine gèrent les morphologies robotiques hétérogènes, complétées par un post-entraînement sensible au contact exploitant force et tactile. L'entraînement mobilise 7 200 heures de données robot et égocentriques, dont EgoLab (275 heures, laboratoire réel), et les tests réels incluent une synthèse de charpentes métallo-organiques en 15 étapes et un pipetage dextre en 5 étapes sensible au contact.
L'enjeu pour les intégrateurs tient à l'efficacité : la plupart des modèles vision-langage-action recalculent une passe complète à chaque étape de contrôle, ce qui plafonne la fréquence de commande utilisable, alors que la réutilisation du cache clé/valeur d'InternW0 vise justement ce goulot d'étranglement. Le choix de tâches scientifiques (chimie, pipetage) plutôt que la manipulation domestique privilégiée par la plupart des démonstrations humanoïdes déplace la preuve vers un usage B2B vérifiable en laboratoire et dans l'industrie pharmaceutique ou des matériaux, où comptent la répétabilité et la sensibilité au contact plus que la polyvalence spectaculaire. Le texte reste un preprint, sans taux de réussite chiffré ni preuve de généralisation au delà de ces scénarios.
InternW0 prolonge la famille Intern de Shanghai AI Laboratory, déjà connue pour InternLM (langage) et InternVL/InternVideo (multimodal), vers la modélisation du monde physique et le contrôle robotique. Il se positionne face aux modèles vision-langage-action généralistes d'autres laboratoires, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, avec une orientation explicitement scientifique plutôt que domestique. Aucun déploiement commercial n'est annoncé : le papier, classé comme nouvelle publication arXiv, décrit une preuve de concept validée en simulation et sur un nombre restreint de scénarios réels, sans calendrier communiqué pour une ouverture du modèle ou du jeu de données EgoLab.
Dans nos dossiers




