Aller au contenu principal
IA physiquearXiv cs.RO 

InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Shanghai AI Laboratory a publié le 24 septembre 2026 sur arXiv (2609.27656) InternW0, premier modèle de sa série InternW dédiée à la modélisation du monde physique. L'architecture associe un expert vidéo lourd, qui prédit la dynamique visuelle à long horizon, et un expert d'action léger cadencé plus vite, entraînés conjointement par flow matching ; plutôt que de tout recalculer à chaque action, le modèle réutilise ses caches clé/valeur et les met à jour selon les nouvelles observations. Des interfaces par domaine gèrent les morphologies robotiques hétérogènes, complétées par un post-entraînement sensible au contact exploitant force et tactile. L'entraînement mobilise 7 200 heures de données robot et égocentriques, dont EgoLab (275 heures, laboratoire réel), et les tests réels incluent une synthèse de charpentes métallo-organiques en 15 étapes et un pipetage dextre en 5 étapes sensible au contact.

L'enjeu pour les intégrateurs tient à l'efficacité : la plupart des modèles vision-langage-action recalculent une passe complète à chaque étape de contrôle, ce qui plafonne la fréquence de commande utilisable, alors que la réutilisation du cache clé/valeur d'InternW0 vise justement ce goulot d'étranglement. Le choix de tâches scientifiques (chimie, pipetage) plutôt que la manipulation domestique privilégiée par la plupart des démonstrations humanoïdes déplace la preuve vers un usage B2B vérifiable en laboratoire et dans l'industrie pharmaceutique ou des matériaux, où comptent la répétabilité et la sensibilité au contact plus que la polyvalence spectaculaire. Le texte reste un preprint, sans taux de réussite chiffré ni preuve de généralisation au delà de ces scénarios.

InternW0 prolonge la famille Intern de Shanghai AI Laboratory, déjà connue pour InternLM (langage) et InternVL/InternVideo (multimodal), vers la modélisation du monde physique et le contrôle robotique. Il se positionne face aux modèles vision-langage-action généralistes d'autres laboratoires, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, avec une orientation explicitement scientifique plutôt que domestique. Aucun déploiement commercial n'est annoncé : le papier, classé comme nouvelle publication arXiv, décrit une preuve de concept validée en simulation et sur un nombre restreint de scénarios réels, sans calendrier communiqué pour une ouverture du modèle ou du jeu de données EgoLab.

À lire aussi

Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique
1arXiv cs.RO 

Riemann-1.0 : un modèle d'action du monde incarné pour l'IA physique

Un preprint publie sur arXiv (2608.27033) présente Riemann-1.0, un "World Action Model" causal et autoregressif qui unifie, dans une seule séquence, observations visuelles multi-vues, états du robot et actions spécifiques a chaque embodiment. Le modèle est pré-entraine sur plus de 200 000 heures de données hétérogènes: vidéos humaines a la première personne, démonstrations avec pinces portables et trajectoires de robots varies. Il atteint 94,3% de réussite sur RoboTwin2.0, 99,0% sur LIBERO et 62,6% sur le benchmark compositionnel long-horizon RoboCasa-365, soit 8,4 points de plus que la meilleure méthode antérieure. Sur des taches réelles de manipulation longue durée, il obtient 85,0% de réussite (SR) et 94,4% de progression (PSR), soit 15 points de plus que le meilleur système open source de référence. Le résultat notable n'est pas seulement le score, mais l'architecture: un seul modèle fait a la fois office de politique de contrôle exécutable et de simulateur du monde conditionne par l'action, la ou la plupart des approches séparent prédiction vidéo et génération d'actions. Cela alimente le débat sur le passage a l'échelle des modèles vision-langage-action, en suggérant que des sources bon marche comme la vidéo humaine peuvent compléter des données robotiques rares pour améliorer la généralisation. Pour les intégrateurs, la prudence reste de mise: ces résultats proviennent d'un preprint non relu par les pairs, obtenus sur des benchmarks contrôles et des taches réelles décrites de façon générique, sans précision sur le site de test ni sur un déploiement en production. Riemann-1.0 se positionne contre trois familles de "world models" robotiques existantes, génération conjointe d'actions et d'images, prédiction vidéo suivie d'une politique séparée, ou architectures découplées, jugées limitantes par ses auteurs face a la fragmentation entre simulation du monde et contrôle du robot. L'article ne mentionne ni organisation commerciale a l'origine du projet, ni plateforme robotique associée, ni date de pilote ou de déploiement: il se presente comme un jalon de recherche plutôt que comme un produit livre. Les suites logiques, non confirmées dans le texte, porteraient sur l'extension a davantage d'embodiments et sur des essais en conditions réelles hors laboratoire, dans la lignée des travaux parallèles menés par d'autres laboratoires sur les modèles fondation pour la manipulation robotique.

IA physiqueActu
1 source
Shanghai AI Lab lance Intern W0, un modèle du monde physique pour la robotique à retour de force et tactile
2Pandaily 

Shanghai AI Lab lance Intern W0, un modèle du monde physique pour la robotique à retour de force et tactile

Le Shanghai Artificial Intelligence Laboratory a présenté W0, un modèle de fondation robotique baptisé Intern physical world model, conçu pour combiner vision, force et toucher dans des tâches physiques à contact riche, avec perception, prédiction, action et correction s'exécutant en parallèle plutôt qu'en chaîne rigide. Deux piliers le définissent : une perception force-tactile native, où la vision fixe cibles et trajectoires d'approche, le retour de contact ajuste qualité de préhension et détection de glissement, et l'état corporel suit pose et mouvement ; et une architecture « duplex » asynchrone à fréquences multiples, planification longue en arrière-plan et commandes moteur à haute fréquence, pour raccourcir le délai entre un changement d'environnement et la correction du geste. W0 diffère du projet NCP-ArchPreview, mené avec le LUMIA Lab de l'université Jiao Tong de Shanghai sur la prédiction du concept suivant en espace latent. Connecté à la plateforme Intern InkStone et au modèle scientifique Intern S2, W0 a fait tourner des boucles fermées en laboratoire humide et sec : évolution dirigée de protéines d'édition génique, synthèse organique de mépivacaïne, préparation de nanoparticules lipidiques avec ajustements dynamiques de paramètres en cours de run. Pour les intégrateurs et décideurs de la robotique industrielle, ce choix diffère du pari humanoïde grand public : plutôt que la démonstration spectaculaire, le laboratoire vise l'automatisation d'expériences scientifiques, où la fiabilité du contact (préhension, glissement, micro-ajustement) prime sur la marche ou la manipulation domestique. Si le couplage force-tactile-vision en duplex tient au-delà des cas montrés, il fournirait un argument concret dans le débat sur le passage à l'échelle des modèles vision-langage-action au-delà de vidéos de démonstration triées, un reproche récurrent fait au secteur. Les résultats de laboratoire humide cités restent toutefois issus en partie de couverture secondaire relayée par le laboratoire lui-même comme preuve précoce, non d'une validation indépendante ni d'un déploiement à grande échelle : une preuve de faisabilité sur un nombre limité de protocoles, pas un produit fini. W0 s'inscrit dans l'effort plus large du Shanghai AI Lab pour bâtir une pile de modèles d'IA physique, distincte de sa branche NCP-ArchPreview menée avec l'université Jiao Tong de Shanghai. Contrairement aux humanoïdes commerciaux orientés logistique ou assemblage industriel, le laboratoire cible en priorité les instruments de paillasse et les protocoles de chimie, biologie et science des matériaux, présentés comme une brique sous les flux Intern InkStone plutôt que comme un robot grand public. La suite dépendra de la capacité du contrôle force-tactile duplex à généraliser au-delà des trois cas démontrés, protéines d'édition génique, synthèse de mépivacaïne, nanoparticules lipidiques ; le laboratoire présente ces résultats comme l'ouverture d'un chemin allant de la déduction de schémas à l'expérience instrumentée, sans calendrier de déploiement ni partenaires pilotes annoncés à ce stade.

IA physiqueOpinion
1 source
L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde
3arXiv cs.RO 

L'action latente comme intention permet une imagination efficace du futur pour les modèles d'action du monde

La modélisation prédictive de l'action robotique franchit une étape avec LAWA, une architecture présentée dans un article publié sur arXiv fin août 2026 sous la référence 2608.24882. Les modèles dits "world action models" (WAM) améliorent le contrôle des robots en simulant l'évolution future des observations visuelles, mais cette génération d'images futures coûte cher en latence au moment de l'exécution. Une variante rapide, Fast-WAM, supprime cette étape pour gagner en vitesse, au prix d'une généralisation nettement plus faible, en particulier lorsque les démonstrations robotiques sont rares ou dans des scénarios hors distribution. LAWA propose un compromis: au lieu de générer des vidéos futures complètes, il encode l'intention future sous forme d'actions latentes compactes, produites par un tokenizer discret pré-entraîné sans action, qui génère des cibles de codebook centrées sur la manipulation. Le modèle débruite conjointement un état latent continu ancré sur ces cibles avec des blocs d'actions exécutables, tout en omettant la branche vidéo future à l'inférence. Sur le benchmark RoboCasa, LAWA atteint des taux de succès moyens de 65,6% en few-shot et 80,8% en données complètes, dépassant Fast-WAM de 9,6 et 4,5 points respectivement, tout en réduisant la latence d'inférence de 42,9% par rapport à la variante Joint-WAM de référence. Ces résultats remettent en question l'idée reçue selon laquelle il faudrait sacrifier l'imagination du futur pour gagner en rapidité d'exécution. Pour les équipes qui développent des politiques de contrôle basées sur des modèles VLA (vision-language-action), le message est clair: la vitesse et la généralisation ne sont pas nécessairement antagonistes si l'information future est compressée intelligemment plutôt que supprimée. C'est un enjeu concret pour l'industrialisation des robots manipulateurs, où le temps de cycle et la robustesse hors distribution conditionnent directement la viabilité en usine ou en entrepôt. Un modèle capable de conserver la qualité de généralisation d'un WAM complet tout en réduisant drastiquement la latence rapproche ces architectures d'un déploiement temps réel réaliste, plutôt que d'un simple exercice de recherche en laboratoire. Le travail s'inscrit dans la lignée des architectures WAM et de leurs déclinaisons rapides, dont Fast-WAM sert ici de point de comparaison direct sur des implémentations appariées. Les auteurs testent aussi LAWA en zero-shot sur LIBERO-Plus, où il affiche une robustesse compétitive, ainsi que sur des tâches réelles où il surpasse les approches concurrentes. Le code et les modèles doivent être publiés, ce qui permettra une vérification indépendante des chiffres annoncés, une précaution utile puisque les métriques de succès en manipulation robotique restent souvent sensibles au choix des tâches et des conditions d'évaluation.

IA physiqueActu
1 source
PhysBrain 1.5 : des modèles vision-langage aux modèles fondation pour l'IA physique
4arXiv cs.RO 

PhysBrain 1.5 : des modèles vision-langage aux modèles fondation pour l'IA physique

PhysBrain 1.5, décrit dans une publication arXiv (2609.14973v1, soumission croisée), est un modèle unifié qui fusionne compréhension de scène, génération d'actions et prédiction d'états futurs dans un seul cadre d'apprentissage. Bâti sur un modèle vision-langage généraliste, il encode réponses textuelles, mouvements de l'effecteur terminal et cibles visuelles denses en séquences discrètes, optimisées conjointement par prédiction autorégressive du token suivant. Le pré-entraînement s'appuie entièrement sur des vidéos d'interaction humaine, sans donnée robot, via des épisodes centrés sur des tâches associant contexte sémantique et spatial au mouvement reconstruit et aux observations suivantes. L'ajustement supervisé combine ensuite démonstrations humaines, trajectoires robotiques et expérience simulée. Sur 28 benchmarks de compréhension incarnée, le modèle de 8 milliards de paramètres obtient un score moyen de 72,5, nouveau record open source, à la hauteur de modèles propriétaires comme GPT-6-Astra et Gemini 3.6 Flash, et meilleur résultat open source sur 14 des 28 benchmarks. L'enjeu pour l'industrie robotique tient à la source de supervision : pré-entraîner un modèle d'action à partir de vidéos humaines ordinaires, plutôt que de coûteuses données de téléopération robotique, attaquerait le principal goulot d'étranglement des modèles vision-langage-action (VLA) pour bras et humanoïdes. Qu'un modèle ouvert de 8B rivalise avec des systèmes propriétaires sur la compréhension intéresse les intégrateurs cherchant un déploiement local sans dépendre d'une API fermée. Réserve importante toutefois : la génération de trajectoires et la prédiction de scènes futures (RGB, profondeur, masques robot) ne reposent que sur des exemples qualitatifs, sans taux de réussite ni temps de cycle chiffrés, un écart classique entre démonstration et fiabilité de terrain. Ce travail s'inscrit dans la vague des modèles vision-langage-action qui unifient perception, langage et contrôle moteur dans un même transformeur autorégressif, aux côtés d'approches comme Pi-0, GR00T N2 ou Helix, et se positionne explicitement face aux modèles multimodaux propriétaires des grands laboratoires. Il s'agit d'une publication de recherche arXiv, pas d'un produit livré ni d'un déploiement commercial : aucune entreprise, plateforme robotique ni calendrier de disponibilité n'est précisé. La suite logique serait une évaluation quantitative des capacités d'action sur robot réel, afin de vérifier si les démonstrations qualitatives se traduisent en performances reproductibles hors laboratoire.

IA physiqueOpinion
1 source