Aller au contenu principal
GigaBrain-WBC-0.5 : un modèle du monde comportemental pour un contrôle corporel robuste avec interaction environnementale
IA physiquearXiv cs.RO 

GigaBrain-WBC-0.5 : un modèle du monde comportemental pour un contrôle corporel robuste avec interaction environnementale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 20 août 2026 (arXiv:2608.18234v1) GigaBrain-WBC-0.5, présenté comme le premier "Behavior World Model" (BWM) pour le contrôle corps entier de robots humanoïdes. Contrairement aux trackers de mouvement classiques, entraînés sur sol plat et incapables d'apprendre comment le contact avec le terrain ou des objets modifie leur dynamique, ce système repose sur un Transformer causal qui prédit simultanément sa prochaine action, son prochain état et la distribution de ses prochaines commandes comportementales latentes. Un pipeline d'annotation automatique reconstruit la géométrie de contact 3D à partir de mouvements retargetés, permettant d'annoter des jeux de données de mouvement à grande échelle sans travail manuel. Cette distribution prédite sert aussi en déploiement à détecter les commandes jugées implausibles et à les ramener vers des comportements appris, pour une exécution en mode "best effort". Face à trois trackers de référence à grande échelle, GigaBrain-WBC-0.5 obtient les meilleurs taux de réussite sur les quatre régimes testés: 81,3% en interaction avec le terrain (4,3 fois le meilleur concurrent), 83,1% sous commandes implausibles et 99,3% en récupération après chute (16,8 fois le meilleur concurrent). Des essais matériels montrent une robustesse face aux appuis manquants et aux perturbations; le modèle entraîné sur le Unitree G1 se transfère au robot Maker L01 avec un simple fine-tuning.

Pour l'industrie robotique, ce travail s'attaque à un angle mort récurrent: la plupart des trackers actuels fonctionnent bien en démo sur sol lisse mais s'effondrent dès que le terrain devient irrégulier ou que des objets entrent en jeu, un écart entre démonstration et déploiement réel que le secteur peine encore à combler. En modélisant explicitement comment l'environnement contraint les comportements possibles, plutôt qu'en empilant des corpus de mouvements toujours plus vastes, l'approche ouvre une piste pour rendre les humanoïdes plus fiables hors des environnements contrôlés, entrepôts encombrés ou chantiers compris. Le taux de récupération après chute à 99,3% pèse particulièrement pour les intégrateurs, chaque chute non gérée interrompant généralement une tâche. La portabilité démontrée entre le Unitree G1 et le Maker L01 suggère par ailleurs une indépendance vis-à-vis du matériel, un enjeu commercial pour les fournisseurs de "cerveaux" robotiques.

Ce travail s'inscrit dans la lignée des modèles vision-langage-action et des "world models" appliqués à la robotique, aux côtés d'approches comme GR00T N2 de NVIDIA, Helix de Figure AI ou Pi-0 de Physical Intelligence, qui visent toutes une couche de contrôle plus généraliste que les trackers traditionnels. GigaBrain-WBC-0.5 cible spécifiquement le contrôle bas niveau corps entier, un maillon souvent traité comme un simple suivi de trajectoire dans les piles logicielles concurrentes. Les trois trackers de référence comparés ne sont pas nommés dans le résumé, ce qui limite la comparaison directe avec des systèmes commerciaux connus. Aucun calendrier de déploiement industriel n'est mentionné: il s'agit d'une publication de recherche accompagnée d'essais matériels limités, pas d'un produit commercialisé.

À lire aussi

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche
1arXiv cs.RO 

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche

Des chercheurs ont présenté Agile-WAM, un "world action model" (WAM) tactile pour le contrôle robotique en manipulation à contact riche, détaillé dans un preprint arXiv (2609.20761) et sur une page de projet dédiée portant le nom de code TARO. Le modèle encode vision et tactile dans un espace latent partagé, exploité par un processus de flow-matching direct vision-tactile-vers-action qui génère à la fois des séquences d'actions et les latents visuels/tactiles futurs. Sa particularité est une prédiction multimodale à horizons multiples : supervision visuelle à décalage temporel large, les images voisines étant peu différentes, mais prédiction tactile image par image pour capter les changements brusques au moment du contact. Testé sur neuf tâches simulées et cinq tâches réelles de manipulation, Agile-WAM obtient un gain relatif de 29,4% en taux de succès sur les cinq essais réels, pour une latence d'inférence de 11,9 millisecondes. Ce résultat répond à une limite concrète des WAM tactiles existants, qui s'appuient souvent sur de lourds backbones génératifs pré-entraînés au détriment de la latence et du déploiement temps réel. En affichant une inférence à un chiffre de millisecondes tout en dépassant sa meilleure baseline, Agile-WAM suggère qu'un contrôle précis et à haute fréquence, nécessaire dès que le contact évolue plus vite que l'image, ne requiert pas forcément les architectures massives des VLA généralistes type Pi-0 ou GR00T N2. Pour les équipes de recherche et les intégrateurs travaillant sur l'insertion de pièces, l'assemblage ou la préhension fine, l'apport principal est méthodologique : traiter vision et tactile à des échelles temporelles distinctes améliore à la fois précision et efficacité, plutôt qu'une simple fusion multimodale. Le travail s'inscrit dans la lignée des world models robotiques, qui étendent les politiques visuomotrices classiques en apprenant conjointement la dynamique du monde et l'action à produire, une piste déjà suivie par des VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), rarement avec un signal tactile aussi fin. Les auteurs positionnent Agile-WAM contre des WAM tactiles antérieurs jugés trop coûteux en calcul, sans les nommer précisément dans le résumé. Il s'agit à ce stade d'un preprint de recherche non encore revu par les pairs, appuyé par des démonstrations en simulation et cinq essais réels, sans partenaire industriel ni calendrier de déploiement annoncé.

IA physiqueOpinion
1 source
InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel
2arXiv cs.RO 

InternW0 : un modèle fondation du monde physique pour des interactions efficaces avec le monde réel

Shanghai AI Laboratory a publié le 24 septembre 2026 sur arXiv (2609.27656) InternW0, premier modèle de sa série InternW dédiée à la modélisation du monde physique. L'architecture associe un expert vidéo lourd, qui prédit la dynamique visuelle à long horizon, et un expert d'action léger cadencé plus vite, entraînés conjointement par flow matching ; plutôt que de tout recalculer à chaque action, le modèle réutilise ses caches clé/valeur et les met à jour selon les nouvelles observations. Des interfaces par domaine gèrent les morphologies robotiques hétérogènes, complétées par un post-entraînement sensible au contact exploitant force et tactile. L'entraînement mobilise 7 200 heures de données robot et égocentriques, dont EgoLab (275 heures, laboratoire réel), et les tests réels incluent une synthèse de charpentes métallo-organiques en 15 étapes et un pipetage dextre en 5 étapes sensible au contact. L'enjeu pour les intégrateurs tient à l'efficacité : la plupart des modèles vision-langage-action recalculent une passe complète à chaque étape de contrôle, ce qui plafonne la fréquence de commande utilisable, alors que la réutilisation du cache clé/valeur d'InternW0 vise justement ce goulot d'étranglement. Le choix de tâches scientifiques (chimie, pipetage) plutôt que la manipulation domestique privilégiée par la plupart des démonstrations humanoïdes déplace la preuve vers un usage B2B vérifiable en laboratoire et dans l'industrie pharmaceutique ou des matériaux, où comptent la répétabilité et la sensibilité au contact plus que la polyvalence spectaculaire. Le texte reste un preprint, sans taux de réussite chiffré ni preuve de généralisation au delà de ces scénarios. InternW0 prolonge la famille Intern de Shanghai AI Laboratory, déjà connue pour InternLM (langage) et InternVL/InternVideo (multimodal), vers la modélisation du monde physique et le contrôle robotique. Il se positionne face aux modèles vision-langage-action généralistes d'autres laboratoires, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, avec une orientation explicitement scientifique plutôt que domestique. Aucun déploiement commercial n'est annoncé : le papier, classé comme nouvelle publication arXiv, décrit une preuve de concept validée en simulation et sur un nombre restreint de scénarios réels, sans calendrier communiqué pour une ouverture du modèle ou du jeu de données EgoLab.

IA physiqueOpinion
1 source
WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable
3arXiv cs.RO 

WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable

Les chercheurs à l'origine de WSA₁ proposent un nouveau modèle fondation pour la robotique généraliste, construit autour d'un paradigme baptisé "World-Spatial-Action" centré sur la 3D. Contrairement aux modèles robot-fondation (RFM) classiques qui associent directement perception visuelle 2D et instructions langagières à des actions continues, WSA₁ apprend une représentation explicite de l'état spatial 3D du monde et de ses transitions, puis relie ces transitions aux actions du robot. Le modèle a été préentraîné sur 6 000 heures de démonstrations expertes, dont seulement 1 000 heures issues de robots réels, le reste provenant de sources simulées ou synthétiques. Sur le benchmark de simulation RoboTwin2.0, WSA₁ atteint un taux de réussite de 93% en manipulation, et sur des tâches de contrôle robotique en conditions réelles il affiche un gain moyen de 20% par rapport aux meilleurs RFM existants. L'enjeu pour l'industrie robotique est la sobriété en données réelles. La plupart des modèles fondation actuels, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, dépendent de volumes massifs de téléopération et de collecte sur robots physiques, une contrainte coûteuse qui freine leur déploiement à grande échelle chez les intégrateurs. En démontrant qu'une modélisation conjointe 3D monde-action permet d'atteindre une généralisation compétitive avec un ratio de données réelles très faible, WSA₁ ouvre une voie potentiellement plus abordable vers des systèmes robotiques polyvalents, sans nécessiter les flottes de collecte massives déployées par des acteurs comme Figure ou Tesla pour leurs humanoïdes. Ce travail s'inscrit dans la lignée des critiques adressées aux RFM actuels, accusés de manquer d'un raisonnement physique réel sur la dynamique 3D et les effets causaux des actions du robot sur son environnement, un décalage jugé limitant pour la généralisation en conditions réelles. Les auteurs positionnent explicitement WSA₁ face aux modèles VLA (vision-language-action) de référence du secteur. La publication, encore au stade de préprint arXiv, ne détaille pas de calendrier de déploiement industriel ni de partenariat matériel, les prochaines étapes attendues portant vraisemblablement sur une validation élargie hors simulation et sur des comparaisons directes avec davantage de RFM concurrents.

IA physiqueActu
1 source
Modélisation du monde en contexte pour le contrôle robotique
4arXiv cs.RO 

Modélisation du monde en contexte pour le contrôle robotique

Des chercheurs ont publié le 25 juin 2026 un preprint arXiv (2606.26025) présentant ICWM (In-Context World Modeling), un cadre d'adaptation pour les modèles Vision-Language-Action (VLA) appliqués à la robotique. Les VLA actuels échouent dès que le contexte d'exécution change - angle de caméra différent, morphologie de robot modifiée - parce qu'ils supposent un contexte fixe, celui rencontré pendant l'entraînement, et nécessitent un fine-tuning intensif en données pour toute nouvelle configuration. ICWM traite l'identification du système comme un problème d'adaptation en contexte : avant d'exécuter une tâche, le robot génère de courtes interactions autonomes agnostiques à la tâche, dont l'historique est injecté dans la fenêtre de contexte du modèle. Celui-ci infère ainsi implicitement la dynamique du système courant - position de caméra, configuration mécanique - sans mise à jour de poids. Les expériences menées en simulation et sur plateformes réelles montrent que ICWM surpasse significativement les baselines VLA standards sur des configurations de caméra inédites. La généralisation des VLA est le verrou principal qui freine le déploiement industriel de la robotique généraliste. Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA et les modèles Google nécessitent tous du fine-tuning dès qu'on change la disposition d'une caméra ou la morphologie d'un robot, ce qui rend les pilotes industriels coûteux et longs à mettre en place. ICWM attaque ce problème sans modifier les poids du modèle : l'adaptation passe uniquement par le contexte, à l'image de ce que l'In-Context Learning a apporté aux LLMs. Pour un intégrateur ou un COO industriel, cela signifie potentiellement déployer un même modèle sur plusieurs lignes avec des géométries de capteurs différentes, sans pipeline de re-entraînement. La contribution est conceptuellement distincte : là où l'ICL classique spécifie quelle tâche effectuer, ICWM apprend comment le système fonctionne - une couche d'adaptation complémentaire aux approches existantes. Les modèles VLA ont connu une explosion depuis 2024 : RT-2 (Google DeepMind), Pi-0 de Physical Intelligence, GR00T N2 d'NVIDIA présenté à GTC 2025, et plus récemment Helix (Figure AI) illustrent la convergence entre fondations LLM et contrôle moteur. La fragilité aux variations contextuelles - ce qu'on appelle le "demo-to-deployment gap" - reste une critique récurrente formulée notamment par des acteurs européens comme Enchanted Tools ou Wandercraft, qui misent sur des architectures plus déterministes pour des environnements industriels contraints. ICWM s'inscrit dans une tendance plus large : importer les paradigmes d'adaptation du machine learning directement dans la boucle de contrôle robotique, sans passer par un cycle de collecte de données et de re-entraînement. Le preprint ne mentionne ni partenariat industriel, ni code open-source, ni dataset public : il s'agit d'une contribution de recherche pure, sans déploiement commercial annoncé à ce stade.

UESi ICWM tient ses promesses, les intégrateurs européens pourraient déployer un même modèle VLA sur plusieurs lignes à géométries de capteurs différentes sans pipeline de ré-entraînement, réduisant directement le coût des pilotes industriels, mais aucun déploiement ni partenariat européen n'est annoncé à ce stade.

💬 Le vrai frein au déploiement robotique industriel, ce n'est pas la performance brute des VLA, c'est que la moindre caméra déplacée oblige à relancer un fine-tuning complet. ICWM importe dans la boucle de contrôle la même logique qui a rendu les LLMs flexibles, et si ça tient, c'est un changement de calcul économique pour les intégrateurs européens qui tentent des pilotes. Bon, pour l'instant c'est un preprint sans code ni partenaire industriel, donc on verra.

IA physiqueOpinion
1 source