Aller au contenu principal
WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés
RecherchearXiv cs.RO 

WestWorld : un modèle du monde de trajectoires évolutif intégrant des connaissances pour systèmes robotiques variés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié WestWorld (arXiv:2603.14392), un modèle de monde trajectoire conçu pour opérer sur des systèmes robotiques hétérogènes. Préentraîné sur 89 environnements complexes couvrant une large variété de morphologies en simulation et en conditions réelles, le modèle cible deux lacunes récurrentes dans la littérature : la difficulté de passer à l'échelle face à un grand nombre de dynamiques système distinctes, et l'absence d'intégration des connaissances sur les structures physiques des robots. La validation réelle a été conduite sur un quadrupède Unitree Go1, où WestWorld a démontré des performances stables en locomotion. Le code source est disponible sur GitHub.

L'architecture repose sur un mécanisme baptisé Sys-MoE (system-aware Mixture-of-Experts), qui route dynamiquement des experts spécialisés selon le système robotique fourni en entrée, via un embedding système appris. Un embedding structurel complémentaire aligne les représentations de trajectoires avec les informations morphologiques du robot, permettant au modèle de tenir compte du fait qu'un bras articulé, un quadrupède et une plateforme mobile n'obéissent pas aux mêmes contraintes physiques. Les résultats affichent des gains significatifs en prédiction de trajectoire zero-shot et few-shot face aux baselines compétitives, ainsi qu'une amélioration des performances sur le contrôle model-based downstream pour différentes plateformes robotiques. La scalabilité tient sur un spectre large d'environnements, ce qui constitue l'argument central de la contribution.

La publication s'inscrit dans une tendance forte : appliquer aux robots les world models issus du monde des agents RL et des LLMs multimodaux, à l'image de Dreamer, UniSim, ou des frameworks VLA (Vision-Language-Action) orientés manipulation. WestWorld se distingue par son ambition généraliste multi-morphologie, là où la majorité des approches concurrentes restent spécialisées sur une famille de robots. L'usage du Unitree Go1 comme banc de test réel est pertinent mais reste un cas relativement balisé dans la littérature, ce qui nuance la portée de la démonstration sim-to-real. Les prochaines étapes logiques seront d'évaluer le transfert sur des morphologies plus complexes, humanoïdes notamment, là où les défis de généralisation sont encore ouverts.

À lire aussi

GigaWorld-1 : une feuille de route pour créer des modèles du monde évaluant les politiques robotiques
1arXiv cs.RO 

GigaWorld-1 : une feuille de route pour créer des modèles du monde évaluant les politiques robotiques

Une équipe de recherche publie GigaWorld-1, un modèle du monde spécialement conçu pour évaluer les politiques robotiques, accompagné de WMBench, un banc d'essai construit à partir de données réelles de téléopération et de rollouts de politiques appariés sur des tâches de manipulation variées. L'étude analyse 7 modèles du monde vidéo, 4 schémas de représentation d'action et plus de 324 000 rollouts de politiques simulés mis en correspondance avec des exécutions robotiques réelles, en s'appuyant aussi sur les soumissions de la communauté au CVPR 2026 GigaBrain Challenge, des trajectoires synthétiques et plus de 12 000 heures de vidéos d'entraînement. Trois résultats principaux ressortent : la qualité d'un évaluateur dépend surtout de la cohérence des rollouts sur de longs horizons temporels et de leur fidélité à l'action réelle, plutôt que du simple réalisme visuel à court terme ; les gains de pré-entraînement viennent autant d'un équilibre entre connaissances générales et contrôlabilité spécifique au robot que de la seule taille des données ; et des choix d'architecture comme l'encodage d'action, la conception de la mémoire et le post-entraînement orienté évaluation déterminent fortement l'alignement avec le comportement réel du robot. Code, modèles, jeux de données et outils sont publiés en intégralité. Ce travail s'attaque à un vrai goulot d'étranglement du secteur : contrairement aux LLM, évaluables via des benchmarks numériques rapides, les politiques robotiques nécessitent des essais physiques lents, coûteux et limités par le matériel et la supervision humaine. Utiliser des modèles du monde comme évaluateurs de substitution promet d'accélérer drastiquement l'itération sur les modèles fondation embarqués (VLA), en simulant les conséquences d'une action avant tout déploiement réel. Mais jusqu'ici, personne n'avait établi méthodiquement ce qui rend un modèle du monde fiable pour ce rôle précis d'évaluateur, plutôt que pour la génération vidéo générique. En démontrant que le réalisme visuel court terme est un mauvais proxy et que la cohérence long-horizon compte davantage, l'étude remet en cause une hypothèse implicite du secteur, celle voulant qu'un bon générateur vidéo fasse automatiquement un bon simulateur d'évaluation, avec des implications directes pour tous les laboratoires qui entraînent des politiques de manipulation (type GR00T N2, Pi-0 ou Helix) et cherchent à réduire leur dépendance aux essais sur banc réel. Le travail s'inscrit dans la montée en puissance des modèles du monde comme brique d'infrastructure pour la robotique fondation, un axe de recherche porté ces derniers mois par des acteurs comme World Labs, Genie de DeepMind ou les initiatives associées au GigaBrain Challenge du CVPR 2026, dont les soumissions communautaires alimentent d'ailleurs directement WMBench. La démarche se distingue par son échelle : plus de 12 000 heures de vidéos d'entraînement et 324 000 rollouts appariés à des exécutions réelles, un volume rarement atteint pour ce type d'analyse comparative. En publiant intégralement code, modèles et jeux de données, les auteurs positionnent GigaWorld-1 et WMBench comme une référence ouverte que d'autres laboratoires pourront reprendre pour benchmarker leurs propres politiques, une étape qui pourrait accélérer la comparaison objective entre familles de modèles VLA concurrentes, aujourd'hui difficile faute de protocole d'évaluation standardisé.

RecherchePaper
1 source
WorldContact : un modèle du monde centré sur le contact pour l'apprentissage robotique à grande échelle
2arXiv cs.RO 

WorldContact : un modèle du monde centré sur le contact pour l'apprentissage robotique à grande échelle

Un article publié sur arXiv sous la référence 2609.19600v1 présente WorldContact, un modèle du monde ("world model") centré sur le contact, conçu pour la manipulation d'objets déformables comme les sacs de courses en plastique. Le système est construit à partir d'un nombre limité de trajectoires de haute qualité et prédit la dynamique des objets avec des pas de temps plus larges que le simulateur numérique classique dont il s'inspire, ce dernier nécessitant de très petits pas d'intégration pour capter les mouvements rapides et éviter l'interpénétration des surfaces. Les auteurs ont testé WorldContact sur 16 tâches de manipulation de sacs de courses. Sur un seul GPU Nvidia H100, les mesures de state-rollout montrent une accélération d'un facteur 10 par rapport au simulateur source, un chiffre qui exclut toutefois le rendu graphique et les entrées-sorties disque, ce qui limite sa comparabilité directe avec un temps d'exécution complet. Les données générées ont servi à affiner une politique vision-langage-action (VLA) existante, ensuite déployée sur un robot réel. Sur la tâche de levage de sac, le taux de réussite au premier essai passe de 65%, lorsque la politique est entraînée uniquement sur les données du simulateur d'origine, à 95% une fois le jeu de données enrichi par WorldContact. Ce résultat s'attaque à un goulot d'étranglement bien identifié dans la robotique de manipulation: l'expérience physique réelle nécessaire pour adapter un robot à un nouvel objet ou une nouvelle tâche reste coûteuse à collecter, et les objets déformables comme les tissus ou les emballages souples aggravent le problème car leur simulation fine est lente. Un modèle du monde dix fois plus rapide que la simulation physique classique, capable de produire des données d'entraînement synthétiques exploitables pour affiner une politique VLA, offre une piste concrète pour réduire ce coût. Le saut de 65% à 95% de succès sur un robot réel constitue une preuve empirique, quoique limitée à un seul type de tâche, que l'augmentation de données via world model peut combler une partie de l'écart entre simulation et réalité pour la manipulation déformable, un domaine où les politiques génériques peinent généralement à généraliser. L'étude s'inscrit dans la tendance croissante des modèles du monde appris comme alternative ou complément aux simulateurs physiques classiques en robotique, ces derniers étant pénalisés par leurs contraintes d'intégration numérique sur les phénomènes de contact rapide. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier de déploiement au-delà de la validation expérimentale sur robot réel; les résultats, obtenus sur 16 tâches centrées sur un seul type d'objet, relèvent d'une preuve de concept plutôt que d'un système prêt à l'industrialisation, la généralisation à d'autres catégories d'objets déformables restant à démontrer.

RecherchePaper
1 source
$\mu_0$ : un modèle du monde 3D évolutif par traces d'interaction
3arXiv cs.RO 

$\mu_0$ : un modèle du monde 3D évolutif par traces d'interaction

Des chercheurs présentent μ₀ (mu-zéro), un modèle mondial 3D à base de traces d'interaction, publié en préprint sur arXiv (2506.13769) en juin 2025. Plutôt que de reconstruire des pixels denses comme les modèles vidéo, ou d'exiger des étiquettes d'action spécifiques à chaque morphologie robotique, μ₀ prédit des trajectoires 3D lisses pour des points saillants : objets, outils, mains et zones de contact, encodées en points de contrôle B-spline. Le système TraceExtract extrait automatiquement cette supervision depuis des vidéos diversifiées, en sélectionnant des points clés, construisant des traces alignées globalement et associant chaque segment à des légendes linguistiques hiérarchiques. L'architecture couple un backbone vision-langage préentraîné à un expert de traces modulaire. Dans les expériences de laboratoire, μ₀ dépasse les baselines en prédiction de traces 2D et 3D, y compris les approches VLM tokenisées. L'enjeu central est l'interopérabilité cross-embodiment : permettre à une politique robotique d'opérer sur différentes morphologies sans données d'action spécifiques. Les VLA comme π₀ de Physical Intelligence ou GR00T N2 de NVIDIA nécessitent des téléopérations coûteuses pour étiqueter les actions, freinant la scalabilité. μ₀ contourne ce verrou en apprenant une représentation intermédiaire agnostique à l'embodiment, couplable ensuite à des experts d'action légers par morphologie cible. Résultat notable : malgré un préentraînement entièrement sans étiquettes d'action, les politiques trace-conditionnées atteignent des performances compétitives avec π₀, un VLA entraîné avec supervision d'action complète. Si cette généralisation se confirme à l'échelle, des politiques de manipulation pourraient être entraînées massivement sur des vidéos génériques, humaines ou issues de la simulation, sans collecte de données robot-spécifiques. La robotique de manipulation cherche depuis des années à s'affranchir des données proprioceptives labellisées, coûteuses à collecter. Deux approches dominent actuellement : les modèles vidéo pixel-dense comme UniSim ou Genie, et les VLA directs comme OpenVLA, π₀ ou GR00T N2, chacun présentant ses propres limites de scalabilité ou de spécificité. μ₀ propose un troisième espace latent, la trace 3D compacte, entraînable sur des vidéos brutes. Les concurrents les plus proches incluent les travaux de point-tracking tels que TAPIR et CoTracker, ainsi que les modèles d'action en espace latent. Le papier reste un préprint de laboratoire sans déploiement industriel annoncé, et la robustesse en environnement réel non contrôlé reste à démontrer. Les prochaines étapes logiques incluent la validation sur des flottes multi-robots hétérogènes et l'intégration dans des pipelines d'imitation learning à grande échelle.

RechercheOpinion
1 source
GelNeuro : un système tactile neuromorphique intégrant détection et calcul pour la reconnaissance de textures
4arXiv cs.RO 

GelNeuro : un système tactile neuromorphique intégrant détection et calcul pour la reconnaissance de textures

Une équipe de recherche a présenté GelNeuro, un système tactile neuromorphique entièrement intégré combinant un capteur optique GelSight Mini avec la puce neuromorphique Speck2f. Contrairement aux systèmes existants qui dépendent d'un ordinateur hôte pour lire, prétraiter ou relayer les données avant inférence, GelNeuro traite tout directement sur puce : les mouvements des marqueurs induits par le contact sont capturés sous forme d'événements par un capteur de vision dynamique (DVS), puis acheminés via le réseau embarqué vers un classificateur à réseau de neurones convolutif à impulsions (SCNN). Pour limiter la perte de précision lors du déploiement en 8 bits, les chercheurs ont introduit une stratégie de bridage des poids adaptée au matériel (hardware-aware weight clamping). Testé en conditions réelles sur puce physique pour une tâche de reconnaissance de 15 classes de textures naturelles, le système atteint 96,3% de précision avec une fenêtre d'inférence de seulement 80 millisecondes, tout en ne consommant que 19,6 mW de puissance active au niveau carte. Cette consommation représente plus de trois ordres de grandeur de moins que les architectures CPU/GPU classiques évaluées sur le même benchmark, ce qui change la donne pour l'intégration de perception tactile fine sur des plateformes embarquées à budget énergétique serré, comme les mains robotiques, les préhenseurs ou les capteurs distribués sur des robots mobiles. Le résultat appuie une thèse plus large du secteur neuromorphique : que le traitement événementiel de bout en bout, du capteur à la puce, peut remplacer les pipelines classiques gourmands en calcul sans sacrifier la précision, du moins sur des tâches de classification tactile bien définies. GelNeuro montre aussi une bonne généralisation face à des profondeurs de contact non vues à l'entraînement, un point clé pour une utilisation en conditions réelles variables. Ce travail s'inscrit dans la lignée des efforts récents pour rapprocher capteur et calcul, un axe déjà exploré par les puces Speck de SynSense et les capteurs optiques tactiles GelSight, tous deux largement utilisés dans la recherche en robotique manipulatrice. La prochaine étape naturelle serait une validation sur des tâches de manipulation en boucle fermée plutôt que sur la seule classification de textures, ainsi qu'une intégration physique complète dans une main ou un doigt robotique.

RecherchePaper
1 source