Aller au contenu principal
WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable
IA physiquearXiv cs.RO 

WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de WSA₁ proposent un nouveau modèle fondation pour la robotique généraliste, construit autour d'un paradigme baptisé "World-Spatial-Action" centré sur la 3D. Contrairement aux modèles robot-fondation (RFM) classiques qui associent directement perception visuelle 2D et instructions langagières à des actions continues, WSA₁ apprend une représentation explicite de l'état spatial 3D du monde et de ses transitions, puis relie ces transitions aux actions du robot. Le modèle a été préentraîné sur 6 000 heures de démonstrations expertes, dont seulement 1 000 heures issues de robots réels, le reste provenant de sources simulées ou synthétiques. Sur le benchmark de simulation RoboTwin2.0, WSA₁ atteint un taux de réussite de 93% en manipulation, et sur des tâches de contrôle robotique en conditions réelles il affiche un gain moyen de 20% par rapport aux meilleurs RFM existants.

L'enjeu pour l'industrie robotique est la sobriété en données réelles. La plupart des modèles fondation actuels, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, dépendent de volumes massifs de téléopération et de collecte sur robots physiques, une contrainte coûteuse qui freine leur déploiement à grande échelle chez les intégrateurs. En démontrant qu'une modélisation conjointe 3D monde-action permet d'atteindre une généralisation compétitive avec un ratio de données réelles très faible, WSA₁ ouvre une voie potentiellement plus abordable vers des systèmes robotiques polyvalents, sans nécessiter les flottes de collecte massives déployées par des acteurs comme Figure ou Tesla pour leurs humanoïdes.

Ce travail s'inscrit dans la lignée des critiques adressées aux RFM actuels, accusés de manquer d'un raisonnement physique réel sur la dynamique 3D et les effets causaux des actions du robot sur son environnement, un décalage jugé limitant pour la généralisation en conditions réelles. Les auteurs positionnent explicitement WSA₁ face aux modèles VLA (vision-language-action) de référence du secteur. La publication, encore au stade de préprint arXiv, ne détaille pas de calendrier de déploiement industriel ni de partenariat matériel, les prochaines étapes attendues portant vraisemblablement sur une validation élargie hors simulation et sur des comparaisons directes avec davantage de RFM concurrents.

Dans nos dossiers

À lire aussi

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche
1arXiv cs.RO 

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche

Des chercheurs ont présenté Agile-WAM, un "world action model" (WAM) tactile pour le contrôle robotique en manipulation à contact riche, détaillé dans un preprint arXiv (2609.20761) et sur une page de projet dédiée portant le nom de code TARO. Le modèle encode vision et tactile dans un espace latent partagé, exploité par un processus de flow-matching direct vision-tactile-vers-action qui génère à la fois des séquences d'actions et les latents visuels/tactiles futurs. Sa particularité est une prédiction multimodale à horizons multiples : supervision visuelle à décalage temporel large, les images voisines étant peu différentes, mais prédiction tactile image par image pour capter les changements brusques au moment du contact. Testé sur neuf tâches simulées et cinq tâches réelles de manipulation, Agile-WAM obtient un gain relatif de 29,4% en taux de succès sur les cinq essais réels, pour une latence d'inférence de 11,9 millisecondes. Ce résultat répond à une limite concrète des WAM tactiles existants, qui s'appuient souvent sur de lourds backbones génératifs pré-entraînés au détriment de la latence et du déploiement temps réel. En affichant une inférence à un chiffre de millisecondes tout en dépassant sa meilleure baseline, Agile-WAM suggère qu'un contrôle précis et à haute fréquence, nécessaire dès que le contact évolue plus vite que l'image, ne requiert pas forcément les architectures massives des VLA généralistes type Pi-0 ou GR00T N2. Pour les équipes de recherche et les intégrateurs travaillant sur l'insertion de pièces, l'assemblage ou la préhension fine, l'apport principal est méthodologique : traiter vision et tactile à des échelles temporelles distinctes améliore à la fois précision et efficacité, plutôt qu'une simple fusion multimodale. Le travail s'inscrit dans la lignée des world models robotiques, qui étendent les politiques visuomotrices classiques en apprenant conjointement la dynamique du monde et l'action à produire, une piste déjà suivie par des VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), rarement avec un signal tactile aussi fin. Les auteurs positionnent Agile-WAM contre des WAM tactiles antérieurs jugés trop coûteux en calcul, sans les nommer précisément dans le résumé. Il s'agit à ce stade d'un preprint de recherche non encore revu par les pairs, appuyé par des démonstrations en simulation et cinq essais réels, sans partenaire industriel ni calendrier de déploiement annoncé.

IA physiqueOpinion
1 source
Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable
2arXiv cs.RO 

Robot Control : un pré-entraînement vidéo-action natif pour un contrôle robotique généralisable

Une équipe de recherche présente, dans un preprint publié sur arXiv (arXiv:2607.08639v1), LingBot-VA 2.0, un modèle fondation vidéo-action conçu spécifiquement pour le contrôle robotique, en succession directe de LingBot-VA. Quatre changements architecturaux structurent cette évolution. D'abord, l'équipe abandonne les VAE classiques axés sur la reconstruction d'image au profit d'un tokenizer visuel-action sémantique, qui aligne les représentations visuelles à la fois sur le sens et sur l'action, ce qui améliore le suivi d'instructions et la précision des gestes lors de l'apprentissage de politiques. Ensuite, le modèle adopte un pré-entraînement causal from scratch plutôt qu'une architecture bidirectionnelle adaptée après coup, pour éviter l'oubli catastrophique observé lors de ce type d'adaptation. Troisième point, un backbone MoE (mixture of experts) épars permet d'augmenter la capacité du modèle sans alourdir l'inférence, condition nécessaire pour du contrôle à haute fréquence. Enfin, un schéma d'inférence asynchrone prédit les futurs états latents en parallèle de l'exécution des actions, en recalant chaque rollout sur la dernière observation via une dynamique prédictive apprise, pour du contrôle en boucle fermée temps réel. Le papier ne précise ni le nombre de degrés de liberté, ni le payload, ni les sites ou volumes de déploiement, ni de calendrier commercial. Cette publication s'inscrit dans la course aux modèles VLA (vision-language-action) pour la robotique généraliste, où l'enjeu central est de dépasser le simple réemploi de générateurs vidéo pensés pour le contenu numérique, souvent inadaptés à la physique du monde réel faute d'ancrage dans l'action. En traitant frontalement l'oubli catastrophique et le coût d'inférence, LingBot-VA 2.0 répond à deux limites fréquemment citées des modèles fondation robotiques actuels: la difficulté à tenir un contrôle réactif et la fragilité des architectures reconverties depuis la génération vidéo pure. LingBot-VA 2.0 vient after LingBot-VA, dans un paysage où rivalisent des modèles comme GR00T N2 (Nvidia), Helix (Figure) ou Pi-0 (Physical Intelligence). Le papier revendique une validation par déploiement réel et une généralisation few-shot sur des tâches de manipulation complexes, mais sans benchmark chiffré ni comparaison directe publiée à ce stade, la portée exacte de ces résultats reste à confirmer par des évaluations indépendantes.

IA physiqueActu
1 source
STARRY : modélisation du monde centrée sur l'action spatio-temporelle pour la manipulation robotique
3arXiv cs.RO 

STARRY : modélisation du monde centrée sur l'action spatio-temporelle pour la manipulation robotique

Des chercheurs ont publié sur arXiv (arXiv:2604.26848) un nouveau modèle de politique robotique appelé STARRY, conçu pour améliorer la manipulation d'objets en intégrant un module de prédiction spatiotemporelle directement dans la boucle de génération d'actions. L'architecture repose sur un débruitage conjoint de latents spatiotemporels futurs et de séquences d'actions, complété par un mécanisme baptisé Geometry-Aware Selective Attention Modulation (GASAM), qui convertit la profondeur prédite et la géométrie de l'effecteur terminal en poids d'attention alignés sur les tokens d'action. Sur le benchmark RoboTwin 2.0, STARRY atteint 93,82 % de taux de succès moyen en configuration propre (Clean) et 93,30 % en configuration aléatoire (Randomized). En conditions réelles, le modèle améliore le taux de succès de 42,5 % à 70,8 % par rapport à π0.5, la politique de référence de Physical Intelligence. Ce résultat en conditions réelles mérite attention : le delta de +28,3 points sur π0.5 suggère que l'intégration explicite de la structure spatiotemporelle dans la politique, plutôt qu'en post-traitement, apporte un gain concret au-delà du benchmark simulé. Pour les intégrateurs et décideurs industriels, c'est un signal que le sim-to-real gap sur des tâches de manipulation précise reste un vrai verrou, et que les architectures VLA (Vision-Language-Action) classiques, sans modélisation de l'interaction future, plafonnent sur les scénarios à forte contrainte géométrique. La distinction entre prédire le monde et prédire ce qui est pertinent pour l'action semble être la clé ici, ce que STARRY formalise avec GASAM. STARRY s'inscrit dans une compétition dense autour des politiques VLA pour la manipulation : π0 et π0.5 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA, et les travaux issus des labos de Stanford, CMU ou Berkeley. Le benchmark RoboTwin 2.0, utilisé comme terrain d'évaluation principal, est un environnement de simulation récent orienté tâches bimanuelles. Il convient de noter que cette publication est un preprint arXiv, sans revue par les pairs à ce stade, et que les expériences réelles décrites semblent limitées en nombre de tâches et de contextes. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks plus diversifiés comme LIBERO ou Open X-Embodiment, et une validation à plus grande échelle en environnement industriel réel.

IA physiqueOpinion
1 source
Runway présente Praxis-1, un modèle du monde et d'action pour la robotique
4Robotics Business Review 

Runway présente Praxis-1, un modèle du monde et d'action pour la robotique

Runway AI, la société new-yorkaise fondée en 2018 et connue pour ses modèles génératifs vidéo, a présenté cette semaine Praxis-1, un « world action model » à poids ouverts qui convertit son pré-entraînement vidéo à grande échelle en commandes pour robots. Le modèle s'appuie sur la même base que les world models généraux de l'entreprise (GWM-1, Gen-4.5, Aleph 2.0, Act-Two) et apprend surtout à partir de vidéos filmées à la troisième personne, non de démonstrations téléopérées. Il a été entraîné sur des tâches de manipulation allant du simple pick-and-place (soulever des canettes) à la manipulation d'objets déformables (emballer des sacs cadeaux). Runway affirme que la simulation de politiques robotiques dans son world model prédit les résultats réels avec une corrélation de 0,95, mieux que des techniques plus coûteuses fondées sur la reconstruction 3D, sans publier de détails méthodologiques. Des partenaires pilotes (Noble Machines, Standard Bots et Ultra) font tourner Praxis-1 sur leur propre matériel, des bras bimanuels aux humanoïdes, avec un fine-tuning léger. La sortie publique est annoncée « dans les prochains mois », sans date. L'enjeu est de savoir si la vidéo peut remplacer, au moins en partie, la donnée robot, rare et chère à collecter. Selon Kamil Sindi, directeur technique de Runway, la performance progresse avec le volume de vidéo, de sorte que le plafond du modèle dépendrait de la quantité de vidéo disponible plutôt que du nombre de démonstrations. Si cela se confirme, le goulot d'étranglement des politiques généralistes se déplacerait de la collecte téléopérée vers le curage de données vidéo. Pour les intégrateurs, la promesse d'un modèle unique adaptable à plusieurs morphologies avec peu de fine-tuning serait un gain de coût réel. Il faut toutefois rester prudent : aucun taux de réussite, aucun temps de cycle ni aucune comparaison avec des politiques existantes n'a été publié, et les retours des partenaires sont rapportés par Runway elle-même. Le chiffre de 0,95 mesure la fidélité de la simulation, pas la performance sur site. À ce stade, il s'agit d'une annonce avec des tests partenaires, pas d'un produit livré ni d'un déploiement en production. Runway arrive en robotique depuis la vidéo générative, après GWM-1 et des modèles interactifs temps réel comme Solaris et GWM Worlds 2, conçus pour créer des environnements d'entraînement d'agents. L'entreprise, qui a des bureaux à New York, San Francisco, Seattle, Londres, Paris, Tel Aviv et Tokyo, rejoint un champ où les approches VLA (vision-langage-action) et world models se disputent le terrain, face à des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix), qui s'appuient davantage sur des données robot. Le choix des poids ouverts est assumé : Sindi y voit un levier pour que les États-Unis retrouvent leur avance industrielle, en laissant aux fabricants de matériel de la flexibilité. Les prochaines étapes sont l'élargissement du cercle de partenaires avant la sortie publique et la validation sur davantage de robots, pour combler les écarts avant la disponibilité générale. Aucun acteur français ou européen n'est cité parmi les partenaires.

UEPas d\'impact direct sur la France/UE

IA physiqueActu
1 source