Aller au contenu principal
Runway présente Praxis-1, un modèle du monde et d'action pour la robotique
IA physiqueRobotics Business Review 

Runway présente Praxis-1, un modèle du monde et d'action pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Runway AI, la société new-yorkaise fondée en 2018 et connue pour ses modèles génératifs vidéo, a présenté cette semaine Praxis-1, un « world action model » à poids ouverts qui convertit son pré-entraînement vidéo à grande échelle en commandes pour robots. Le modèle s'appuie sur la même base que les world models généraux de l'entreprise (GWM-1, Gen-4.5, Aleph 2.0, Act-Two) et apprend surtout à partir de vidéos filmées à la troisième personne, non de démonstrations téléopérées. Il a été entraîné sur des tâches de manipulation allant du simple pick-and-place (soulever des canettes) à la manipulation d'objets déformables (emballer des sacs cadeaux). Runway affirme que la simulation de politiques robotiques dans son world model prédit les résultats réels avec une corrélation de 0,95, mieux que des techniques plus coûteuses fondées sur la reconstruction 3D, sans publier de détails méthodologiques. Des partenaires pilotes (Noble Machines, Standard Bots et Ultra) font tourner Praxis-1 sur leur propre matériel, des bras bimanuels aux humanoïdes, avec un fine-tuning léger. La sortie publique est annoncée « dans les prochains mois », sans date.

L'enjeu est de savoir si la vidéo peut remplacer, au moins en partie, la donnée robot, rare et chère à collecter. Selon Kamil Sindi, directeur technique de Runway, la performance progresse avec le volume de vidéo, de sorte que le plafond du modèle dépendrait de la quantité de vidéo disponible plutôt que du nombre de démonstrations. Si cela se confirme, le goulot d'étranglement des politiques généralistes se déplacerait de la collecte téléopérée vers le curage de données vidéo. Pour les intégrateurs, la promesse d'un modèle unique adaptable à plusieurs morphologies avec peu de fine-tuning serait un gain de coût réel. Il faut toutefois rester prudent : aucun taux de réussite, aucun temps de cycle ni aucune comparaison avec des politiques existantes n'a été publié, et les retours des partenaires sont rapportés par Runway elle-même. Le chiffre de 0,95 mesure la fidélité de la simulation, pas la performance sur site. À ce stade, il s'agit d'une annonce avec des tests partenaires, pas d'un produit livré ni d'un déploiement en production.

Runway arrive en robotique depuis la vidéo générative, après GWM-1 et des modèles interactifs temps réel comme Solaris et GWM Worlds 2, conçus pour créer des environnements d'entraînement d'agents. L'entreprise, qui a des bureaux à New York, San Francisco, Seattle, Londres, Paris, Tel Aviv et Tokyo, rejoint un champ où les approches VLA (vision-langage-action) et world models se disputent le terrain, face à des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix), qui s'appuient davantage sur des données robot. Le choix des poids ouverts est assumé : Sindi y voit un levier pour que les États-Unis retrouvent leur avance industrielle, en laissant aux fabricants de matériel de la flexibilité. Les prochaines étapes sont l'élargissement du cercle de partenaires avant la sortie publique et la validation sur davantage de robots, pour combler les écarts avant la disponibilité générale. Aucun acteur français ou européen n'est cité parmi les partenaires.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique
1arXiv cs.RO 

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique

Des chercheurs ont déposé le 1er juin 2026 sur arXiv (réf. 2606.01027) τ₀-WM (tau-zéro World Model), une architecture unifiée vidéo-action pour la manipulation robotique. Le modèle repose sur un backbone de diffusion vidéo partagé qui intègre simultanément apprentissage de politique, prédiction vidéo et évaluation d'actions au sein d'un même cadre prédictif. Il expose deux interfaces complémentaires : un modèle d'action vidéo qui prédit conjointement des représentations visuelles latentes futures et des séquences d'actions continues à partir d'observations multi-caméras, d'instructions en langage naturel et de l'état courant du robot ; et un simulateur vidéo conditionné sur l'action, capable de dérouler des séquences candidates en projections multi-vues tout en attribuant des scores denses de progression de tâche. L'entraînement porte sur environ 27 300 heures de données combinant téléopération réelle, interactions de style UMI (Universal Manipulation Interface, protocole de collecte de données en bimanuel développé par Stanford), vidéos égocentrées humaines, et trajectoires de succès comme d'échecs. L'intérêt principal réside dans la convergence entre politique et modèle de monde au sein d'une architecture commune. Les VLA (Vision-Language-Action models) actuels génèrent des actions sans anticiper leurs conséquences, laissant la gestion des erreurs à des modules séparés. τ₀-WM introduit un mécanisme de rectification à l'inférence : le simulateur évalue chaque séquence candidate via un score dense de progression, et les candidats jugés insuffisants sont corrigés par re-débruitage. Ce test-time scaling structuré pourrait réduire les interventions humaines sur des tâches longue durée, un enjeu clé pour les intégrateurs industriels qui peinent encore à déployer des robots autonomes sur des séquences de plus de quelques étapes. Sur les benchmarks de manipulation fine et longue séquence, les auteurs déclarent surpasser les baselines comparables, sans préciser les conditions expérimentales ni les contraintes matérielles testées. Ce travail s'inscrit dans une course engagée depuis fin 2024 entre Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Figure (Helix) pour des architectures VLA à grande échelle, mais rares sont celles qui intègrent simulation interne et évaluation d'action dans un seul modèle plutôt que dans un pipeline découplé. L'usage de données UMI signale une stratégie d'agrégation multi-source qui dépasse les corpus propriétaires et pourrait favoriser la généralisation à de nouveaux environnements. Le papier reste pour l'instant un preprint non soumis à revue par les pairs : les performances annoncées restent à valider sur robot physique en conditions réelles, et aucune date de déploiement ou partenariat industriel n'est mentionné.

IA physiqueOpinion
1 source
Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche
2arXiv cs.RO 

Agile-WAM : un modèle d'action-monde tactile agile pour le contrôle robotique en contact riche

Des chercheurs ont présenté Agile-WAM, un "world action model" (WAM) tactile pour le contrôle robotique en manipulation à contact riche, détaillé dans un preprint arXiv (2609.20761) et sur une page de projet dédiée portant le nom de code TARO. Le modèle encode vision et tactile dans un espace latent partagé, exploité par un processus de flow-matching direct vision-tactile-vers-action qui génère à la fois des séquences d'actions et les latents visuels/tactiles futurs. Sa particularité est une prédiction multimodale à horizons multiples : supervision visuelle à décalage temporel large, les images voisines étant peu différentes, mais prédiction tactile image par image pour capter les changements brusques au moment du contact. Testé sur neuf tâches simulées et cinq tâches réelles de manipulation, Agile-WAM obtient un gain relatif de 29,4% en taux de succès sur les cinq essais réels, pour une latence d'inférence de 11,9 millisecondes. Ce résultat répond à une limite concrète des WAM tactiles existants, qui s'appuient souvent sur de lourds backbones génératifs pré-entraînés au détriment de la latence et du déploiement temps réel. En affichant une inférence à un chiffre de millisecondes tout en dépassant sa meilleure baseline, Agile-WAM suggère qu'un contrôle précis et à haute fréquence, nécessaire dès que le contact évolue plus vite que l'image, ne requiert pas forcément les architectures massives des VLA généralistes type Pi-0 ou GR00T N2. Pour les équipes de recherche et les intégrateurs travaillant sur l'insertion de pièces, l'assemblage ou la préhension fine, l'apport principal est méthodologique : traiter vision et tactile à des échelles temporelles distinctes améliore à la fois précision et efficacité, plutôt qu'une simple fusion multimodale. Le travail s'inscrit dans la lignée des world models robotiques, qui étendent les politiques visuomotrices classiques en apprenant conjointement la dynamique du monde et l'action à produire, une piste déjà suivie par des VLA comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), rarement avec un signal tactile aussi fin. Les auteurs positionnent Agile-WAM contre des WAM tactiles antérieurs jugés trop coûteux en calcul, sans les nommer précisément dans le résumé. Il s'agit à ce stade d'un preprint de recherche non encore revu par les pairs, appuyé par des démonstrations en simulation et cinq essais réels, sans partenaire industriel ni calendrier de déploiement annoncé.

IA physiqueOpinion
1 source
WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable
3arXiv cs.RO 

WSA$_1$ : un modèle monde-spatial-action centré sur la 3D pour un contrôle robotique généralisable

Les chercheurs à l'origine de WSA₁ proposent un nouveau modèle fondation pour la robotique généraliste, construit autour d'un paradigme baptisé "World-Spatial-Action" centré sur la 3D. Contrairement aux modèles robot-fondation (RFM) classiques qui associent directement perception visuelle 2D et instructions langagières à des actions continues, WSA₁ apprend une représentation explicite de l'état spatial 3D du monde et de ses transitions, puis relie ces transitions aux actions du robot. Le modèle a été préentraîné sur 6 000 heures de démonstrations expertes, dont seulement 1 000 heures issues de robots réels, le reste provenant de sources simulées ou synthétiques. Sur le benchmark de simulation RoboTwin2.0, WSA₁ atteint un taux de réussite de 93% en manipulation, et sur des tâches de contrôle robotique en conditions réelles il affiche un gain moyen de 20% par rapport aux meilleurs RFM existants. L'enjeu pour l'industrie robotique est la sobriété en données réelles. La plupart des modèles fondation actuels, qu'il s'agisse de Pi-0, GR00T N2 ou Helix, dépendent de volumes massifs de téléopération et de collecte sur robots physiques, une contrainte coûteuse qui freine leur déploiement à grande échelle chez les intégrateurs. En démontrant qu'une modélisation conjointe 3D monde-action permet d'atteindre une généralisation compétitive avec un ratio de données réelles très faible, WSA₁ ouvre une voie potentiellement plus abordable vers des systèmes robotiques polyvalents, sans nécessiter les flottes de collecte massives déployées par des acteurs comme Figure ou Tesla pour leurs humanoïdes. Ce travail s'inscrit dans la lignée des critiques adressées aux RFM actuels, accusés de manquer d'un raisonnement physique réel sur la dynamique 3D et les effets causaux des actions du robot sur son environnement, un décalage jugé limitant pour la généralisation en conditions réelles. Les auteurs positionnent explicitement WSA₁ face aux modèles VLA (vision-language-action) de référence du secteur. La publication, encore au stade de préprint arXiv, ne détaille pas de calendrier de déploiement industriel ni de partenariat matériel, les prochaines étapes attendues portant vraisemblablement sur une validation élargie hors simulation et sur des comparaisons directes avec davantage de RFM concurrents.

IA physiqueActu
1 source
Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique
4Robotics Business Review 

Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique

Genesis AI, startup californienne basée à Palo Alto, a présenté le 6 mai 2026 son modèle fondation GENE-26.5, conçu pour la manipulation robotique dextre bimane à vocation généraliste. La société fondée par Zhou Xian revendique des "capacités de manipulation physique au niveau humain" et annonce simultanément deux composants propriétaires : un moteur de données destiné à lever le plafond de volumétrie d'entraînement, et une main robotique à l'échelle humaine couplée à un gant de capture tactile. Ce gant, équipé d'une peau électronique à capteurs, est conçu pour assurer un mappage 1:1:1 entre le gant, la main humaine et l'effecteur robotique, réduisant la perte de fidélité dans le transfert de compétences téléopérées. Pour illustrer les capacités de GENE-26.5, Genesis AI a publié une vidéo montrant un robot réaliser une séquence de cuisson en 20 étapes (découpe de tomates, cassage d'œuf d'une main, coordination bimane), préparer un smoothie avec service en plein air, exécuter des expériences de laboratoire incluant pipetage et transfert de liquides, câbler des faisceaux électroniques, résoudre un Rubik's Cube en manipulation aérienne, saisir simultanément quatre objets de tailles variables, et jouer du piano. Genesis AI était sortie de stealth en 2025 avec 105 millions de dollars de financement. L'enjeu industriel de cette annonce se situe à deux niveaux distincts. Le moteur de données propriétaire cible le principal frein aux modèles de fondation en robotique : l'absence de données de manipulation dextre à grande échelle et haute fidélité. Le gant tactile cherche à résoudre l'embodiment gap, soit la discontinuité morphologique entre effecteur robotique et main humaine qui dégrade le transfert de compétences. Si le mappage 1:1:1 annoncé tient en production, il ouvrirait la voie à une scalabilité des données de téléopération rarement atteinte dans les systèmes actuels. Il convient toutefois de tempérer : les démonstrations présentées sont des vidéos produites et sélectionnées par l'entreprise elle-même. Aucun benchmark indépendant, aucun taux de succès en environnement industriel non contrôlé n'est communiqué. Les affirmations de performance "au niveau humain" émanent exclusivement de Genesis AI et d'Eric Schmidt, ex-PDG de Google et investisseur dans la société. Genesis AI évolue dans un segment en pleine consolidation. Sur le terrain des modèles de fondation pour la manipulation, elle affronte Physical Intelligence (Pi-0, Pi-0.5, Pi-1, San Francisco), Nvidia avec GR00T N2 lancé en novembre 2024, et Figure AI dont la plateforme Figure 03 progresse vers le déploiement industriel chez BMW. La différenciation de Genesis AI porte sur la verticalisation hardware-software : là où Physical Intelligence s'appuie sur du matériel tiers, Genesis AI contrôle à la fois le modèle et l'effecteur. L'entreprise n'a communiqué aucun calendrier de déploiement commercial précis ni partenariat industriel signé. La prochaine étape observable sera de vérifier si les performances démontrées en vidéo se traduisent en métriques reproductibles dans des environnements réels, hors conditions de studio.

IA physiqueOpinion
1 source