Aller au contenu principal
RecherchearXiv cs.RO 

UniWAM : modèle unifié du monde et de l'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

UniWAM, présenté sur arXiv (2610.02054, première version), est une architecture unifiée qui combine trois blocs : un « raisonneur physique » issu d'un modèle vision-langage préentraîné, un générateur de monde (vidéo) et un prédicteur d'actions. L'ensemble apprend conjointement la compréhension sémantique du monde physique, la génération visuelle et la prédiction d'actions. Les auteurs ont construit un pipeline de nettoyage et d'annotation pour les données égocentriques humaines et les données robot. Les actions bas niveau sont exprimées en langage naturel, afin de préserver les capacités linguistiques du modèle de base. Le préentraînement répartit les supervisions entre composants : VQA (questions-réponses visuelles), vidéos égocentriques humaines et démonstrations robot. Au post-entraînement, une augmentation par bruit visuel sur le futur réduit la dépendance à des prédictions précises, et un flow matching conditionné par l'historique d'actions initialise la génération d'actions. Selon les auteurs, cela réduit nettement le nombre d'étapes de débruitage sans perte de performance. Ils revendiquent l'état de l'art en performance in-distribution, robustesse, généralisation, suivi d'instructions et tâches longues. Le résumé ne donne ni chiffres ni noms de benchmarks.

L'intérêt est de s'attaquer à un compromis connu. Les modèles VLA (vision-langage-action) héritent du raisonnement des VLM, mais une supervision limitée aux actions leur donne peu d'ancrage dans la dynamique physique. À l'inverse, les modèles monde-action, bâtis sur la génération vidéo, captent bien les régularités spatio-temporelles mais comprennent et raisonnent moins bien hors distribution. Unifier les deux dans un seul modèle est une réponse directe à ce problème de robustesse, qui compte pour les intégrateurs confrontés au fossé entre démo et déploiement. La réduction des étapes de débruitage compte aussi pour la latence de contrôle, point faible des approches fondées sur la vidéo. Le résultat le plus transposable est la loi d'échelle log-linéaire du co-entraînement humain-robot. Si elle se confirme, elle soutient l'idée que les vidéos humaines, bien moins chères que la téléopération, peuvent servir de levier de données. Prudence toutefois : il s'agit d'un préprint non évalué par les pairs, sans test annoncé sur robot en production.

Ce travail s'inscrit dans la course entre VLA (Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure) et modèles monde-action, qui exploitent la génération vidéo pour la planification. Il prolonge aussi la tendance à exploiter les données égocentriques humaines pour pallier la rareté des démonstrations robot. Le résumé ne cite ni équipe, ni plateforme robotique, ni calendrier de publication du code ou des poids. Il faudra donc attendre le texte complet pour juger du protocole, de la comparaison avec les références et de la validation sur matériel réel.

À lire aussi

RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde
1arXiv cs.RO 

RynnVLA-002 : un modèle unifié vision-langage-action (VLA) et du monde

Une équipe de recherche a publié RynnVLA-002, un modèle unifié combinant Vision-Language-Action (VLA) et world model, présenté en preprint sur arXiv (2511.17502v3). L'architecture couple deux composantes interdépendantes : le world model prédit des états visuels futurs à partir des actions et observations courantes, apprenant ainsi la physique implicite de l'environnement ; le modèle VLA génère en retour les actions suivantes depuis des observations visuelles brutes. Ce couplage bidirectionnel vise un apprentissage conjoint de la dynamique environnementale et de la planification motrice. Sur le benchmark de simulation LIBERO, RynnVLA-002 atteint 97,4 % de taux de succès sans pré-entraînement. En conditions réelles, dans des expériences conduites avec le framework open-source LeRobot de Hugging Face, l'intégration du world model améliore le taux de succès global de 50 % par rapport au modèle VLA seul. L'intérêt de cette architecture tient dans la mutualisation de deux paradigmes historiquement distincts. Les world models ont longtemps servi d'outils de planification offline ou de data augmentation, tandis que les VLA visent la génération d'actions en temps réel depuis des observations brutes. RynnVLA-002 cherche à démontrer leur renforcement mutuel : le world model corrige la génération d'actions en anticipant leurs conséquences visuelles, ce qui réduit la dépendance aux données d'entraînement dans des zones peu couvertes. Le gain de 50 % en real-world est significatif, mais le preprint reste peu disert sur la diversité des tâches testées et les conditions expérimentales précises, ce qui rend une évaluation indépendante prématurée. Pour les équipes confrontées au sim-to-real gap, l'idée d'ancrer une VLA dans une représentation physique anticipatrice constitue néanmoins une direction crédible. Les VLA sont devenus un terrain de compétition dense depuis Pi-0 de Physical Intelligence, OpenVLA, et les approches RoboVLMs, qui exploitent des backbones vision-langage pré-entraînés pour produire des politiques généralisables. Côté world models, des travaux comme Dreamer (DeepMind) et UniSim ont popularisé la prédiction vidéo comme supervision indirecte pour la robotique. RynnVLA-002 cherche à unifier explicitement ces deux lignes, se différenciant ainsi des architectures à modules séparés. À sa troisième version de preprint, le travail est en itération active, mais aucune affiliation institutionnelle claire ni partenariat industriel n'est mentionné dans l'abstract, ce qui limite l'évaluation de sa maturité réelle. Les prochaines étapes logiques incluront une validation sur des benchmarks plus exigeants comme CALVIN ou RLBench, et idéalement une publication des poids du modèle pour permettre une réplication indépendante.

UEL'utilisation de LeRobot (framework open-source de HuggingFace, entreprise française) comme cadre expérimental de référence valide l'écosystème robotique open-source porté par un acteur français, sans impact direct sur le marché ou la R&D en France/UE.

RechercheOpinion
1 source
DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
2arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
Robot mobile-manipulateur unifié : ABot-M0.5 présente un modèle d'action du monde
3arXiv cs.RO 

Robot mobile-manipulateur unifié : ABot-M0.5 présente un modèle d'action du monde

Des chercheurs présentent ABot-M0.5, un nouveau "World Action Model" (WAM) conçu pour la manipulation mobile, cette capacité qui combine navigation et manipulation d'objets chez un robot généraliste. Publié sur arXiv début juillet 2026, l'article part d'un constat : les politiques VLA actuelles restent réactives et sans modélisation explicite du monde, tandis que les WAM existants sont mal adaptés à la manipulation mobile car ils traitent des séquences vidéo trop grossières, mélangent les actions de navigation et de manipulation, et entraînent leur dynamique inverse avec une supervision qui ne correspond pas aux conditions réelles d'inférence autorégressive. Pour y remédier, ABot-M0.5 introduit des "actions latentes intermédiaires" qui capturent les transitions visuelles locales et servent de pont entre les représentations vidéo et les commandes propres à chaque robot. Le modèle repose aussi sur une architecture de type Mixture-of-Transformers à deux niveaux, séparant les modalités et les sous-espaces d'action hétérogènes (déplacement de la base d'un côté, manipulation du bras de l'autre). Enfin, une stratégie d'entraînement baptisée "dream-forcing" entraîne progressivement la dynamique inverse sur des vidéos générées par le modèle lui-même plutôt que sur les seules trajectoires réelles, ce qui rapproche les conditions d'entraînement et de test. Les auteurs revendiquent des résultats état de l'art sur des benchmarks de manipulation mobile et de manipulation fine, tant sur le taux de réussite des tâches longues que sur la précision de contrôle. Pour l'industrie robotique, ce travail s'attaque à un problème connu et bloquant : l'accumulation d'erreurs lors des déplacements longs, causée par un décalage entre l'entraînement (sur trajectoires vérité terrain) et l'exécution réelle, où le robot doit composer avec ses propres erreurs qui s'accumulent. Si la méthode tient ses promesses au-delà des benchmarks internes, elle constituerait une avancée utile pour les intégrateurs visant des robots mobiles capables d'enchaîner navigation, saisie et dépose sur plusieurs étapes, un scénario bien plus exigeant que la simple manipulation statique sur table. Il s'agit toutefois d'un préprint arXiv non encore relu par les pairs, sans institution ni entreprise clairement identifiée dans le résumé, et les métriques de "état de l'art" reposent sur des comparaisons choisies par les auteurs eux-mêmes. Une réplication indépendante sera nécessaire avant de juger de la portée réelle de cette approche face aux autres travaux sur les modèles monde appliqués à la robotique.

RechercheActu
1 source
DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation
4arXiv cs.RO 

DiffWAM : un modèle du monde et d'actions rapide et efficace pour la navigation

Des chercheurs présentent DiffWAM, un modèle « monde-action » de navigation pour drones (UAV) qui convertit les représentations prédictives d'un modèle vidéo gelé en trajectoires de caméra continues en 3D. Là où les approches courantes génèrent d'abord une vidéo du futur, puis reconstruisent la géométrie pour en tirer un mouvement, DiffWAM s'en dispense au déploiement. Le module Grid-Motion conserve les associations spatio-temporelles du mouvement à partir de caractéristiques multi-niveaux. Le module Latent2Pose les ancre dans la géométrie de la première image pour retrouver un mouvement 3D métriquement cohérent. Les rollouts vidéo complets et la reconstruction géométrique ne servent qu'à la supervision hors ligne. Le système inclut aussi FastDreamer, qui recouvre le calcul prédictif et géométrique avec le vol en cours et transmet les trajectoires de façon asynchrone, avec horodatage, pour une exécution continue. Sur le banc d'essai DiffWAM-1000 (1 000 échantillons), le modèle atteint une RMSE de trajectoire de 0,3492 m et un taux de succès à l'arrivée de 74,40 %. Une version embarquée, DiffWAM-Flash, affiche 1,08 s de latence pour le pipeline du modèle sur NVIDIA Jetson AGX Thor. L'intérêt tient à la latence et au coût de calcul, deux obstacles à l'usage de modèles vidéo de fondation en robotique aérienne. Supprimer le décodage vidéo et la reconstruction multi-images à l'inférence rend ces modèles plus compatibles avec un calcul embarqué. Cela suggère que le mouvement est déjà largement encodé dans les représentations prédictives, sans passer par une vidéo générée. Les résultats appellent toutefois des réserves. Le banc DiffWAM-1000 semble propre aux auteurs, et un succès à l'arrivée de 74,40 % laisse environ un échec sur quatre, ce qui reste loin d'un seuil industriel. Une latence de 1,08 s dit peu de choses sans connaître la vitesse de vol, la fréquence de replanification et la gestion des obstacles dynamiques. Les expériences réelles (passages contraints, orbites, trajectoires en S, navigation multi-étapes) sont qualifiées de représentatives, donc probablement choisies, sans statistiques de réussite publiées dans le résumé. Ce travail s'inscrit dans la montée des modèles « monde-action » et des approches VLA (vision-langage-action), qui réutilisent les a priori des modèles vidéo pour piloter des robots. Il en propose une variante efficace pour la navigation aérienne, face aux pipelines « générer puis reconstruire ». Aucun acteur industriel n'est cité, et aucun acteur français ou européen n'apparaît dans le résumé. Il s'agit d'un résultat de recherche publié sur arXiv, accompagné d'une page projet, sans produit ni déploiement commercial annoncé. La suite logique serait une validation sur d'autres bancs d'essai, des essais en extérieur à plus grande échelle et une comparaison publique avec d'autres méthodes de navigation par modèle vidéo.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source