Aller au contenu principal
RecherchearXiv cs.RO 

UNITAS : un modèle d'action du monde natif 3D pour la manipulation incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

UNITAS, un modèle d'action-monde (WAM, world action model) publié sur arXiv par l'équipe derrière le dépôt DexForce, se présente comme le premier à travailler nativement en 3D. Il unifie observations, actions et dynamique de scène dans un repère métrique 3D partagé, avec une représentation commune pour différents robots et pour la main humaine. Les actions des mains et des pinces sont encodées en trajectoires de points 3D (« action flow »). Les déplacements des points de la scène (« scene flow ») sont prédits en conditionnant sur ces trajectoires. Des embeddings positionnels 3D alignés sur le monde ancrent les tokens visuels, avec ou sans entrée de profondeur. Un tokenizer de trajectoires en temps physique encode chaque trajectoire en un seul token, ancré à sa position 3D courante. Avec 1,7 milliard de paramètres, UNITAS affiche la meilleure prédiction de scène conditionnée par l'action sur RoboTwin parmi les méthodes comparées, avec jusqu'à 49 % d'erreur de déplacement en moins que PointWorld. Il atteint aussi 99,8 % de succès sur LIBERO et 85 % en moyenne sur des tâches en conditions réelles. Le code est publié sur GitHub.

L'enjeu est un changement de représentation. La plupart des WAM actuels reposent sur des générateurs vidéo pré-entraînés et décrivent l'évolution du monde par des images ou des latents visuels. Or une image est une projection dépendante du point de vue, dont les distances en pixels ne correspondent pas aux distances physiques. En raisonnant directement en espace métrique, UNITAS vise à rapprocher la prédiction de ce que le robot doit réellement mesurer: où va sa pince, de combien l'objet se déplace. La représentation commune humain/robot ouvre aussi la voie à l'exploitation de données de mains humaines pour l'entraînement. Un modèle de 1,7 milliard de paramètres reste compact face aux gros VLA (vision-language-action) et aux modèles vidéo, ce qui compte pour le coût d'inférence embarquée. Les réserves habituelles s'appliquent: LIBERO est proche de la saturation à 99,8 %, donc peu discriminant, et la moyenne de 85 % en réel dépend de tâches, d'un nombre d'essais et d'un matériel que le résumé ne détaille pas. Les comparaisons de scène se limitent aux « méthodes comparées » choisies par les auteurs.

Ce travail s'inscrit dans la montée des world models pour la manipulation, après les VLA de type Pi-0 ou GR00T, et des approches fondées sur la génération vidéo. Il se positionne contre ces dernières en s'inspirant de PointWorld, qui prédit déjà des mouvements de points 3D et sert ici de référence. Il s'agit à ce stade d'un préprint (v1) de recherche, sans produit commercial, déploiement industriel ni calendrier annoncé. La suite dépendra de la reproduction des résultats par d'autres équipes grâce au code ouvert, de la robustesse hors des benchmarks simulés et de la capacité du modèle à passer à l'échelle avec davantage de données humaines et multi-embodiments.

À lire aussi

DepthWorld : un modèle du monde 3D pour la manipulation robotique
1arXiv cs.RO 

DepthWorld : un modèle du monde 3D pour la manipulation robotique

Des chercheurs publient sur arXiv (2610.08780) DepthWorld, un modèle du monde 3D destiné à la manipulation robotique, accompagné d'un jeu de données calibré, DROID-3D. Le point de départ est un constat : les modèles du monde vidéo actuels, entraînés uniquement sur du RGB, produisent des séquences plausibles image par image, mais qui ne forment pas un monde 3D cohérent. Pour y remédier, l'équipe a conçu un pipeline de calibration qui combine une estimation de profondeur stéréo apprise et un graphe de facteurs joint. Il regroupe tous les épisodes enregistrés avec un même robot physique afin de retrouver ses paramètres cinématiques partagés, en plus des extrinsèques propres à chaque scène. Appliqué à DROID, il produit DROID-3D : une profondeur métrique dense et des extrinsèques multi-vues recalibrées, avec une erreur de reprojection inférieure à 0,7 pixel sur 90 % des épisodes pour les caméras externes. Le modèle DepthWorld, bâti sur Stable Video Diffusion, prédit conjointement le RGB et la profondeur sur plusieurs vues grâce à un « tuilage latent spatial » (spatial latent tiling), qui laisse intact l'autoencodeur variationnel (VAE) pré-entraîné. À budget d'entraînement égal, la supervision par la profondeur améliore la prédiction RGB de 1,48 dB de PSNR par rapport à une base identique entraînée sur RGB seul, tout en fournissant une profondeur métrique exploitable. Ces résultats comptent pour les équipes qui voient dans les modèles du monde une alternative pilotée par les données aux simulateurs classiques, pour l'évaluation, l'amélioration et la planification de politiques. Toutes ces utilisations supposent une géométrie fidèle. Un rollout visuellement convaincant mais géométriquement incohérent peut fausser l'évaluation d'une politique de préhension ou une planification de trajectoire. L'apport de la profondeur à la qualité du RGB lui-même suggère que la supervision 3D ne se limite pas à ajouter une sortie : elle renforce la prédiction visuelle. Le choix de ne pas toucher au VAE préserve les connaissances a priori des modèles vidéo pré-entraînés, ce qui évite de ré-entraîner à grande échelle. Pour les intégrateurs, l'enjeu à terme est de disposer d'un banc d'essai virtuel plus fiable avant de passer sur matériel réel. Il faut toutefois rester prudent : il s'agit d'un préprint, sans évaluation en boucle fermée sur des robots réels dans les éléments communiqués, et un gain de 1,48 dB de PSNR ne prouve pas à lui seul une meilleure réussite des tâches. Le contexte est celui d'une course pour remplacer ou compléter la simulation physique par des modèles génératifs, nourrie par de grands jeux de données de téléopération comme DROID. Ces corpus sont riches en vidéo, mais leur calibration de caméras est souvent approximative et la profondeur métrique y est absente, ce qui a limité jusqu'ici la supervision 3D à grande échelle en manipulation. DROID-3D comble en partie ce manque. L'approche s'inscrit dans le courant des modèles du monde vidéo adaptés à la robotique, qui s'appuient sur des modèles de diffusion vidéo généralistes. La suite logique serait de tester si ces rollouts géométriquement cohérents améliorent réellement l'évaluation et l'amélioration de politiques VLA, puis de les valider sur des plateformes variées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
2arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique
3arXiv cs.RO 

RoDyn : apprivoiser un modèle du monde 2.5D interactif pour la manipulation robotique

Des chercheurs ont publié sur arXiv (identifiant 2510.09036, seconde version) RoDyn, un modèle de monde 2.5D destiné à la manipulation robotique. L'architecture repose sur un espace latent géométriquement conscient plutôt que sur des flux vidéo 2D bruts. Son composant central, le Robot-Dynamic Tokenizer, couple les représentations visuelles sémantiques avec des informations spatiales et centrées sur l'agent via un mécanisme de cross-attention dominé par le canal RGB, complété d'un guidage par masque dynamique. Une architecture autorégressi guidée par ces masques oriente ensuite le modèle vers les zones d'interaction active entre le robot et les objets manipulés. Sur des jeux de données à grande échelle, RoDyn atteint l'état de l'art en fidélité de génération et affiche, point le plus saillant, une amélioration de 42% du taux de réussite en imitation learning dans le monde réel par rapport aux baselines purement 2D. Ce gain de 42% doit être lu avec soin: il est mesuré contre des modèles 2D, non contre d'autres approches 2.5D ou 3D, ce qui circonscrit la portée de la comparaison. Il illustre néanmoins un problème structurel bien documenté: les modèles vidéo 2D, aussi convaincants visuellement, ne capturent pas la géométrie ni la cinématique indispensables aux interactions physiques précises. En introduisant une représentation intermédiaire 2.5D, soit une profondeur estimée sans reconstruction 3D complète et coûteuse, RoDyn tente de combler ce fossé à moindre coût computationnel. Pour les équipes R&D en manipulation industrielle, l'intérêt concret réside dans l'accélération du reinforcement learning model-based (MBRL), qui réduit potentiellement le nombre d'interactions physiques requises à l'entraînement, et dans une meilleure généralisation aux objets non vus en simulation. Le champ des modèles de monde pour la robotique s'est densifié depuis 2023, porté par Dreamer (DeepMind), UniSim, et plus récemment les architectures VLA comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA). RoDyn occupe une niche spécifique: la simulation neuronale pour la manipulation de précision, avec un compromis géométrique explicite entre vidéo pure et reconstruction 3D complète. Cette publication reste à ce stade purement académique, sans annonce de déploiement commercial ni partenariat industriel mentionné. Les suites naturelles concerneront des tâches de manipulation plus exigeantes (assemblage fin, dépose contrainte) et une éventuelle intégration dans des pipelines VLA existants. Aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle
4arXiv cs.RO 

DeltaWAM : modèles delta monde-action pour la manipulation bimanuelle

Des chercheurs du AIGeeksGroup publient DeltaWAM (Delta World Action Models), une nouvelle architecture pour piloter des bras robotiques bimanuels via l'apprentissage vidéo, détaillée dans un article arXiv (2609.28811v1) diffusé fin septembre 2026, avec code et démonstrations disponibles sur GitHub. Les modèles World-Action (WAM) classiques transfèrent les connaissances visuelles et de mouvement de générateurs vidéo préentraînés vers le contrôle robotique, mais ils prédisent à chaque étape des images futures complètes, ce qui recalcule inutilement du contenu inchangé et ralentit la génération d'actions en temps réel. DeltaWAM sépare le flux en trois composantes, une ancre dense, un delta visuel épars et un flux d'actions, déclinées en trois architectures selon le partage de calcul et de représentation. Le système ajoute une Streaming Delta Memory (SDM) qui met à jour un contexte d'ancrage en cache à partir des seuls changements observés, évitant de repasser par le lourd module vidéo à chaque pas. Sur le benchmark RoboTwin, DeltaWAM avec SDM porte le taux de réussite moyen de 81,3% à 85,4% en conditions standard, et de 75,8% à 83,9% avec randomisation visuelle, par rapport à la référence Fast-WAM. Les trois architectures réduisent le coût de calcul à l'entraînement de 17,78 à 23,77%, tandis que la SDM abaisse la latence d'inférence de 36,57% et le calcul associé de 31,55%. Pour l'industrie robotique, ce travail cible un goulot d'étranglement concret: les modèles génératifs vidéo, puissants pour transférer des priors de mouvement, restent trop lourds pour du contrôle en quelques pas de temps, un frein direct pour des manipulations bimanuelles réactives en usine ou en logistique. En découplant la dynamique liée à l'action des variations d'apparence parasites, DeltaWAM répond à un doute récurrent sur les architectures VLA à grande échelle: leur capacité à généraliser sans reconstruire l'intégralité de la scène à chaque inférence. Les gains annoncés en conditions réelles restent toutefois évalués par les auteurs eux-mêmes, face à un nombre limité de politiques concurrentes, sans validation indépendante à ce stade. L'article s'inscrit dans la lignée des WAM apparus pour exploiter les générateurs vidéo comme source de priors physiques, avec Fast-WAM comme point de comparaison direct explicitement cité. Aucun acteur industriel ni équipe européenne n'est mentionné, le travail restant à ce stade une contribution académique avec code ouvert, sans annonce de déploiement matériel ni de partenariat commercial.

RechercheActu
1 source