UNITAS : un modèle d'action du monde natif 3D pour la manipulation incarnée
UNITAS, un modèle d'action-monde (WAM, world action model) publié sur arXiv par l'équipe derrière le dépôt DexForce, se présente comme le premier à travailler nativement en 3D. Il unifie observations, actions et dynamique de scène dans un repère métrique 3D partagé, avec une représentation commune pour différents robots et pour la main humaine. Les actions des mains et des pinces sont encodées en trajectoires de points 3D (« action flow »). Les déplacements des points de la scène (« scene flow ») sont prédits en conditionnant sur ces trajectoires. Des embeddings positionnels 3D alignés sur le monde ancrent les tokens visuels, avec ou sans entrée de profondeur. Un tokenizer de trajectoires en temps physique encode chaque trajectoire en un seul token, ancré à sa position 3D courante. Avec 1,7 milliard de paramètres, UNITAS affiche la meilleure prédiction de scène conditionnée par l'action sur RoboTwin parmi les méthodes comparées, avec jusqu'à 49 % d'erreur de déplacement en moins que PointWorld. Il atteint aussi 99,8 % de succès sur LIBERO et 85 % en moyenne sur des tâches en conditions réelles. Le code est publié sur GitHub.
L'enjeu est un changement de représentation. La plupart des WAM actuels reposent sur des générateurs vidéo pré-entraînés et décrivent l'évolution du monde par des images ou des latents visuels. Or une image est une projection dépendante du point de vue, dont les distances en pixels ne correspondent pas aux distances physiques. En raisonnant directement en espace métrique, UNITAS vise à rapprocher la prédiction de ce que le robot doit réellement mesurer: où va sa pince, de combien l'objet se déplace. La représentation commune humain/robot ouvre aussi la voie à l'exploitation de données de mains humaines pour l'entraînement. Un modèle de 1,7 milliard de paramètres reste compact face aux gros VLA (vision-language-action) et aux modèles vidéo, ce qui compte pour le coût d'inférence embarquée. Les réserves habituelles s'appliquent: LIBERO est proche de la saturation à 99,8 %, donc peu discriminant, et la moyenne de 85 % en réel dépend de tâches, d'un nombre d'essais et d'un matériel que le résumé ne détaille pas. Les comparaisons de scène se limitent aux « méthodes comparées » choisies par les auteurs.
Ce travail s'inscrit dans la montée des world models pour la manipulation, après les VLA de type Pi-0 ou GR00T, et des approches fondées sur la génération vidéo. Il se positionne contre ces dernières en s'inspirant de PointWorld, qui prédit déjà des mouvements de points 3D et sert ici de référence. Il s'agit à ce stade d'un préprint (v1) de recherche, sans produit commercial, déploiement industriel ni calendrier annoncé. La suite dépendra de la reproduction des résultats par d'autres équipes grâce au code ouvert, de la robustesse hors des benchmarks simulés et de la capacité du modèle à passer à l'échelle avec davantage de données humaines et multi-embodiments.
Dans nos dossiers




