Robot-Factored World Models via le rendu de robots
Un article de recherche publié sur arXiv (2607.22535) propose une nouvelle architecture pour les "world models" en robotique, ces systèmes qui prédisent les observations futures d'une scène à partir d'une image initiale et d'un signal d'action. L'équipe identifie un problème structurel dans les approches existantes : conditionner le modèle directement sur les commandes d'action l'oblige à apprendre lui-même comment le corps du robot et son contrôleur traduisent ces commandes en mouvement réel, tandis que le conditionner sur les états futurs enregistrés revient à lui donner d'avance le résultat qu'il est censé prédire. La solution proposée, baptisée "robot-factored world model", sépare deux facteurs propres au robot en amont du modèle. D'abord, la trajectoire nominale : chaque commande est passée par le contrôleur et la cinématique du robot pour produire un signal intermédiaire disponible au déploiement. Ensuite, le rendu robotique : cette trajectoire est rendue via le fichier URDF du robot, extrayant sa géométrie et son apparence du modèle d'apprentissage. Pour lever l'ambiguïté de profondeur, les chercheurs associent la profondeur de l'effecteur terminal à celle de la scène.
Cette approche cible un angle mort connu des modèles vidéo conditionnés par l'action utilisés en planification et simulation robotique, à savoir leur difficulté à généraliser au-delà du robot sur lequel ils ont été entraînés. Les résultats montrent que l'interface de rendu surpasse les méthodes de référence conditionnées par vecteurs d'action et généralise à des embodiments robotiques inédits au moment de l'inférence, un point sensible pour l'industrie alors que les modèles vision-langage-action (VLA) cherchent à s'affranchir de la dépendance à une plateforme matérielle unique. Le modèle parvient aussi à générer des vidéos de manipulation robotique à partir de démonstrations humaines, en retargetant le mouvement de la main vers une géométrie de robot.
Ces travaux s'inscrivent dans une compétition plus large autour des world models et des politiques VLA à grande échelle, un terrain où Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) investissent massivement pour rendre leurs systèmes transférables d'un robot à l'autre. La piste du rendu explicite de la géométrie robotique, plutôt que son encodage implicite dans des vecteurs d'action, pourrait devenir un standard méthodologique si elle se confirme sur des déploiements réels au-delà des benchmarks académiques.
Dans nos dossiers




