WorldLine : simulation visuelle pilotée par les actions pour la manipulation robotique
WorldLine, un simulateur visuel piloté par l'action, est présenté dans un preprint arXiv (2609.38059) pour la manipulation robotique. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel annoncé. Le système apprend la dynamique de manipulation à partir de plus de 10 000 heures de vidéos de robots sans annotation d'actions. Il l'ancre ensuite dans le contrôle avec plus de 2 000 heures de trajectoires actionnées, réparties sur plus de dix morphologies de robots. Une représentation des actions dans l'espace image sert d'interface de contrôle commune, ce qui évite de traduire entre espaces de commande incompatibles. L'entraînement combine plusieurs points de vue, des trajectoires d'échec et une régularisation relationnelle pour mieux prédire les interactions. Une distillation en quelques étapes centrée sur le robot permet un déroulé causal rapide, en conservant les mouvements utiles à l'action. Sur des trajectoires échouées, le score d'IoU des masques du robot gagne 0,1626 face à la meilleure référence. La réussite d'une trajectoire est prédite avec 74 % de précision moyenne sur RoboTwin et AgiBot, soit un point de plus que la meilleure base de comparaison. Sans entraînement ni adaptation sur RoboTwin, les déroulés du simulateur améliorent le taux de succès de tâche jusqu'à 21,4 points par rapport à l'exécution directe de la politique.
L'enjeu est le coût de l'évaluation et de la collecte d'expérience sur robot réel, principal frein à l'apprentissage en conditions réelles. Un simulateur capable de prédire l'issue d'une action avant son exécution permet de trier des politiques ou de planifier sans mobiliser de matériel. Le résultat le plus parlant concerne les échecs : les modèles vidéo génératifs tendent à produire des scènes plausibles mais peu fidèles à l'action commandée, et à «réussir» visuellement des gestes ratés. Or un simulateur inutilisable pour détecter l'échec ne sert pas à l'évaluation. Il faut toutefois relativiser : 74 % de précision sur la réussite reste modeste pour de la validation avant déploiement, et l'avance sur la meilleure référence n'est que d'un point. Le gain de 21,4 points est un maximum, non une moyenne, et les benchmarks (RoboTwin est surtout simulé) ne garantissent pas la robustesse en atelier. L'approche montre néanmoins qu'un jeu de données vidéo massif sans actions peut compenser la rareté des données actionnées.
Ces travaux s'inscrivent dans la vague des modèles du monde et des simulateurs vidéo pour la robotique, qui visent à réduire la dépendance aux données téléopérées, coûteuses et propres à chaque robot. Leur point de friction est l'hétérogénéité des espaces d'action entre plateformes, que WorldLine traite par sa représentation image partagée. Il se place face aux modèles vidéo généralistes et aux simulateurs conditionnés par l'action, limités par des données rares. La suite logique passe par la validation sur robots physiques, la mesure de la corrélation entre succès prédit et succès réel, et l'intégration à des boucles de planification ou d'évaluation de politiques. Une page projet publie des résultats supplémentaires, mais aucune date de publication du code ou des modèles n'est mentionnée.
Dans nos dossiers




