Pelican-Sim 1.0 : un simulateur de modèle du monde généraliste pour l'IA incarnée
Un rapport technique publié sur arXiv (2609.12036v1) présente Pelican-Sim 1.0, un simulateur de modèle du monde pour l'intelligence incarnée qui prédit les observations visuelles futures à partir d'une image et d'une action robotique. Son architecture combine un espace d'action unifié à 28 dimensions couvrant la plupart des morphologies robotiques, une injection action-vision par vidéos rendues via des modèles URDF (PSNR +0,904), des couches sparse mixture-of-experts réduisant les conflits entre modalités (FVD -6,530), et une distillation en quatre étapes accélérant la génération de 5,67x face à un modèle à 35 étapes. Entraîné sur environ un million de trajectoires réelles et simulées, il gagne +4,636 de PSNR sur AgiBotWorld Beta, +2,080 sur RoboMIND et +10,343 sur RoboTwin. Sur RoboTwin, ajouter 500 trajectoires générées à 50 démonstrations réelles par tâche fait passer le taux de réussite d'une politique de 70% à 93%, et l'évaluation de politiques atteint une corrélation de Pearson de 0,994 avec les résultats réels.
Ces résultats ciblent le goulot d'étranglement de l'apprentissage robotique : le coût et la rareté des données réelles nécessaires pour entraîner des politiques vision-langage-action fiables. En démontrant qu'un modèle du monde unique peut générer des données synthétiques exploitables sur plusieurs morphologies de robots, servir de proxy d'évaluation sans essais physiques, et guider la sélection d'actions, avec des gains relatifs jusqu'à 47,7%, Pelican-Sim s'attaque à l'écart persistant entre démonstration en laboratoire et déploiement réel. Pour les intégrateurs, l'intérêt tient à l'échelle testée et à la vitesse de génération par distillation, qui rapproche ces simulateurs d'un usage en boucle d'entraînement plutôt que d'une démonstration académique.
Le travail s'inscrit dans la vague de modèles du monde appliqués à la robotique, aux côtés d'efforts comme Cosmos de Nvidia ou Genie de Google DeepMind, sur fond de benchmarks robotiques ouverts comme AgiBotWorld, RoboMIND et RoboTwin. Il s'agit à ce stade d'un rapport technique, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement. Les auteurs avancent des résultats de généralisation qualitative sur des changements de trajectoire, de scène, d'objet, d'embodiment et de point de vue comme preuve de concept, la validation sur des tâches et des robots inédits restant l'étape suivante.
Dans nos dossiers




