
ACE Robotics et NTU dévoilent Puffin-World, un modèle du monde multimodal open source
ACE Robotics et le S-Lab de l'Université technologique de Nanyang, avec des collaborateurs de l'Université Jiaotong de Pékin et de l'Université du Michigan, ont mis en open source Puffin-World, un modèle du monde multimodal unifié traitant physique, géométrie et apparence comme des états natifs d'un monde en trois dimensions. La publication inclut le code, les modèles et le jeu de données Puffin-16M, soit environ 15 millions de triplets vision-langage-caméra (Puffin-Cam-15M) et 1 million de trajectoires complexes couvrant tangage, lacet, roulis et mouvements composés en intérieur, extérieur, synthèse et conduite (Puffin-Traj-1M). L'équipe a aussi utilisé Puffin-World pour ajouter des étiquettes de pose caméra absolue à 28 jeux de données publics, soit environ 44,5 millions d'images publiées pour la recherche. Sur quatre benchmarks caméra-vers-monde (Stanford2D3D, MegaDepth, TartanAir, LaMAR), le modèle revendique des erreurs médianes état de l'art : sur Stanford2D3D, 0,29° de roulis, 0,53° de tangage et 1,62° de champ de vision vertical, avec un roulis sous le degré également en tête sur MegaDepth (0,28°), TartanAir (0,31°) et LaMAR (0,26°). L'architecture combine un encodeur visuel aligné sur la géométrie, un modèle de langage, un générateur par diffusion et un connecteur léger, permettant de partager compréhension, génération et reconstruction dans un seul cadre.
Contrairement à la plupart des modèles du monde génératifs qui se contentent de prédire les pixels d'une image future, Puffin-World modélise conjointement un état physique sensible à la gravité, un état géométrique reconstruit par profondeur et un état d'apparence rendu en RGB, le tout relié par une représentation Omni-Camera fusionnant repères de caméra absolus et relatifs. Cette distinction compte pour les intégrateurs et laboratoires de robotique embarquée : à partir d'une seule image, le modèle estime roulis, tangage et champ de vision vertical absolus, et peut ensuite synthétiser des trajectoires en vue libre, reconstruire une géométrie dense et corriger en boucle fermée la dérive de gravité et de pose pendant qu'une caméra traverse une scène générée. C'est un pas vers des modèles du monde robot-ready, utilisables pour la perception et la simulation plutôt que pour la seule génération vidéo, et cela comble un manque identifié dans les corpus de caméra purement relatifs, incapables d'enseigner l'alignement sur la gravité. Les métriques avancées (erreurs sous le degré, PSNR et LPIPS en tête sur RealEstate10K) proviennent des propres benchmarks du projet et méritent d'être considérées avec la prudence habituelle réservée aux résultats auto-rapportés, en l'absence d'évaluation indépendante à ce stade.
Le projet s'inscrit dans la course actuelle des laboratoires de recherche en robotique et vision par ordinateur à produire des modèles du monde capables de dépasser la simple prédiction de trame suivante, à l'image des efforts parallèles sur des modèles vision-langage-action comme Pi-0 ou GR00T N2 destinés au contrôle robotique. En publiant à la fois le code, les poids et un jeu de données massif de 16 millions d'échantillons annotés en pose absolue, ACE Robotics et NTU cherchent à positionner Puffin-World comme une brique de base réutilisable par la communauté, plutôt que comme un produit fermé. Le dépôt fournit un point de contrôle unique combinant perception de la physique de caméra, simulation de points de vue contrôlables et reconstruction 3D cohérente, sans modules de géométrie externes spécifiques à une tâche. Aucun calendrier de déploiement industriel, pilote client ou intégration matérielle n'a été communiqué à ce stade : il s'agit pour l'instant d'une contribution de recherche ouverte, dont l'adoption par des acteurs de la robotique embarquée dépendra des validations indépendantes à venir.
Dans nos dossiers




