Aller au contenu principal
ACE Robotics et NTU dévoilent Puffin-World, un modèle du monde multimodal open source
IA physiquePandaily 

ACE Robotics et NTU dévoilent Puffin-World, un modèle du monde multimodal open source

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

ACE Robotics et le S-Lab de l'Université technologique de Nanyang, avec des collaborateurs de l'Université Jiaotong de Pékin et de l'Université du Michigan, ont mis en open source Puffin-World, un modèle du monde multimodal unifié traitant physique, géométrie et apparence comme des états natifs d'un monde en trois dimensions. La publication inclut le code, les modèles et le jeu de données Puffin-16M, soit environ 15 millions de triplets vision-langage-caméra (Puffin-Cam-15M) et 1 million de trajectoires complexes couvrant tangage, lacet, roulis et mouvements composés en intérieur, extérieur, synthèse et conduite (Puffin-Traj-1M). L'équipe a aussi utilisé Puffin-World pour ajouter des étiquettes de pose caméra absolue à 28 jeux de données publics, soit environ 44,5 millions d'images publiées pour la recherche. Sur quatre benchmarks caméra-vers-monde (Stanford2D3D, MegaDepth, TartanAir, LaMAR), le modèle revendique des erreurs médianes état de l'art : sur Stanford2D3D, 0,29° de roulis, 0,53° de tangage et 1,62° de champ de vision vertical, avec un roulis sous le degré également en tête sur MegaDepth (0,28°), TartanAir (0,31°) et LaMAR (0,26°). L'architecture combine un encodeur visuel aligné sur la géométrie, un modèle de langage, un générateur par diffusion et un connecteur léger, permettant de partager compréhension, génération et reconstruction dans un seul cadre.

Contrairement à la plupart des modèles du monde génératifs qui se contentent de prédire les pixels d'une image future, Puffin-World modélise conjointement un état physique sensible à la gravité, un état géométrique reconstruit par profondeur et un état d'apparence rendu en RGB, le tout relié par une représentation Omni-Camera fusionnant repères de caméra absolus et relatifs. Cette distinction compte pour les intégrateurs et laboratoires de robotique embarquée : à partir d'une seule image, le modèle estime roulis, tangage et champ de vision vertical absolus, et peut ensuite synthétiser des trajectoires en vue libre, reconstruire une géométrie dense et corriger en boucle fermée la dérive de gravité et de pose pendant qu'une caméra traverse une scène générée. C'est un pas vers des modèles du monde robot-ready, utilisables pour la perception et la simulation plutôt que pour la seule génération vidéo, et cela comble un manque identifié dans les corpus de caméra purement relatifs, incapables d'enseigner l'alignement sur la gravité. Les métriques avancées (erreurs sous le degré, PSNR et LPIPS en tête sur RealEstate10K) proviennent des propres benchmarks du projet et méritent d'être considérées avec la prudence habituelle réservée aux résultats auto-rapportés, en l'absence d'évaluation indépendante à ce stade.

Le projet s'inscrit dans la course actuelle des laboratoires de recherche en robotique et vision par ordinateur à produire des modèles du monde capables de dépasser la simple prédiction de trame suivante, à l'image des efforts parallèles sur des modèles vision-langage-action comme Pi-0 ou GR00T N2 destinés au contrôle robotique. En publiant à la fois le code, les poids et un jeu de données massif de 16 millions d'échantillons annotés en pose absolue, ACE Robotics et NTU cherchent à positionner Puffin-World comme une brique de base réutilisable par la communauté, plutôt que comme un produit fermé. Le dépôt fournit un point de contrôle unique combinant perception de la physique de caméra, simulation de points de vue contrôlables et reconstruction 3D cohérente, sans modules de géométrie externes spécifiques à une tâche. Aucun calendrier de déploiement industriel, pilote client ou intégration matérielle n'a été communiqué à ce stade : il s'agit pour l'instant d'une contribution de recherche ouverte, dont l'adoption par des acteurs de la robotique embarquée dépendra des validations indépendantes à venir.

À lire aussi

Galbot lance LDA-1B, un modèle du monde-action en open source
1Pandaily 

Galbot lance LDA-1B, un modèle du monde-action en open source

Galbot a publié LDA-1B, un modèle fondation monde-action cross-embodiment de 1,6 milliard de paramètres, construit sur son architecture propriétaire WAM (World-Action Model). Ce modèle unifie modèles de monde et modèles d'action au niveau des données, permettant un apprentissage conjoint sur données de simulation et données réelles, données humaines et robotiques, ainsi que sur jeux de données d'action labellisés et non labellisés. LDA-1B peut s'adapter à différentes morphologies de robots après seulement une heure de post-entraînement, selon Galbot. À mesure que le volume de données d'entraînement est passé de 5 000 à 30 000 heures, l'erreur de prédiction d'action a diminué de façon continue, démontrant un comportement de scaling cohérent. La recherche a été acceptée à RSS 2026 et le code source est désormais public. Le modèle est intégré dans AstraBrain et AstraData, l'infrastructure de déploiement de Galbot, couvrant la logistique industrielle, les tâches domestiques et les scénarios retail. En avril 2026, la société est l'entreprise d'IA incarnée non cotée la mieux valorisée en Chine, avec une valorisation dépassant 20 milliards de yuans (2,8 milliards de dollars). Plusieurs points méritent attention. La capacité d'adaptation cross-embodiment en une heure de fine-tuning est une affirmation forte, mais elle reste à valider hors démonstrations contrôlées. Le comportement de scaling confirmé entre 5 000 et 30 000 heures de données est un signal positif pour les VLA (Vision-Language-Action models) à grande échelle, suggérant que les lois d'échelle s'appliquent à l'action robotique de façon analogue aux LLM textuels. L'open-source du codebase réduit la barrière d'entrée pour les intégrateurs souhaitant expérimenter sans infrastructure propriétaire, et positionne Galbot comme fournisseur d'infrastructure fondationale, pas seulement constructeur de robots. Galbot est une startup spécialisée dans les robots humanoïdes et l'IA incarnée. LDA-1B entre en compétition directe avec pi0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches internes de Figure AI et Agility Robotics côté américain. En Chine, la société rivalise avec Unitree et UBTECH sur le terrain humanoïde. L'acceptation à RSS 2026 lui confère une légitimité académique rare dans ce secteur encore dominé par les communiqués marketing. Les prochaines étapes probables incluent des pilotes industriels en logistique et retail, et une expansion internationale que la valorisation de 2,8 milliards de dollars rend plausible.

UEPression concurrentielle indirecte sur les équipes VLA européennes (INRIA, CEA-List), mais aucun déploiement ni partenariat européen annoncé.

💬 Le comportement de scaling sur les données robotiques, c'est le vrai signal ici, pas le chiffre de valorisation. Que les lois d'échelle s'appliquent à l'action physique comme au texte, ça dit quelque chose sur ce qu'on va voir dans 3 ans, et tu commences à comprendre pourquoi les gros acteurs américains s'agitent. L'open source est une bonne décision stratégique, mais une heure de fine-tuning pour changer de morphologie de robot, j'attends de voir ça hors démo contrôlée.

IA physiqueOpinion
1 source
Skild AI dévoile S1, son modèle fondation phare pour la robotique
2Robotics Business Review 

Skild AI dévoile S1, son modèle fondation phare pour la robotique

Skild AI a dévoilé S1, son modèle de fondation robotique phare, conçu pour l'apprentissage en contexte : une vidéo d'un humain réalisant une tâche, ajoutée au prompt, suffit au robot pour la reproduire sans réentraînement, explique le cofondateur et PDG Deepak Pathak. Fondée en 2023, la start-up a levé près de 1,7 milliard de dollars pour bâtir ce "cerveau" robotique généraliste. S1 cible des tâches longues, jusqu'à dix minutes, comme rempoter une plante, préparer un café ou cuisiner des pancakes, plutôt que les gestes de quelques secondes habituellement démontrés. Il combine quatre sources de données d'entraînement, téléopération, vidéos humaines, simulation et gants de capture de mouvement, chacune compensant les limites des autres. Pathak affirme que le robot a improvisé le retournement d'une crêpe à la spatule sans aucun exemple de ce geste dans ses millions d'heures de données d'entraînement, en généralisant à partir de la seule vidéo du prompt. Le modèle est dit "omni-corps", fonctionnant sur bras fixes, quadrupèdes et humanoïdes. Cette annonce s'inscrit dans le débat sur un éventuel "moment ChatGPT" de la robotique, où un modèle de fondation unique remplacerait le post-entraînement tâche par tâche qui freine aujourd'hui le passage à l'échelle des déploiements. Si ces résultats se confirment sur des tâches longues et non scriptées, ils contrediraient l'idée que l'apprentissage en contexte ne fonctionne que sur des gestes courts déjà vus en simulation. Pour les intégrateurs, un modèle apprenant par une seule vidéo démonstrative réduirait le coût de reconfiguration des robots face à de nouvelles lignes ou de nouvelles références produits. Skild AI n'a toutefois publié ni protocole de test indépendant, ni taux de réussite chiffré, ni durée de cycle précise : ces démonstrations restent une vitrine contrôlée plutôt qu'un produit validé en conditions industrielles. L'entreprise reconnaît elle-même que ses résultats sur humanoïdes, capables de continuer une tâche après la perte d'un membre, proviennent d'une version antérieure du modèle, pas encore mise à l'échelle. Skild AI a été cofondée en 2023 par Deepak Pathak et Abhinav Gupta, chercheurs issus de Carnegie Mellon, avec l'ambition de vendre un modèle de fondation indépendant du matériel plutôt que de construire son propre robot. Ses près de 1,7 milliard de dollars levés en font l'un des acteurs les mieux capitalisés du secteur, aux côtés de rivaux développant leurs propres modèles vision-langage-action, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, tandis que des humanoïdes comme Optimus ou Figure 03 restent pilotés par des piles logicielles propriétaires intégrées verticalement. Contrairement à ces approches liées à un matériel spécifique, Skild positionne S1 comme une couche logicielle tierce, applicable à des plateformes existantes. L'entreprise dit vouloir concentrer ses prochains efforts sur l'amélioration de S1 sur humanoïdes, sans donner de calendrier de déploiement pilote ni de client industriel nommé à ce stade.

IA physiqueActu
1 source
RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique
3arXiv cs.RO 

RynnWorld-4D : des modèles du monde incarnés en 4D pour la manipulation robotique

Des chercheurs (l'article ne précise pas d'affiliation institutionnelle dans le résume) publient sur arXiv, le 7 juillet 2026, RynnWorld-4D, un modèle génératif de monde en 4D pour la manipulation robotique. Le système produit simultanément, a partir d'une seule image RGB-D et d'une instruction en langage naturel, des images RGB futures, des cartes de profondeur et des flux optiques, le tout dans un unique processus de diffusion. Son architecture a trois branches combine attention cross-modale et RoPE 3D image par image pour que l'apparence visuelle, la géométrie et le mouvement évoluent de manière cohérente. Pour l'entrainer, les auteurs ont constitue Rynn4DDataset 1.0, un jeu de données de plus de 254,4 millions d'images issues de vidéos de manipulation, a la fois humaines en vue égocentrique et robotiques, avec des pseudo-étiquettes de profondeur et de flux optique. Un module dérivé, RynnWorld-4D-Policy, exploite directement les représentations internes du modèle en un seul passage avant, sans les étapes couteuses de debruitage itératif, pour générer des actions robotiques en boucle fermée. L'intérêt de cette approche tient a l'hypothèse qu'elle teste: en combinant RGB, profondeur et flux optique plutôt qu'en travaillant sur de simples pixels 2D, la représentation obtenue se rapprocherait davantage des commandes bas niveau de l'effecteur, réduisant l'écart classique entre prédiction du monde et apprentissage de politique. Sur des taches réelles de manipulation bimanuelle dextérité, les auteurs rapportent des résultats a l'état de l'art, en particulier sur les taches exigeant précision spatiale et coordination temporelle, deux points ou les approches VLA généralistes butent souvent en conditions réelles. Il s'agit pour l'instant d'un travail de recherche publie en preprint, sans déploiement industriel ni produit commercialise. Il s'inscrit dans la lignée des modèles de monde appliques a la robotique, aux cotes d'approches comme GR00T N2 ou Pi-0, mais mise sur une fusion multimodale plus riche et un passage a l'échelle des données d'entrainement. Les prochaines étapes attendues concernent la généralisation a d'autres plateformes robotiques et la validation hors des benchmarks contrôles du laboratoire.

IA physiqueActu
1 source
MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique
4arXiv cs.RO 

MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique

Des chercheurs présentent ce mois-ci MuseVLA (arXiv:2606.17598, juin 2026), un modèle Vision-Language-Action capable d'intégrer des capteurs non-RGB comme entrées de perception active lors de tâches de manipulation robotique. Sur un robot à main dextre testée en conditions réelles, MuseVLA atteint un taux de succès moyen de 80,6 % sur trois familles de tâches : saisie guidée par la température, recherche d'objet par signal audio, et récupération d'objet dissimulé assistée par radar. L'architecture repose sur un mécanisme en deux temps : le modèle génère d'abord un "sensor token" qui sélectionne dynamiquement la modalité sensorielle pertinente pour la tâche en cours, puis convertit la mesure capteur en une "grounded sensor image", une représentation intermédiaire unifiée fusionnée avec le flux RGB classique avant la génération d'action. Les auteurs introduisent également un pipeline de synthèse de données qui augmente des datasets RGB existants avec des images capteur simulées, contournant ainsi le coût prohibitif de la collecte de données multisensorielles réelles. L'apport principal est architectural plutôt que purement empirique : le découplage entre le traitement capteur spécifique et le backbone VLA permet d'intégrer de nouveaux capteurs sans réentraîner le modèle de base, un principe analogue aux "tool calls" dans les LLM. Cette modularité répond à une limite structurelle des VLA actuels, dont Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui opèrent quasi exclusivement sur RGB. La capacité de zéro-shot sur des tâches non vues lors de l'entraînement est notable, même si les conditions expérimentales restent celles d'un laboratoire, sans déploiement industriel rapporté. Les métriques de cycle time ou de robustesse en environnement non contrôlé ne sont pas fournies, ce qui limite l'interprétation du 80,6 % en contexte réel. Le papier s'inscrit dans une effervescence autour des VLA généralistes depuis mi-2024, avec des acteurs comme Physical Intelligence, 1X Technologies, Enchanted Tools côté européen, et les équipes de Google DeepMind ou Carnegie Mellon qui multiplient les approches de fusion multimodale. MuseVLA reste pour l'instant un preprint sans code ni dataset publié, et la question de la généralisation à des capteurs industriels standards (LiDAR, force/torque) n'est pas traitée. Les prochaines étapes naturelles seraient un benchmark comparatif sur des plateformes connues type Franka ou UR, et une validation hors labo pour confirmer la thèse du sim-to-real sur les données capteur synthétiques.

UELes acteurs européens comme Enchanted Tools opèrent dans le même segment VLA généraliste, mais ce preprint n'implique aucune institution ou entreprise française ou européenne.

IA physiqueOpinion
1 source