Aller au contenu principal
Image2Sim : le passage à l'échelle de la navigation incarnée grâce à un simulateur neuronal génératif
RecherchearXiv cs.RO 

Image2Sim : le passage à l'échelle de la navigation incarnée grâce à un simulateur neuronal génératif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie Image2Sim, un simulateur neuronal temps réel conçu pour entraîner des agents de navigation embarquée à partir de simples séquences d'images RGB-D posées. Le système sépare l'ancrage spatial 3D de la synthèse photoréaliste des observations: un modèle feed-forward de "feature Gaussians" reconstruit la scène en une seule passe, tandis qu'un modèle de flux de pixels en une étape, dit "geometry-aware", transforme les projections gaussiennes éparses et bruitées en images RGB-D panoramiques de haute qualité. Utilisé comme moteur de données entièrement automatisé, Image2Sim convertit de larges collections de vidéos et de photos en près de 20 000 scènes interactives et génère plus de 10 millions d'échantillons d'entraînement à la navigation, avec instructions diverses et actions exécutables associées. Les modèles entraînés uniquement dans ces environnements neuronaux affichent des gains significatifs sur les benchmarks de référence et transfèrent efficacement en conditions réelles sans fine-tuning (zero-shot).

L'enjeu dépasse la simple prouesse technique: il s'agit de résoudre le compromis historique entre réalisme visuel et scalabilité qui bride l'entraînement des agents de navigation. Les jeux de données scannés en conditions réelles offrent un rendu fidèle mais restent coûteux à collecter et donc limités en volume, tandis que les simulateurs synthétiques classiques scalent facilement mais souffrent d'un écart sim-to-real important. Si les résultats de transfert zero-shot se confirment à plus grande échelle, cela validerait l'idée qu'une simulation neuronale générative, construite depuis des vidéos ordinaires plutôt que des moteurs de jeu, peut devenir un substrat d'entraînement crédible pour la navigation robotique, avec des implications directes pour les AMR et les plateformes de navigation embarquée en usine ou en logistique.

Cette approche s'inscrit dans la lignée des travaux récents combinant Gaussian Splatting et modèles de diffusion pour la reconstruction de scènes, un courant de recherche actif face aux limites des NeRF classiques. Elle rejoint aussi la tendance plus large des "world models" appliqués à la robotique, où générer des environnements d'entraînement remplace progressivement leur capture manuelle. Publiée sur arXiv, cette contribution reste à ce stade une preuve de concept académique; sa reproductibilité et son passage à l'échelle sur des flottes robotiques réelles restent les prochaines étapes à observer.

Dans nos dossiers

À lire aussi

NavGen : les modèles génératifs visuels comme moteur de données évolutif pour la navigation 3D incarnée
1arXiv cs.RO 

NavGen : les modèles génératifs visuels comme moteur de données évolutif pour la navigation 3D incarnée

Des chercheurs présentent NavGen dans un article publié sur arXiv (identifiant 2609.30770), un pipeline de génération de données texte-vers-vidéo destiné à l'entraînement de modèles de navigation aérienne pour drones. Le système produit des épisodes de navigation vision-langage (VLN) simulant des environnements intérieurs et extérieurs, associés à une méthode de diversification stylistique conçue pour multiplier les scénarios rares et coûteux à collecter dans la réalité. Le jeu de données résultant compte environ 400 000 épisodes de navigation. Les auteurs comparent leurs résultats à ceux obtenus avec des jeux de données UAV existants sur plusieurs métriques et constatent que les performances du modèle entraîné sur NavGen progressent avec l'échelle des données, dépassant les modèles entraînés sur les corpus concurrents. Pour vérifier le transfert vers le monde réel, l'équipe a déployé le modèle selon un paradigme dit "world-action-model" lors d'essais de vol réels, avec un taux de réussite de 75% sur des tâches et environnements de navigation variés. Cette approche s'attaque à un compromis structurel connu du secteur de la robotique aérienne : les données simulées sont générables à grande échelle mais souffrent d'un écart visuel important entre simulation et réalité, tandis que les données de vol réelles sont fidèles mais coûteuses et lentes à rassembler. En proposant les modèles génératifs vidéo comme une troisième voie, capable de produire des observations visuelles réalistes sans les contraintes logistiques du vol réel, NavGen apporte un élément de preuve empirique en faveur de l'hypothèse selon laquelle des générateurs vidéo haute fidélité peuvent servir de moteurs de données scalables pour l'IA incarnée. Le résultat intéresse directement les intégrateurs et laboratoires travaillant sur des modèles vision-langage-action : un taux de succès de 75% en conditions réelles, à nuancer selon la difficulté exacte des tâches testées et le nombre d'essais réalisés, suggère que l'écart entre démonstration et déploiement réel peut se réduire grâce à des données synthétiques mieux conçues plutôt que par la seule accumulation de vols réels. NavGen s'inscrit dans la lignée des travaux récents qui cherchent à contourner la pénurie de données d'entraînement pour la robotique incarnée, un problème déjà posé pour les bras manipulateurs et les humanoïdes et qui touche tout autant la navigation aérienne autonome. L'article ne révèle ni affiliation institutionnelle ni drone commercial associé au projet, et reste au stade de préprint scientifique : aucun partenariat industriel, pilote client ni feuille de route de déploiement n'est mentionné à ce jour. Les auteurs positionnent leur travail comme une alternative aux jeux de données UAV existants utilisés comme références dans le domaine, sans toutefois les nommer explicitement. La suite logique, non confirmée par les auteurs, serait l'extension de la méthode à d'autres classes de robots mobiles ou à des tâches de navigation plus complexes.

RechercheOpinion
1 source
Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse
2arXiv cs.RO 

Génération 3D pour l'IA incarnée et la simulation robotique : une synthèse

Une étude de synthèse publiée sur arXiv (2604.26509) propose le premier panorama systématique de la génération 3D appliquée à l'IA incarnée (embodied AI) et à la simulation robotique. Les auteurs organisent la littérature autour de trois rôles que joue la génération 3D dans les pipelines robotiques : la production d'assets de simulation (objets articulés, déformables, physiquement contraints), la construction d'environnements interactifs orientés tâche (génération de scènes avec conscience structurelle et capacités agentiques), et le pont sim-to-real, soit la reconstruction de jumeaux numériques, l'augmentation de données synthétiques et la génération de démonstrations pour l'apprentissage robot. Cette taxonomie en trois pôles structure un corpus jusqu'ici dispersé dans plusieurs sous-domaines cloisonnés. Le constat central est que le domaine bascule d'un objectif de réalisme visuel vers ce que les auteurs nomment l'"interaction readiness", soit la capacité d'un asset 3D à être utilisable dans une boucle de contrôle robot. Un objet généré peut être visuellement convaincant tout en étant physiquement invalide : masse incorrecte, articulations sans cohérence cinématique, propriétés de contact inexploitables. Les auteurs identifient quatre goulots d'étranglement concrets : la rareté des annotations physiques dans les datasets existants, l'écart entre qualité géométrique et validité physique, la fragmentation des protocoles d'évaluation (absence de benchmarks standardisés), et un sim-to-real divide qui reste ouvert malgré les progrès récents en diffusion 3D et 3D Gaussian Splatting. Cette publication s'inscrit dans l'accélération des modèles génératifs 3D que la communauté robotique cherche à exploiter pour alimenter des simulateurs comme NVIDIA Isaac ou Genesis. Créer manuellement des assets physiquement valides reste coûteux et lent ; la génération automatique promet de lever ce verrou, mais les compromis sur la validité physique freinent encore l'adoption à l'échelle industrielle. Google DeepMind, MIT CSAIL, CMU et plusieurs laboratoires académiques travaillent activement sur ce pipeline. La page projet associée (3dgen4robot.github.io) centralise la bibliographie de référence. La prochaine étape structurante pour le secteur sera la définition de benchmarks unifiés couvrant simultanément qualité géométrique, cohérence physique et performance en transfert sim-to-real, condition nécessaire pour que la génération 3D devienne une brique fiable de l'intelligence incarnée.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage par renforcement VLA sim-vers-réel grâce à des mondes 3D génératifs
3arXiv cs.RO 

Passage à l'échelle de l'apprentissage par renforcement VLA sim-vers-réel grâce à des mondes 3D génératifs

Une preprint arXiv mise a jour (2603.18532v3) présente une méthode pour affiner par apprentissage par renforcement (RL) des modèles vision-langage-action (VLA) en remplaçant les données réelles couteuses par des mondes 3D génératifs. Partant d'une politique pretrainee par imitation, les chercheurs combinent des modèles génératifs de scènes 3D et un concepteur de scènes pilote par langage naturel pour produire 100 environnements interactifs varies, permettant un entrainement RL massivement parallèle. Le taux de réussite en simulation grimpe de 9,7% a 79,8%, avec un temps de complétion des taches réduit de 1,25x. Transfere vers le réel grâce a de la randomisation de domaine, le taux de réussite passe de 21,7% a 75%, pour un gain de vitesse de 1,13x. Ce résultat s'attaque a un problème connu du secteur : affiner un VLA par RL directement en conditions réelles évite le fosse sim-to-real mais transforme paradoxalement un modèle généraliste en politique surspecialisee a une seule scene, faute de pouvoir diversifier les environnements physiques a bas cout. La simulation promettait plus de diversité, mais concevoir manuellement des scènes variées restait tout aussi couteux en travail. En montrant qu'un générateur de mondes 3D peut produire a la demande des dizaines d'environnements exploitables pour du RL a grande échelle, ces travaux ouvrent une voie pour les laboratoires et intégrateurs cherchant a entrainer des politiques généralistes sans multiplier les campagnes de collecte réelle, tout en traitant le fosse sim-to-real par la diversité des scènes plutôt que par le seul réalisme physique du simulateur. La méthode s'inscrit dans la lignée des travaux sur le fine-tuning RL des VLA, inspires par les progrès des grands modèles vision-langage entraines par renforcement, et se distingue des approches concurrentes fondées sur le RL purement réel ou sur des bibliothèques de scènes simulées construites a la main. Cette troisième version (v3) succède a des publications antérieures de la même preprint sur arXiv, signe d'un travail itératif. Une étude d'ablation montre que la généralisation zero-shot s'améliore directement avec la diversité des scènes générées, ce qui laisse présager une mise a l'échelle au-delà des 100 environnements testes ici avant tout déploiement industriel.

RechercheActu
1 source
Pelican-Sim 1.0 : un simulateur de modèle du monde généraliste pour l'IA incarnée
4arXiv cs.RO 

Pelican-Sim 1.0 : un simulateur de modèle du monde généraliste pour l'IA incarnée

Un rapport technique publié sur arXiv (2609.12036v1) présente Pelican-Sim 1.0, un simulateur de modèle du monde pour l'intelligence incarnée qui prédit les observations visuelles futures à partir d'une image et d'une action robotique. Son architecture combine un espace d'action unifié à 28 dimensions couvrant la plupart des morphologies robotiques, une injection action-vision par vidéos rendues via des modèles URDF (PSNR +0,904), des couches sparse mixture-of-experts réduisant les conflits entre modalités (FVD -6,530), et une distillation en quatre étapes accélérant la génération de 5,67x face à un modèle à 35 étapes. Entraîné sur environ un million de trajectoires réelles et simulées, il gagne +4,636 de PSNR sur AgiBotWorld Beta, +2,080 sur RoboMIND et +10,343 sur RoboTwin. Sur RoboTwin, ajouter 500 trajectoires générées à 50 démonstrations réelles par tâche fait passer le taux de réussite d'une politique de 70% à 93%, et l'évaluation de politiques atteint une corrélation de Pearson de 0,994 avec les résultats réels. Ces résultats ciblent le goulot d'étranglement de l'apprentissage robotique : le coût et la rareté des données réelles nécessaires pour entraîner des politiques vision-langage-action fiables. En démontrant qu'un modèle du monde unique peut générer des données synthétiques exploitables sur plusieurs morphologies de robots, servir de proxy d'évaluation sans essais physiques, et guider la sélection d'actions, avec des gains relatifs jusqu'à 47,7%, Pelican-Sim s'attaque à l'écart persistant entre démonstration en laboratoire et déploiement réel. Pour les intégrateurs, l'intérêt tient à l'échelle testée et à la vitesse de génération par distillation, qui rapproche ces simulateurs d'un usage en boucle d'entraînement plutôt que d'une démonstration académique. Le travail s'inscrit dans la vague de modèles du monde appliqués à la robotique, aux côtés d'efforts comme Cosmos de Nvidia ou Genie de Google DeepMind, sur fond de benchmarks robotiques ouverts comme AgiBotWorld, RoboMIND et RoboTwin. Il s'agit à ce stade d'un rapport technique, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement. Les auteurs avancent des résultats de généralisation qualitative sur des changements de trajectoire, de scène, d'objet, d'embodiment et de point de vue comme preuve de concept, la validation sur des tâches et des robots inédits restant l'étape suivante.

RecherchePaper
1 source