Aller au contenu principal
RecherchearXiv cs.RO 

GATOR : reconstruction d'objets 3D générative et à base d'agents à partir de photos du quotidien

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de NVIDIA (laboratoire LPR) publient GATOR, un cadre de reconstruction 3D d'objets à partir d'images ordinaires, présenté sur arXiv en octobre 2026. À partir d'une ou plusieurs photos prises sans protocole particulier, le système produit un objet texturé complet et sa pose relative à la scène, y compris pour les surfaces masquées par des occultations. Un « mélangeur de modalités local » associe, avant le raisonnement multi-vues, les caractéristiques RGB, le masque de l'objet cible et les cartes de points (pointmaps), alignées au niveau des patchs. Cela permet de conserver le contexte de la scène tout en distinguant la cible de son environnement. Des adaptateurs spécifiques à chaque étape (structure, géométrie, apparence) injectent en plus des noms de catégories et des légendes textuelles. L'actif généré initialise ensuite un agent multimodal, qui affine la structure et la texture par une boucle « édition, rendu, revue » guidée par les observations. Les auteurs annoncent une bonne fidélité géométrique et visuelle sur des objets synthétiques, des tables encombrées et des scènes d'intérieur, ainsi qu'une récupération de la pose avec peu d'observations.

L'intérêt pour la robotique tient surtout à ce que le résumé appelle la « préparation à la simulation ». Construire des jumeaux numériques d'une scène réelle reste un goulot d'étranglement pour l'apprentissage sim-to-real. Les environnements sont souvent modélisés à la main ou scannés avec du matériel dédié, ce qui limite le volume de données d'entraînement pour les politiques VLA et les modèles de fondation robotiques. Si une poignée de photos de smartphone suffit à produire des actifs alignés sur la scène et exploitables dans un simulateur, le coût de création d'environnements variés baisse nettement. Pour les intégrateurs, cela pourrait aider à valider des cellules de travail ou à générer des scènes de test à partir de simples captures sur site. Les auteurs évoquent aussi des comparaisons à budget de temps égal, qui visent l'efficacité plutôt que la seule qualité maximale. Le résumé ne donne cependant aucun chiffre sur les métriques, les temps de calcul ni les jeux de données. L'ampleur réelle du gain, la robustesse hors des benchmarks et la précision physique (masses, collisions, articulations) restent donc à vérifier dans l'article complet.

GATOR s'inscrit dans la course aux modèles génératifs 3D, qui ont progressé rapidement avec les approches image vers 3D et les reconstructions par cartes de points à la DUSt3R. Beaucoup de ces méthodes produisent un objet isolé, sans pose fiable dans la scène, ou peinent avec les occultations. L'ajout d'une boucle agentique de relecture et de correction reflète une tendance plus large : utiliser des modèles de langage et de vision comme relecteurs pour corriger les sorties génératives. NVIDIA, déjà très présent en simulation avec Isaac Sim, Omniverse et la famille GR00T, a un intérêt évident à alimenter ses pipelines en actifs 3D produits automatiquement. Il s'agit pour l'instant d'une publication de recherche. Aucun code, calendrier d'intégration ni produit n'est annoncé dans le résumé, qui renvoie seulement à une page de projet sur le site de NVIDIA Research.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents
1arXiv cs.RO 

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents

Une équipe de chercheurs a présenté AGILE (arXiv:2602.04672v3), un framework de reconstruction d'interactions dynamiques main-objet à partir de vidéos monoculaires, ciblant deux applications majeures : la collecte de données pour la manipulation dextère en robotique et la création de jumeaux numériques pour la simulation et la réalité virtuelle. La méthode s'attaque à deux verrous techniques qui paralysent les approches existantes : d'une part, le rendu neuronal classique produit sous forte occultation des géométries fragmentées, inutilisables directement en simulation physique ; d'autre part, l'initialisation par Structure-from-Motion (SfM) est notoriellement fragile sur des vidéos captées en conditions réelles. AGILE bascule du paradigme de reconstruction vers ce que les auteurs appellent une "génération agentique" : un Vision-Language Model (VLM) pilote un modèle génératif pour synthétiser un mesh objet complet, fermé (watertight) et texturé haute fidélité, sans dépendre du contenu vidéo occulté. Une stratégie dite "anchor-and-track" initialise la pose de l'objet sur une unique frame d'interaction via un modèle fondation, puis propage cette pose temporellement en exploitant la similarité visuelle entre l'asset généré et les frames vidéo. Une optimisation finale dite contact-aware intègre des contraintes sémantiques, géométriques et de stabilité d'interaction pour garantir la plausibilité physique. Sur les benchmarks HO3D, DexYCB et ARCTIC, AGILE surpasse les baselines en précision géométrique globale. L'intérêt industriel de cette approche réside dans la production d'assets directement exploitables en simulation, une propriété validée par les auteurs via du retargeting real-to-sim pour des applications robotiques. C'est précisément le point de friction qui freinait l'adoption des pipelines de reconstruction vidéo dans les boucles d'entraînement de politiques de manipulation : les meshes obtenus par NeRF ou reconstruction multi-vues classique nécessitaient un travail de remaillage manuel avant d'être injectables dans un moteur physique comme MuJoCo ou Isaac Sim. En contournant le SfM, AGILE devient également utilisable sur des données de terrain non contrôlées, ce qui ouvre la voie à la collecte passive de démos humaines à grande échelle, un prérequis pour les approches VLA (Vision-Language-Action) qui peinent encore à obtenir suffisamment de trajectoires dextères annotées. Le problème de la reconstruction main-objet est étudié depuis plusieurs années, avec des datasets de référence comme HO-3D (2020) et DexYCB (2021), et des méthodes basées sur les modèles paramétriques MANO pour la main. L'originalité d'AGILE est de déporter la reconstruction de l'objet vers une génération guidée, plutôt que de l'estimer directement depuis le signal vidéo dégradé. Les concurrents directs sont les méthodes NeRF-based adaptées aux scènes dynamiques (D-NeRF, HO-NeRF) et les pipelines SfM+MVS classiques, tous sensibles aux occultations. Du côté des acteurs industriels, cette direction intéresse directement les équipes travaillant sur la télé-opération et l'imitation learning pour bras robotiques dextères, notamment chez Dexterous Robotics, Physical Intelligence (Pi) ou les labos académiques proches de Figure et Apptronik. Le projet dispose d'une page dédiée (agile-hoi.github.io) ; aucun code ni dataset supplémentaire n'est annoncé à ce stade.

RecherchePaper
1 source
NavArena : construction automatisée de bancs d'essai de navigation orientés objectifs à partir de reconstructions par 3D Gaussian Splatting
2arXiv cs.RO 

NavArena : construction automatisée de bancs d'essai de navigation orientés objectifs à partir de reconstructions par 3D Gaussian Splatting

Une équipe de recherche publie sur arXiv (arXiv:2609.04602v1, septembre 2026) NavArena, un framework automatisé qui transforme des reconstructions figées en 3D Gaussian Splatting (3DGS) en bancs d'essai pour la navigation visuelle orientée objectif. Le système combine trois briques techniques : un modèle 3DGS gelé pour le rendu RGB-D en vue égocentrique, une carte d'occupation dérivée de la densité des gaussiennes et de statistiques de hauteur pour évaluer la franchissabilité du terrain et détecter les collisions, et des candidats d'objectifs sémantiques extraits de masques multi-vues en vocabulaire ouvert. Ces composants permettent de générer automatiquement des épisodes de navigation et de les évaluer selon un protocole unifié en boucle fermée. Sur plus de 2 000 scènes, NavArena a généré 22,2 millions de trajectoires expertes. Les auteurs annoncent la publication publique de tous les outils de génération de benchmarks, des protocoles d'évaluation et des jeux de données dérivés. Le problème que résout NavArena est concret : les reconstructions 3DGS offrent des vues nouvelles photoréalistes mais manquaient jusqu'ici des contraintes de franchissabilité, des objectifs valides et des protocoles en boucle fermée nécessaires pour évaluer réellement une politique de navigation. En automatisant la construction de ces bancs d'essai à grande échelle, le framework répond à un goulot d'étranglement classique de la recherche en navigation embarquée et en IA incarnée, où la création manuelle de benchmarks réalistes reste coûteuse et peu reproductible. Pour les laboratoires qui entraînent des politiques de navigation visuelle sur robots mobiles ou AMR, l'intérêt est double : un volume massif de trajectoires expertes pour l'apprentissage, et une capacité diagnostique, les auteurs précisant que les tests de politiques (rollouts) servent surtout à démontrer la valeur diagnostique du protocole d'évaluation, plutôt qu'à afficher des scores flatteurs. NavArena s'inscrit dans la généralisation du 3D Gaussian Splatting comme technique de rendu rapide et photoréaliste, de plus en plus utilisée pour construire des environnements de simulation à partir de captures du monde réel, en remplacement des maillages synthétiques des bancs d'essai historiques bâtis sur des jeux de données comme Matterport3D. Ces reconstructions 3DGS existantes manquaient jusqu'ici de la couche sémantique et physique nécessaire à une évaluation de navigation rigoureuse, se limitant à la synthèse de vues. Aucune date de disponibilité publique n'est communiquée pour l'instant : seule l'intention de publier les outils de génération, les protocoles d'évaluation et les données dérivées est annoncée, sans calendrier ni partenaire de déploiement précisé.

RecherchePaper
1 source
RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution
3arXiv cs.RO 

RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution

Des chercheurs présentent Agentic Real-to-Sim-to-Real (Agentic RSR), un cadre qui relie dans une même boucle la reconstruction de scène, le développement de politique et l'exécution sur robot réel, à partir d'une seule tâche de manipulation. L'entrée se limite à une vidéo de l'espace de travail, une description de la tâche et le modèle connu du robot. Un agent récupère l'échelle métrique, affine la scène par retours visuels successifs et vérifie dans MuJoCo que les interactions pertinentes pour la tâche sont bien préservées. Un agent de codage écrit ensuite une politique exécutable, en progressant des poses d'objets privilégiées vers des observations visuelles, puis vers une simulation randomisée. La politique peut enchaîner plusieurs observations et actions au sein d'un même appel, et l'agent exploite les retours d'exécution pour poursuivre, réessayer ou revoir son approche. Sur 18 scènes reconstruites impliquant deux robots, l'erreur absolue moyenne de profondeur sur quatre vues, mesurée par rapport à des estimations de référence, atteint 0,1057 m. Le ΔE76 moyen en espace Lab est de 11,04 et le SSIM moyen en niveaux de gris de 0,6990. Sur robot réel, le taux de réussite agrégé atteint 80 % de celui obtenu en simulation. Le point notable tient à l'architecture plus qu'à une performance isolée. La reconstruction de scène et le développement de politique sont habituellement traités séparément, ce qui produit des jumeaux numériques jolis mais inutiles pour la tâche, ou des politiques entraînées sur des observations que le robot réel ne verra jamais. Ici, la scène est jugée sur sa capacité à préserver les interactions utiles, et la politique n'utilise que des observations disponibles sur le matériel. Un taux de rétention de 80 % suggère que le fossé sim-to-real peut se réduire sans entraînement massif par apprentissage par renforcement, en s'appuyant sur du code généré par un agent et corrigé par ses retours d'exécution. Pour les intégrateurs, la perspective est de déployer plus vite sur une cellule inédite à partir d'une simple vidéo. Les métriques de reconstruction restent toutefois modestes : une erreur de profondeur d'environ 10 cm et un SSIM proche de 0,70 indiquent une fidélité visuelle limitée. Le ratio de 80 % est relatif à la simulation, et le taux de réussite absolu, la diversité des tâches et le nombre d'essais ne sont pas précisés dans le résumé. Ces travaux s'inscrivent dans la montée des approches « real-to-sim » et des agents de codage appliqués à la robotique, qui concurrencent les VLA entraînés de bout en bout, plus gourmands en données de téléopération. Ils reposent sur MuJoCo, simulateur désormais standard, et sur des modèles de perception pour la profondeur et la géométrie. L'article, publié sur arXiv (2610.10479v1), annonce que le code et les données de scènes reconstruites seront rendus publics, sans calendrier précisé. Leur diffusion permettra de vérifier si la méthode tient hors du cadre de laboratoire, sur des tâches plus longues et des environnements encombrés, ainsi que de la comparer aux politiques apprises de bout en bout.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RAPID : programmation à base d'agents pour robots à partir de démonstrations
4arXiv cs.RO 

RAPID : programmation à base d'agents pour robots à partir de démonstrations

Une équipe de recherche présente RAPID (Robot Agentic Programming from Demonstrations) dans un preprint publié sur arXiv le 25 septembre 2026 (arXiv:2609.30249) : un système qui génère, vérifie et affine automatiquement un programme robotique complet à partir d'une seule démonstration visuelle humaine, sans corpus d'entraînement massif. La boucle agentique itérative infère elle-même, depuis cette démonstration, trois ingrédients clés : une spécification de tâche testable, des primitives d'action exécutables par le robot, et un environnement interactif pour exécuter et vérifier le programme. Pour rendre le résultat réutilisable au-delà du contexte filmé, RAPID exprime les primitives comme des programmes d'optimisation de trajectoire reproduisant l'effet de mouvement au niveau de l'objet, assemblés par des contraintes relationnelles qui capturent la géométrie de la scène au moment de l'exécution. Les chercheurs ont testé le système en simulation sur huit tâches de manipulation non préhensile riches en contacts (pousser, pivoter, basculer des objets) et sur des tâches préhensiles classiques du benchmark LIBERO-Pro, puis l'ont déployé sur un bras robotique Franka réel pour l'ensemble des huit tâches non préhensiles ; le projet est documenté sur yuyaoliu.me/projects/rapid. L'intérêt de RAPID tient à la difficulté qu'il attaque : transformer une démonstration unique en un programme réutilisable et généralisable, là où les politiques d'apprentissage par imitation ou les modèles vision-langage-action (VLA) exigent généralement des corpus de démonstrations massifs. En appliquant à la manipulation robotique la logique des agents de codage logiciel, capables d'itérer, tester et corriger leur propre production, RAPID parie que la synthèse de programmes symboliques explicites généralise mieux que des politiques paramétriques apprises, en particulier sur les tâches non préhensiles où la dynamique de contact et le frottement rendent la généralisation notoirement difficile. Les auteurs revendiquent une généralisation à la pose, la forme, le matériau et l'environnement des objets, une affirmation émanant pour l'instant d'une seule équipe sur un périmètre de tâches limité et non validée indépendamment ; le déploiement réel se cantonne d'ailleurs à un unique bras Franka et aux tâches non préhensiles, les tâches préhensiles de LIBERO-Pro n'ayant été testées qu'en simulation. Il s'agit donc d'un résultat de recherche prometteur mais encore au stade du preprint, pas d'un produit ou d'un pipeline prêt pour l'intégration industrielle. Le travail s'inscrit dans un mouvement plus large visant à transposer aux robots le paradigme des agents de codage popularisé en génie logiciel, plutôt que d'empiler les données pour entraîner des politiques de bout en bout. Il se positionne ainsi en alternative aux approches VLA dominantes du secteur, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, qui apprennent des politiques directement à partir de grands ensembles de démonstrations plutôt que de synthétiser un programme symbolique explicite à partir d'un seul exemple ; aucun acteur français ou européen n'apparaît dans cette publication. À ce stade, RAPID reste un résultat académique diffusé via un preprint arXiv et un site de projet présentant des matériaux complémentaires, sans partenariat industriel, pilote de déploiement ni calendrier de commercialisation annoncés par les auteurs.

RecherchePaper
1 source