Aller au contenu principal
AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux
RecherchearXiv cs.RO 

AgentGrounder : ancrage visuel 3D en zéro-shot dans des nuages de points via des modèles multimodaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire be2rlab publient sur arXiv (arXiv:2605.25901) AgentGrounder, un système de localisation visuelle 3D zéro-shot opérant directement sur des nuages de points colorés, sans entraînement spécifique à la tâche. L'architecture repose sur deux étapes : une phase hors ligne construit une table de correspondance d'objets (Object Lookup Table, OLT) regroupant identifiants d'instances, labels sémantiques et boîtes englobantes 3D ; une phase en ligne déploie un agent qui décompose chaque requête en langage naturel, récupère les candidats pertinents dans l'OLT, effectue un scoring géométrique, puis déclenche un rendu d'image à la demande lorsque des indices visuels supplémentaires (couleur, texture, angle de vue) sont nécessaires. Évalué sur les benchmarks ScanRefer et Nr3D en configuration zéro-shot, AgentGrounder surpasse SeeGround de +2,5 % en précision Acc@0.5 sur ScanRefer et de +6,3 % sur Nr3D, dont un gain de +6,3 % sur les requêtes indépendantes du point de vue. Le code est publié sur GitHub.

Ce résultat est directement pertinent pour les équipes travaillant sur la manipulation robotique et la navigation en environnements intérieurs non structurés. L'absence d'entraînement dédié abaisse la barrière d'intégration : un robot équipé d'un LiDAR ou d'une caméra de profondeur pourrait répondre à des commandes en langage naturel sans fine-tuning sur l'environnement cible, ce qui simplifie les déploiements dans des entrepôts ou des espaces de service variables. Le mécanisme de récupération sélective dans l'OLT réduit les erreurs en cascade typiques des pipelines d'ancrage-cible fixes, qui saturent la fenêtre de contexte des modèles de langage avec des objets non pertinents. L'inspection visuelle adaptative évite par ailleurs de solliciter inutilement les capacités multimodales coûteuses lorsque la géométrie seule suffit à discriminer.

La localisation visuelle 3D est un domaine de recherche structuré autour de benchmarks comme ScanRefer (2020) et Nr3D, qui évaluent la capacité à identifier un objet précis dans une scène intérieure 3D à partir d'une description textuelle ambiguë. Les méthodes zéro-shot antérieures supposaient souvent des ensembles d'images multi-vues préexistants et peinaient face aux limites sémantiques des outils de segmentation 3D standards, SeeGround représentant jusqu'ici l'état de l'art sur ces benchmarks. Côté industrie, NVIDIA intègre des capacités de grounding 3D dans son framework GR00T pour la manipulation robotique, tandis qu'Enchanted Tools en France et les équipes embodied AI de Meta FAIR travaillent sur des modules similaires de compréhension spatiale ouverte. AgentGrounder, encore au stade de preprint non évalué par les pairs, devra confirmer ses performances hors contexte académique avant toute adoption en conditions réelles.

Impact France/UE

Enchanted Tools (France), explicitement citée comme travaillant sur des modules similaires de compréhension spatiale ouverte, peut utiliser AgentGrounder comme référence zéro-shot pour réduire les coûts de fine-tuning dans ses déploiements robotiques.

À lire aussi

NavDreamer : des modèles vidéo comme navigateurs 3D en zero-shot
1arXiv cs.RO 

NavDreamer : des modèles vidéo comme navigateurs 3D en zero-shot

Des chercheurs présentent NavDreamer, un framework de navigation robotique en 3D publié sur arXiv sous la référence 2602.09765 (version 2, révisée, papier initialement déposé début 2026). Le système utilise des modèles vidéo génératifs comme interface universelle entre des instructions en langage naturel et des trajectoires de navigation, plutôt que de s'appuyer sur les représentations statiques des modèles Vision-Language-Action (VLA) classiques. Pour gérer le caractère aléatoire des prédictions vidéo, les auteurs ajoutent une méthode d'optimisation par échantillonnage : un modèle de langage visuel (VLM) note et sélectionne les trajectoires générées. Un modèle de dynamique inverse convertit ensuite ces plans vidéo en points de passage exécutables par le robot. L'équipe a construit un benchmark maison couvrant cinq tâches, la navigation vers un objet, la navigation de précision, l'ancrage spatial, le contrôle par le langage et le raisonnement de scène, pour tester plusieurs modèles vidéo de base. Les expériences montrent une généralisation à des objets et environnements inédits. Sur le fond, le travail cible un problème central du secteur : la rareté des données de navigation, coûteuses à collecter par téléopération, et l'incapacité des représentations figées à capturer la dynamique temporelle et les lois physiques. En s'appuyant sur des modèles vidéo entraînés à l'échelle d'internet plutôt que sur des démonstrations robotiques dédiées, NavDreamer teste l'hypothèse selon laquelle la vidéo peut servir de modèle du monde généraliste pour la navigation, sans réentraînement spécifique par environnement. Une conclusion issue des études d'ablation nuance toutefois la portée de l'approche : la navigation se prête bien à ce type de planification vidéo parce qu'elle relève surtout de décisions de haut niveau, où aller, quoi éviter, et non de contrôle moteur fin. Rien n'indique que la méthode transfère aussi bien à des tâches de manipulation exigeant une précision articulaire élevée. Les scores de généralisation « zéro-shot » sont par ailleurs mesurés sur un benchmark conçu par les auteurs eux-mêmes, ce qui appelle une lecture prudente avant toute comparaison avec des déploiements industriels réels. Le papier s'inscrit dans la lignée des modèles VLA qui dominent la robotique généraliste depuis plusieurs années, dans la même famille conceptuelle que des systèmes comme Pi-0, GR00T N2 ou Helix, tous confrontés au même goulot d'étranglement : des jeux de démonstrations robotiques restreints et coûteux à produire. NavDreamer s'en distingue en déportant l'apprentissage vers des modèles vidéo génératifs pré-entraînés sur des corpus internet, une piste explorée en parallèle par plusieurs laboratoires de recherche en robotique et en vision par ordinateur. À ce stade, il s'agit d'une contribution académique : aucun déploiement sur robot physique, aucun partenaire industriel ni date de commercialisation n'apparaît dans la publication. Le benchmark introduit par les auteurs est présenté comme un outil de comparaison entre architectures vidéo, ce qui suggère que la prochaine étape sera une course de performance entre modèles de base avant tout passage à la production.

RecherchePaper
1 source
HiWE : modèle hiérarchique de connaissances du monde avec amélioration par points clés visuels pour la planification de trajectoire 3D en zéro-shot
2arXiv cs.RO 

HiWE : modèle hiérarchique de connaissances du monde avec amélioration par points clés visuels pour la planification de trajectoire 3D en zéro-shot

HiWE, publié sur arXiv (2609.39323v1), est un cadre de génération de démonstrations robotiques qui relie trois décisions habituellement traitées séparément : où l'interaction doit avoir lieu, quel mouvement planifier, et comment exécuter le contact. Le lien est assuré par une interface fondée sur des points. PointVLM, un modèle vision-langage ajusté par instructions, associe les objets pertinents pour la tâche à des coordonnées d'image. Son entraînement mélange annotations de points, échantillons dérivés de segmentation, observations de robots et données de questions-réponses visuelles. Les mesures de profondeur projettent ensuite ces prédictions dans une représentation 3D sémantique. Un planificateur linguistique, 3DLLM, s'appuie sur cette représentation pour produire les waypoints de l'effecteur et les commandes de pince, tandis qu'un module de préhension hybride détermine les poses de saisie locales. L'évaluation porte sur 14 tâches de manipulation simulées et quatre tâches sur robot physique, avec des ablations sur les données visuelles d'entraînement, les entrées spatiales et la sélection de saisie. Aucun chiffre de taux de réussite n'figure dans le résumé. L'intérêt tient à la décomposition. Plutôt qu'une politique VLA de bout en bout qui régresse directement des actions, HiWE isole la perception, la planification et la saisie en modules inspectables, reliés par des points 3D lisibles. Pour un intégrateur, c'est plus facile à déboguer et à adapter qu'un modèle monolithique. La notion de « zéro-shot » demande toutefois de la prudence : elle signifie ici l'absence d'entraînement par démonstrations propres à chaque tâche, mais le modèle visuel est affiné sur des données robotiques existantes. Le volume restreint de tâches réelles, quatre seulement, laisse entière la question du passage de la simulation au monde physique et de la robustesse en environnement industriel non contrôlé. Il s'agit d'un résultat de recherche, sans produit livré ni déploiement. Le travail s'inscrit dans la tendance à combiner grands modèles de langage et ancrage visuel pour la manipulation, en concurrence avec les VLA de bout en bout comme Pi-0, GR00T N2 ou Helix de Figure, qui misent sur l'apprentissage direct des actions à grande échelle. Les auteurs précisent que cet article décrit la formulation initiale, fondée sur les points, et que son lien avec l'extension ultérieure GeneralVLA est détaillé dans l'introduction. La suite logique sera de mesurer cette approche modulaire sur davantage de tâches réelles, avec des temps de cycle et des taux de réussite publiés, avant de pouvoir la comparer honnêtement aux VLA entraînés sur de grands volumes de téléopération.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D
3arXiv cs.RO 

Manipulation dextérique à long horizon en zéro-shot par raisonnement VLM multi-vues ancré en 3D

Des chercheurs ont publié le 19 juin 2026 sur arXiv (référence 2606.19340) un framework zero-shot pour la manipulation dextre à longue séquence, capable d'exécuter des tâches en plusieurs étapes sur des objets inconnus sans entraînement spécifique. Le système prend en entrée des instructions en langage naturel et des images RGB multi-vues calibrées, sans capteur de profondeur, et utilise un modèle vision-langage (VLM) pour générer des points-clés 2D dans un référentiel de vue de référence. Ces points sont ensuite reconstruits en 3D par fusion multi-vues combinant triangulation et une technique de "ray voting" : le système parcourt le rayon optique de la caméra principale pour identifier les candidats géométriquement cohérents dans les vues adjacentes. Les points-clés 3D obtenus supportent deux modes d'exécution : saisie-dépose directe et utilisation d'outils via la récupération d'une trajectoire outil stockée à 6 degrés de liberté (6DoF), alignée sur la configuration de scène courante. Un module bras-main génère ensuite les paires grasping-mouvement faisables. Les expériences réelles montrent que le système surpasse des baselines RGB-D vue unique et des VLA fine-tunés en précision de grounding 3D et en fiabilité d'exécution. L'enjeu central est la flexibilité de déploiement : un système zero-shot qui surpasse des VLA (Vision-Language-Action models) fine-tunés sur données spécifiques remet en question l'hypothèse dominante selon laquelle la manipulation dextre en environnement réel exige obligatoirement de larges datasets annotés et un réentraînement par tâche. Pour les intégrateurs industriels, cela signifie potentiellement des cycles de mise en production raccourcis, sans collecte systématique de démonstrations téléopérées pour chaque nouvel objet ou configuration. La boucle fermée de vérification d'état et de replanification (closed-loop replan) est particulièrement significative : elle distingue ce travail des approches open-loop qui accumulent les erreurs sur des séquences longues, un problème récurrent dans les démos de manipulation non supervisées. L'absence de capteur de profondeur réduit par ailleurs les contraintes matérielles à l'intégration sur des cellules robotiques existantes. Ce travail s'inscrit dans la tension croissante entre deux paradigmes : les VLA de bout-en-bout, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA de Stanford, qui nécessitent supervision et données massives, et les approches modulaires exploitant les capacités de raisonnement de VLM existants sans réentraînement. Depuis 2023, les VLA dominent les benchmarks de manipulation dextre, mais leur coût en données et leur manque de généralisation zero-shot à de nouveaux objets freinent les déploiements industriels à grande échelle. À noter : ce preprint ne mentionne pas d'affiliation institutionnelle dans l'abstract disponible, ce qui limite l'évaluation de la maturité des résultats, et n'a pas encore été soumis à peer review. Aucun acteur européen n'est impliqué. Les suites naturelles seraient une validation sur les benchmarks standardisés DROID ou Open X-Embodiment, et une comparaison formelle avec les versions récentes de Pi-0 et GR00T N2 pour situer précisément les gains annoncés.

RechercheOpinion
1 source
VTLoc : localisation tactile de contact par apprentissage dans des nuages de points visuels
4arXiv cs.RO 

VTLoc : localisation tactile de contact par apprentissage dans des nuages de points visuels

Voici la traduction/résumé de l'article. Des chercheurs présentent VTLoc, un système d'apprentissage qui combine vision et toucher pour localiser précisément un point de contact tactile sur la surface d'un objet, à partir d'un nuage de points 3D issu d'une caméra. Le défi technique central est l'alignement spatial entre les données tactiles, très locales et ponctuelles, et la géométrie visuelle globale de l'objet. VTLoc s'appuie sur deux composants: un module d'alignement multimodal géométrique, qui reconstruit un pseudo-nuage de points à partir des caractéristiques visuelles-tactiles fusionnées puis l'aligne avec le nuage de points visuel réel pour garantir une cohérence spatiale entre les deux modalités; et un module de raffinement itératif, qui ajuste progressivement l'estimation du point de contact au fil des itérations en réexploitant les données fusionnées. Le système a été évalué sur un nouveau benchmark constitué de 100 objets réels, où il améliore la localisation d'un contact tactile unique en réduisant l'ambiguïté de correspondance entre repère local (le capteur tactile) et repère global (l'objet dans son ensemble). Pour l'industrie robotique, cette avancée s'attaque à un verrou concret de la manipulation fine: savoir exactement où un doigt ou un capteur tactile touche un objet est indispensable pour des tâches comme l'insertion de précision, la manipulation en aveugle partiel ou le réajustement de prise sans vision directe du point de contact. La plupart des systèmes actuels traitent vision et toucher comme des flux séparés ou les fusionnent de façon grossière, ce qui laisse une ambiguïté importante dès que le capteur tactile ne "voit" qu'une zone très locale de la surface. En démontrant une réduction mesurable de cette ambiguïté sur un benchmark réel de 100 objets plutôt que sur des simulations, VTLoc apporte une preuve empirique que la fusion géométrique multimodale peut combler l'écart entre la perception globale par caméra et le retour local par capteur tactile, un prérequis pour des manipulateurs plus autonomes en environnement encombré ou peu éclairé. Ce travail s'inscrit dans une lignée de recherche en perception visuo-tactile qui s'est accélérée avec la démocratisation de capteurs tactiles denses (type GelSight ou équivalents) et la maturation des architectures de nuages de points 3D pour la robotique. Il se positionne aux côtés d'efforts plus larges sur les modèles vision-langage-action (VLA) et les architectures de perception multimodale pour la manipulation, sans toutefois constituer un produit déployé: il s'agit d'une contribution de recherche publiée sur arXiv, évaluée en laboratoire, dont les suites naturelles seraient une intégration dans des pipelines de contrôle en boucle fermée et des tests sur des tâches de manipulation complètes plutôt que sur la seule localisation de contact.

RecherchePaper
1 source