Aller au contenu principal
RecherchearXiv cs.RO 

UniTrackPLA : modèle unifié panorama-langage-action pour la navigation guidée par instructions et le suivi de personnes en mouvement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

UniTrackPLA est un modèle panorama-langage-action présenté dans un preprint arXiv (2610.00878v1) qui traite avec une seule politique deux tâches habituellement séparées: la navigation vers une destination décrite en langage naturel et le suivi dynamique d'une personne, quel que soit son azimut initial. Son encodage panoramique (Panoramic-Aware Encoding, PAE) conserve la structure temporelle et azimutale des vues en perspective projetées depuis chaque panorama. Les encodeurs visuels pré-entraînés sur des images en perspective peuvent ainsi traiter des observations omnidirectionnelles. Un backbone vision-langage partagé ancre l'instruction dans le contexte panoramique et prédit des blocs de waypoints continus, exprimés dans le repère du robot. Un module de cohérence monde-action (World-Action Consistency, WAC) prédit les états visuels futurs conditionnés par l'action et vérifie en ligne les préfixes de waypoints. Les actions jugées fiables sont réutilisées, et une incohérence déclenche une replanification. Le jeu de données OmniTrackNav-Bench compte 5 000 trajectoires de suivi simulées, 10 000 routes de navigation simulées (VLN) et 96 routes réelles vérifiées, soit 919 978 instances de supervision par waypoints. Le taux de succès (SR) global en suivi passe de 23,50 % à 35,00 %. En navigation omnidirectionnelle, le SR et le SPL passent de 13,00 % et 12,77 % à 19,75 % et 19,29 %. L'ajout de 76 routes réelles fait grimper l'EP@0,2 m sur les routes réservées à l'évaluation de 42,92 % à 92,08 %. Des essais en boucle fermée ont été menés sur un robot quadrupède à roues Go2-W, en intérieur comme en extérieur.

L'intérêt tient à la fois à l'architecture et aux ordres de grandeur. La plupart des approches reposent sur une caméra frontale et sur des politiques distinctes pour la navigation et le suivi. Cela empêche de retrouver une personne située dans le dos du robot et d'avoir un contrôle unifié en boucle fermée. Un panorama traité par un encodeur pré-entraîné évite de repartir de zéro côté perception. La vérification en ligne des actions répond aussi à un problème pratique des VLA, qui exécutent des séquences d'actions sans savoir si elles restent valides. Les chiffres demandent toutefois de la prudence. Les gains simulés sont réels mais les taux absolus restent bas, avec 35 % de succès en suivi et moins de 20 % en navigation. Le saut à 92 % sur le réel porte sur un jeu de test restreint, issu d'un faible nombre de routes. Il montre surtout le poids des données réelles, sans prouver une robustesse en conditions industrielles.

Ces travaux s'inscrivent dans la vague des modèles vision-langage-action pour la navigation, qui ciblent surtout des caméras frontales, et des systèmes de suivi de personne entraînés séparément. Le choix d'un Go2-W, plateforme d'Unitree très répandue en recherche, favorise la reproductibilité. Une page de projet est annoncée. Les suites probables sont l'extension du corpus réel, bien plus petit que le simulé, et des tests dans des environnements encombrés et peuplés. Le preprint n'indique ni déploiement commercial ni calendrier.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

I-Perceive : un modèle fondation pour la perception active guidée par instructions en langage naturel
1arXiv cs.RO 

I-Perceive : un modèle fondation pour la perception active guidée par instructions en langage naturel

Une équipe de recherche présente I-Perceive, un modèle de fondation pour la perception active conditionnée par le langage, dans une version révisée (v2) d'un article déposé sur arXiv sous la référence 2603.00600. À partir d'une image requête, d'images de contexte et d'une instruction en langage naturel, le système prédit une pose de caméra à 6 degrés de liberté satisfaisant l'intention de perception exprimée, dans de grands environnements intérieurs. L'architecture associe une voie vision-langage pour l'ancrage sémantique des instructions et une voie de raisonnement géométrique pour la compréhension 3D multi-vues, reliées par une fusion sémantique multi-couches. L'entraînement s'appuie sur un jeu de données de paires langage-point de vue à grande échelle, construit via un pipeline automatisé combinant scans de scènes réelles et environnements simulés. Les systèmes de perception active existants restent généralement limités à des objectifs fixes ou à des contextes restreints ; I-Perceive vise au contraire une généralisation à des intentions ouvertes, formulées librement en langage naturel, un point faible connu de la robotique mobile actuelle. Pour les intégrateurs travaillant sur des AMR, des bras manipulateurs ou des plateformes humanoïdes, l'enjeu est concret : la plupart des modèles vision-langage-action (VLA) décident quoi faire à partir d'un flux caméra fixe, sans jamais décider où regarder. Les auteurs revendiquent une généralisation zéro-shot à des scènes et instructions inédites, ainsi qu'un mode boucle fermée affinant le point de vue au fil d'interactions successives, ce qui, si cela se confirme hors du cadre des auteurs, rapprocherait les robots d'une exploration active plutôt que d'une perception passive. Ce travail s'inscrit dans la vague des modèles de fondation pour la robotique, aux côtés d'architectures vision-langage-action comme Pi-0, GR00T N2 ou Helix, centrées sur la génération d'actions à partir d'une perception supposée acquise ; I-Perceive se place en amont, sur la question négligée de savoir où regarder pour obtenir l'information utile à la tâche. Il se distingue aussi des approches classiques de perception active de type next-best-view, limitées à des objectifs géométriques sans compréhension du langage. Publié comme remplacement d'une soumission arXiv antérieure, l'article reste une contribution évaluée sur des données et environnements construits par les auteurs, sans code ouvert ni déploiement sur robot physique mentionné ; l'intégration sur des plateformes commerciales demeure une suite logique mais non confirmée.

RecherchePaper
1 source
Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action
2arXiv cs.RO 

Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action

Publiée le 4 août 2026 sur arXiv (2608.04633), une méthode baptisée Mind-VLA corrige un défaut des modèles vision-langage-action (VLA) en robotique: les approches existantes alignent leur représentation avec la géométrie 3D de toute la scène de façon uniforme, sans isoler l'objet désigné par l'instruction, d'où des échecs en manipulation fine ou en cas d'occlusion. Mind-VLA identifie d'abord cet objet cible, en génère une vue à trois angles, en extrait des caractéristiques VAE et VGGT, puis aligne la représentation latente du modèle dessus. Avec un backbone compact de 345 millions de paramètres, le système atteint 93,9% de réussite sur LIBERO, 4,47 sur CALVIN, et 54% de succès moyen sur robot réel en situation d'occlusion, soit 32 points de plus que la meilleure méthode instruction-agnostique comparée. Le code sera publié en open source. Le résultat vise un problème concret pour les intégrateurs déployant bras manipulateurs ou humanoïdes: les démonstrations de laboratoire s'effondrent souvent dès que l'objet à saisir est partiellement caché par un carton, une pièce voisine ou l'angle de la caméra. En conditionnant la représentation 3D sur l'objet réellement visé plutôt que sur la scène entière, Mind-VLA cible directement l'écart entre démo et réalité industrielle. Le gain de 32 points obtenu sur robot réel, pas seulement en simulation, compte dans un domaine où les progrès annoncés reposent souvent sur des vidéos sélectionnées ou des métriques peu transposables. Mind-VLA s'inscrit dans la lignée des travaux sur l'alignement géométrique des VLA, qui injectent une compréhension 3D explicite dans des modèles entraînés sur images et texte, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sans qu'aucun ne cible spécifiquement l'objet d'intérêt. Le résumé ne nomme pas la méthode instruction-agnostique servant de référence, ce qui invite à la prudence tant que l'article complet et le code promis ne sont pas vérifiables. La piste, aligner la représentation sur l'objet désigné plutôt que sur toute la scène, devrait néanmoins intéresser d'autres laboratoires travaillant sur la manipulation fine.

RechercheOpinion
1 source
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
3arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt
4arXiv cs.RO 

PIGEON : navigation vers des objets guidée par un modèle vision-langage via la sélection de points d'intérêt

Des chercheurs ont publié PIGEON (Point of Interest Guided Exploration for Object Navigation), un cadre de navigation robotique pour localiser des objets dans des espaces intérieurs inconnus. L'approche repose sur des modèles vision-langage (VLM), mais résout leur principal obstacle opérationnel : l'inférence dense image par image est trop coûteuse pour un usage embarqué temps réel. PIGEON introduit des Points d'Intérêt (PoI), unités de décision visuelles couplant waypoints géométriques et observations égocentriques brutes, que le VLM utilise pour sélectionner parmi des destinations candidates : frontières d'exploration, objets suspectés, escaliers franchissables, résumés de niveau sol. Un planificateur bas niveau exécute les trajectoires continues entre ces points. Le système intègre un pipeline RLVR (Reinforcement Learning with Verifiable Rewards) permettant d'affiner des VLM locaux sans annotations Chain-of-Thought manuelles. Sur le benchmark Habitat ObjectNav, référence standard en navigation simulée, PIGEON affiche les meilleures performances zero-shot publiées à ce jour et se transfère à la tâche Active Embodied Question Answering par simple modification du prompt. Des déploiements sur robots physiques sont documentés dans le papier (arXiv 2511.13207). L'enjeu central est l'efficacité computationnelle des VLM dans des boucles de contrôle robotique. Les approches concurrentes utilisent soit les VLM comme contrôleurs denses (coûteux), soit pour un simple ranking de frontières d'exploration (sémantiquement appauvri). PIGEON propose un compromis : décisions rares mais ancrées dans les observations brutes, rendant chaque choix vérifiable et compatible avec l'apprentissage par renforcement sans supervision humaine. La réduction de la dépendance aux données annotées est un avantage concret pour des équipes robotiques sans large budget d'annotation. La progression des performances avec la taille du modèle de fondation (scaling) indique une architecture alignée avec les tendances génératives actuelles. La navigation d'objets en environnement inconnu est un benchmark actif en robotique cognitive, avec des systèmes concurrents comme ESC, SG-Nav ou OpenFMNav exploitant également des LLM pour la planification sémantique. PIGEON se différencie par son mode zero-shot strict, sans réentraînement spécifique à l'environnement cible. Habitat, le simulateur d'intérieur de Meta AI Research, reste la plateforme d'évaluation de référence pour ce type de tâche. Ce résultat est académique : aucun partenariat commercial ni déploiement industriel n'est mentionné, et la robustesse en environnements réels dynamiques non contrôlés reste à valider à plus grande échelle. Les prochaines étapes naturelles incluent des tests en milieux variés et l'adaptation à des VLM embarqués contraints en ressources.

RechercheOpinion
1 source