UniTrackPLA : modèle unifié panorama-langage-action pour la navigation guidée par instructions et le suivi de personnes en mouvement
UniTrackPLA est un modèle panorama-langage-action présenté dans un preprint arXiv (2610.00878v1) qui traite avec une seule politique deux tâches habituellement séparées: la navigation vers une destination décrite en langage naturel et le suivi dynamique d'une personne, quel que soit son azimut initial. Son encodage panoramique (Panoramic-Aware Encoding, PAE) conserve la structure temporelle et azimutale des vues en perspective projetées depuis chaque panorama. Les encodeurs visuels pré-entraînés sur des images en perspective peuvent ainsi traiter des observations omnidirectionnelles. Un backbone vision-langage partagé ancre l'instruction dans le contexte panoramique et prédit des blocs de waypoints continus, exprimés dans le repère du robot. Un module de cohérence monde-action (World-Action Consistency, WAC) prédit les états visuels futurs conditionnés par l'action et vérifie en ligne les préfixes de waypoints. Les actions jugées fiables sont réutilisées, et une incohérence déclenche une replanification. Le jeu de données OmniTrackNav-Bench compte 5 000 trajectoires de suivi simulées, 10 000 routes de navigation simulées (VLN) et 96 routes réelles vérifiées, soit 919 978 instances de supervision par waypoints. Le taux de succès (SR) global en suivi passe de 23,50 % à 35,00 %. En navigation omnidirectionnelle, le SR et le SPL passent de 13,00 % et 12,77 % à 19,75 % et 19,29 %. L'ajout de 76 routes réelles fait grimper l'EP@0,2 m sur les routes réservées à l'évaluation de 42,92 % à 92,08 %. Des essais en boucle fermée ont été menés sur un robot quadrupède à roues Go2-W, en intérieur comme en extérieur.
L'intérêt tient à la fois à l'architecture et aux ordres de grandeur. La plupart des approches reposent sur une caméra frontale et sur des politiques distinctes pour la navigation et le suivi. Cela empêche de retrouver une personne située dans le dos du robot et d'avoir un contrôle unifié en boucle fermée. Un panorama traité par un encodeur pré-entraîné évite de repartir de zéro côté perception. La vérification en ligne des actions répond aussi à un problème pratique des VLA, qui exécutent des séquences d'actions sans savoir si elles restent valides. Les chiffres demandent toutefois de la prudence. Les gains simulés sont réels mais les taux absolus restent bas, avec 35 % de succès en suivi et moins de 20 % en navigation. Le saut à 92 % sur le réel porte sur un jeu de test restreint, issu d'un faible nombre de routes. Il montre surtout le poids des données réelles, sans prouver une robustesse en conditions industrielles.
Ces travaux s'inscrivent dans la vague des modèles vision-langage-action pour la navigation, qui ciblent surtout des caméras frontales, et des systèmes de suivi de personne entraînés séparément. Le choix d'un Go2-W, plateforme d'Unitree très répandue en recherche, favorise la reproductibilité. Une page de projet est annoncée. Les suites probables sont l'extension du corpus réel, bien plus petit que le simulé, et des tests dans des environnements encombrés et peuplés. Le preprint n'indique ni déploiement commercial ni calendrier.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




