Aller au contenu principal
WareFly-VLA : un cadre vision-langage-action pour la navigation de drones et le suivi de personnes en entrepôt intelligent
RecherchearXiv cs.RO 

WareFly-VLA : un cadre vision-langage-action pour la navigation de drones et le suivi de personnes en entrepôt intelligent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient WareFly-VLA, un cadre et un jeu de données destinés à la navigation de drones pilotée par le langage dans les entrepôts intelligents (arXiv 2610.08526). Le corpus rassemble 507 épisodes de vol téléopérés par des humains et 8 504 transitions RGB haute résolution, collectés dans NVIDIA Isaac Sim. Chaque transition est associée à une description écrite par un humain de l'apparence du travailleur ciblé et à une commande de contrôle synchronisée à 4 degrés de liberté. Deux tâches sont couvertes, l'approche d'une cible et le suivi d'une personne, avec occlusions, recherche longue portée, variations d'altitude et encombrement. Quatre architectures VLA open source (SmolVLA, GR00T N1.7, pi_0 et OpenVLA) sont comparées sur un protocole sans fuite de données au niveau de l'épisode, à deux fréquences de contrôle. Le jeu de données, les modèles de référence et le protocole d'évaluation sont publiés.

Les résultats tempèrent l'enthousiasme autour des modèles vision-langage-action. Les performances chutent nettement dès que la généralisation est évaluée strictement, c'est-à-dire sur des épisodes réellement inédits. La modélisation continue des actions bat systématiquement la tokenisation discrète, ce qui va contre le choix d'OpenVLA et conforte l'approche de pi_0. Sur une seule image, seul le canal avant (avancer) est appris de façon fiable, alors que latéral, altitude et rotation restent hors de portée. Enfin, les interfaces des modèles de fondation actuels, conçues pour la manipulation, la navigation au sol et les humanoïdes, se transfèrent mal aux plateformes aériennes. Pour un intégrateur qui envisage des drones d'inventaire ou d'assistance en entrepôt, le message est clair: le contrôle aérien guidé par le langage n'est pas résolu, et un VLA généraliste ne peut pas encore être déployé tel quel.

Ce travail comble un vide. Les VLA ont brillé en manipulation et en navigation de robots mobiles au sol, mais aucun benchmark ne combinait actions de vol continues bas niveau, descriptions fines de cibles en langage naturel et environnements industriels réalistes. Il faut toutefois rester prudent: le jeu de données est modeste (507 épisodes), entièrement simulé, et les résultats viennent de baselines affinées sur une seule image, sans validation sur drone réel. Les annotations de pose et de difficulté, synchronisées avec la vidéo, le langage et les actions, visent aussi la recherche sur les modèles du monde. Aucun acteur français ou européen n'est cité dans l'étude. La suite logique passera par des modèles à mémoire temporelle ou multi-images, puis par des tests sim-to-real. Les équipes derrière SmolVLA, GR00T et pi_0 pourraient s'appuyer sur ce banc d'essai pour adapter leurs architectures à l'aérien.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

UniTrackPLA : modèle unifié panorama-langage-action pour la navigation guidée par instructions et le suivi de personnes en mouvement
1arXiv cs.RO 

UniTrackPLA : modèle unifié panorama-langage-action pour la navigation guidée par instructions et le suivi de personnes en mouvement

UniTrackPLA est un modèle panorama-langage-action présenté dans un preprint arXiv (2610.00878v1) qui traite avec une seule politique deux tâches habituellement séparées: la navigation vers une destination décrite en langage naturel et le suivi dynamique d'une personne, quel que soit son azimut initial. Son encodage panoramique (Panoramic-Aware Encoding, PAE) conserve la structure temporelle et azimutale des vues en perspective projetées depuis chaque panorama. Les encodeurs visuels pré-entraînés sur des images en perspective peuvent ainsi traiter des observations omnidirectionnelles. Un backbone vision-langage partagé ancre l'instruction dans le contexte panoramique et prédit des blocs de waypoints continus, exprimés dans le repère du robot. Un module de cohérence monde-action (World-Action Consistency, WAC) prédit les états visuels futurs conditionnés par l'action et vérifie en ligne les préfixes de waypoints. Les actions jugées fiables sont réutilisées, et une incohérence déclenche une replanification. Le jeu de données OmniTrackNav-Bench compte 5 000 trajectoires de suivi simulées, 10 000 routes de navigation simulées (VLN) et 96 routes réelles vérifiées, soit 919 978 instances de supervision par waypoints. Le taux de succès (SR) global en suivi passe de 23,50 % à 35,00 %. En navigation omnidirectionnelle, le SR et le SPL passent de 13,00 % et 12,77 % à 19,75 % et 19,29 %. L'ajout de 76 routes réelles fait grimper l'EP@0,2 m sur les routes réservées à l'évaluation de 42,92 % à 92,08 %. Des essais en boucle fermée ont été menés sur un robot quadrupède à roues Go2-W, en intérieur comme en extérieur. L'intérêt tient à la fois à l'architecture et aux ordres de grandeur. La plupart des approches reposent sur une caméra frontale et sur des politiques distinctes pour la navigation et le suivi. Cela empêche de retrouver une personne située dans le dos du robot et d'avoir un contrôle unifié en boucle fermée. Un panorama traité par un encodeur pré-entraîné évite de repartir de zéro côté perception. La vérification en ligne des actions répond aussi à un problème pratique des VLA, qui exécutent des séquences d'actions sans savoir si elles restent valides. Les chiffres demandent toutefois de la prudence. Les gains simulés sont réels mais les taux absolus restent bas, avec 35 % de succès en suivi et moins de 20 % en navigation. Le saut à 92 % sur le réel porte sur un jeu de test restreint, issu d'un faible nombre de routes. Il montre surtout le poids des données réelles, sans prouver une robustesse en conditions industrielles. Ces travaux s'inscrivent dans la vague des modèles vision-langage-action pour la navigation, qui ciblent surtout des caméras frontales, et des systèmes de suivi de personne entraînés séparément. Le choix d'un Go2-W, plateforme d'Unitree très répandue en recherche, favorise la reproductibilité. Une page de projet est annoncée. Les suites probables sont l'extension du corpus réel, bien plus petit que le simulé, et des tests dans des environnements encombrés et peuplés. Le preprint n'indique ni déploiement commercial ni calendrier.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Exp2VLA : permettre la navigation de drones par modèle vision-langage-action à partir de démonstrations d'experts
2arXiv cs.RO 

Exp2VLA : permettre la navigation de drones par modèle vision-langage-action à partir de démonstrations d'experts

Des chercheurs proposent Exp2VLA, un pipeline de distillation d'expertise pour la navigation de drones pilotée par le langage, décrit dans une prépublication arXiv (2607.03146v1). Le principe consiste à capturer des comportements experts, qu'ils proviennent de l'apprentissage par renforcement, de la téléopération ou d'autres contrôleurs classiques, puis à convertir ces trajectoires en données d'entraînement pour affiner des modèles vision-langage-action (VLA) de taille compacte. L'objectif est de transférer des stratégies de contrôle existantes vers un modèle unifié capable de comprendre des commandes en langage naturel. Les auteurs ont testé leur approche dans des environnements simulés, à la fois en configuration sim-to-sim et en boucle simulation-in-the-loop, sur des scènes comportant plusieurs objets. Les modèles affinés parviennent à traiter des commandes sémantiques variées et à généraliser à des compositions de cibles jamais vues pendant l'entraînement. Aucun vol réel n'est mentionné à ce stade : les résultats reposent exclusivement sur la simulation. L'enjeu dépasse le simple exercice académique. Les modèles VLA se sont largement développés autour des bras manipulateurs et des humanoïdes, mais leur adaptation aux drones bute sur deux obstacles concrets : le coût de calcul embarqué, souvent incompatible avec les contraintes de poids et d'autonomie d'un UAV, et le manque de robustesse de nombreuses solutions dès que l'environnement se complexifie. En automatisant la conversion de contrôleurs spécialisés en un modèle unique piloté par le langage, Exp2VLA réduit la charge d'intégration manuelle que doivent habituellement assumer les équipes qui déploient de nouveaux comportements robotiques. Pour les intégrateurs et décideurs industriels travaillant sur des flottes de drones autonomes, ce type d'approche illustre une piste pour rendre les systèmes plus flexibles sans repartir d'une architecture de contrôle entièrement nouvelle à chaque nouvelle tâche. Le travail s'inscrit dans la lignée des grands modèles VLA généralistes déjà déployés sur d'autres classes de robots, à l'image de Pi-0 ou GR00T N2 pour les bras et humanoïdes. Son originalité est de cibler spécifiquement les contraintes propres aux UAV plutôt que d'adapter directement des architectures pensées pour des robots au sol. Restant à ce stade un résultat de recherche validé en simulation, la suite logique attendue serait une validation sur drone réel, condition nécessaire avant toute perspective de déploiement opérationnel.

RechercheActu
1 source
Mémoire intégrée et compétences réutilisables : un cadre centré sur la mémoire pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

Mémoire intégrée et compétences réutilisables : un cadre centré sur la mémoire pour les modèles vision-langage-action (VLA)

Des chercheurs proposent Optimus-R, un cadre de type VLA (Vision-Language-Action) centré sur la mémoire, qui traite l'adaptation d'un robot à une nouvelle tâche comme un réglage explicite d'une mémoire requête-compétence, plutôt que comme un réentraînement des paramètres du modèle. Le dispositif repose sur trois briques. Une interface de mémoire « en ligne » insère des tokens de mémoire apprenables dans le flux de préfixe du VLA, ce qui permet au backbone d'extraire des représentations de requête et de compétence liées au contrôle, dans son circuit natif de conditionnement de l'action. Une banque de mémoire requête-compétence externalise ensuite ces compétences : des prototypes de requêtes décident quoi récupérer, des valeurs de compétence précisent comment agir. Enfin, un mécanisme léger « Bridge-and-Adapt » aligne les requêtes et compétences du domaine cible sur l'espace mémoire existant, via un adaptateur et des mises à jour résiduelles. Les auteurs rapportent des expériences en adaptation intra-domaine, inter-domaines et en apprentissage continu. Leur conclusion est un apprentissage de compétences économe en données, avec un oubli catastrophique atténué. Le résumé ne fournit ni taux de réussite, ni nom de robot, ni taille de modèle, ni benchmark. Il s'agit d'un travail de recherche publié sur arXiv, sans produit ni déploiement associé. L'enjeu est très concret pour qui veut déployer des VLA en production. Aujourd'hui, adapter un modèle généraliste à un nouveau poste, une nouvelle pièce ou un nouvel effecteur passe le plus souvent par du fine-tuning. Celui-ci coûte du calcul et des démonstrations, et il peut dégrader les tâches déjà maîtrisées. Pour un intégrateur qui maintient plusieurs cellules, ce risque de régression oblige à revalider l'existant à chaque mise à jour. Déplacer l'apprentissage vers une mémoire externe, extensible avec peu de paramètres modifiés, irait vers une logique plus modulaire, où l'on ajoute une compétence sans toucher au reste. L'approche reste cependant à démontrer. Faute de chiffres dans le résumé, on ignore l'ampleur du gain, la nature des domaines testés (simulation ou matériel réel) et la façon dont la banque se comporte quand le nombre de compétences croît. L'écart entre résultats de laboratoire et exploitation industrielle reste donc entier. Ce travail s'inscrit dans un courant de recherche sur l'apprentissage continu pour les politiques robotiques et l'adaptation efficiente en paramètres, déjà exploré par des méthodes de type adaptateurs ou LoRA appliquées aux VLA. Il rejoint aussi l'intérêt croissant pour les mémoires externes et la récupération de compétences dans les modèles de fondation. Les acteurs industriels comme Physical Intelligence (Pi-0), NVIDIA (GR00T) ou Figure (Helix) travaillent sur des modèles généralistes, mais leurs méthodes d'adaptation propres ne sont pas détaillées publiquement dans ce cadre. La suite logique est la publication du code et des détails expérimentaux, puis une comparaison avec ces approches sur des benchmarks communs et sur robot réel. Tant que ces éléments manquent, Optimus-R relève d'une piste de recherche prometteuse et non d'une solution éprouvée.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
4arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source