
WareFly-VLA : un cadre vision-langage-action pour la navigation de drones et le suivi de personnes en entrepôt intelligent
Des chercheurs publient WareFly-VLA, un cadre et un jeu de données destinés à la navigation de drones pilotée par le langage dans les entrepôts intelligents (arXiv 2610.08526). Le corpus rassemble 507 épisodes de vol téléopérés par des humains et 8 504 transitions RGB haute résolution, collectés dans NVIDIA Isaac Sim. Chaque transition est associée à une description écrite par un humain de l'apparence du travailleur ciblé et à une commande de contrôle synchronisée à 4 degrés de liberté. Deux tâches sont couvertes, l'approche d'une cible et le suivi d'une personne, avec occlusions, recherche longue portée, variations d'altitude et encombrement. Quatre architectures VLA open source (SmolVLA, GR00T N1.7, pi_0 et OpenVLA) sont comparées sur un protocole sans fuite de données au niveau de l'épisode, à deux fréquences de contrôle. Le jeu de données, les modèles de référence et le protocole d'évaluation sont publiés.
Les résultats tempèrent l'enthousiasme autour des modèles vision-langage-action. Les performances chutent nettement dès que la généralisation est évaluée strictement, c'est-à-dire sur des épisodes réellement inédits. La modélisation continue des actions bat systématiquement la tokenisation discrète, ce qui va contre le choix d'OpenVLA et conforte l'approche de pi_0. Sur une seule image, seul le canal avant (avancer) est appris de façon fiable, alors que latéral, altitude et rotation restent hors de portée. Enfin, les interfaces des modèles de fondation actuels, conçues pour la manipulation, la navigation au sol et les humanoïdes, se transfèrent mal aux plateformes aériennes. Pour un intégrateur qui envisage des drones d'inventaire ou d'assistance en entrepôt, le message est clair: le contrôle aérien guidé par le langage n'est pas résolu, et un VLA généraliste ne peut pas encore être déployé tel quel.
Ce travail comble un vide. Les VLA ont brillé en manipulation et en navigation de robots mobiles au sol, mais aucun benchmark ne combinait actions de vol continues bas niveau, descriptions fines de cibles en langage naturel et environnements industriels réalistes. Il faut toutefois rester prudent: le jeu de données est modeste (507 épisodes), entièrement simulé, et les résultats viennent de baselines affinées sur une seule image, sans validation sur drone réel. Les annotations de pose et de difficulté, synchronisées avec la vidéo, le langage et les actions, visent aussi la recherche sur les modèles du monde. Aucun acteur français ou européen n'est cité dans l'étude. La suite logique passera par des modèles à mémoire temporelle ou multi-images, puis par des tests sim-to-real. Les équipes derrière SmolVLA, GR00T et pi_0 pourraient s'appuyer sur ce banc d'essai pour adapter leurs architectures à l'aérien.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




