WayFinder : modèle vision-langage-action hiérarchique pour la génération de points de passage sans apprentissage préalable et le contrôle cinématique bas niveau
Des chercheurs proposent WayFinder, un cadre hiérarchique de type Vision-Langage-Action (VLA) destiné à la navigation autonome. Il évite le fine-tuning, coûteux et propre à chaque robot et à chaque tâche. L'architecture sépare deux niveaux. Un modèle de langage multimodal (MLLM) tourne hors du robot, en zero-shot. Il reçoit le contexte linguistique et des cartes d'état, puis génère des waypoints stratégiques. En parallèle et de façon asynchrone, une politique légère embarquée assure le contrôle cinématique en temps réel, à haute fréquence, à partir du retour continu des capteurs. Les tests ont eu lieu uniquement en simulation, dans Microsoft AirSim, sur quatre environnements de complexité variable et avec trois tailles de MLLM, pour arbitrer entre efficacité de prédiction et coût de calcul. Le MLLM n'est interrogé que lors des échecs de navigation. Les auteurs annoncent un taux de réussite supérieur aux politiques bas niveau de référence, avec un gain pouvant atteindre 27,45 %.
Ce travail s'attaque à un point de friction connu des VLA : la généralisation impressionnante des modèles se heurte, sur le terrain, à une exécution peu fiable et à des coûts d'adaptation par plateforme. Découpler le raisonnement lent, délégué à un grand modèle distant, du contrôle rapide embarqué est une approche pragmatique pour un intégrateur. Elle évite de réentraîner un modèle pour chaque morphologie et limite les appels d'inférence coûteux, puisque le MLLM n'intervient qu'en cas de blocage. Il faut toutefois relativiser. Le « jusqu'à 27,45 % » est un maximum, dépendant de la configuration retenue. Le papier ne donne ici aucun résultat sur matériel réel, et l'écart entre simulation et déploiement reste entier. La dépendance à un modèle hors bord pose aussi la question de la latence et de la connectivité en environnement industriel. Enfin, la comparaison porte sur des politiques bas niveau de référence, pas sur d'autres VLA hiérarchiques.
Le contexte est celui d'une littérature qui multiplie les architectures à deux niveaux, un module de raisonnement lent au-dessus d'un contrôleur rapide, illustrées côté humanoïdes par des systèmes comme Helix ou GR00T. WayFinder applique cette logique à la navigation, en s'appuyant sur AirSim, simulateur classique pour drones et véhicules. Il s'agit d'une prépublication arXiv (v1) et non d'un produit livré, sans partenaire industriel ni pilote annoncé. Les prochaines étapes utiles seraient une validation sur robot physique, une mesure de la latence de bout en bout et des comparaisons directes avec les autres approches hiérarchiques.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



