Navigation vision-langage multi-agents systématique : formulation, benchmark et méthode
Une équipe de chercheurs publie sur arXiv (référence 2609.35965) un cadre formel pour la navigation multi-agents guidée par la vision et le langage (VLN, Vision-and-Language Navigation), jusqu'ici centrée sur un seul robot suivant une seule consigne. Les auteurs proposent ce qu'ils présentent comme la première formalisation systématique du problème sous forme de coordination sous contraintes : chaque mission se décompose en sous-tâches liées par des dépendances et des contraintes de ressources, notamment des verrous de présence et des chaînes de détention d'objets. Ils livrent le benchmark MAVLN, produit par un pipeline de création en quatre étapes vérifiées : 11 724 épisodes répartis sur 145 scènes, avec des équipes allant jusqu'à quatre agents et trois régimes de consigne, ainsi que des métriques adaptées à ces contraintes. Ils présentent aussi TRISS, un système de référence qui associe un ordonnanceur de sous-tâches fondé sur un LLM, une mémoire topologique partagée transformant l'exploration de chaque agent en connaissance d'équipe, et un mécanisme d'exécution qui résout les conflits pour produire des trajets sans collision. Une page projet est publiée. Il s'agit d'un travail de recherche en simulation : aucun robot physique, déploiement ni produit n'est annoncé.
L'enjeu tient à l'écart entre les démonstrations actuelles et les besoins des sites logistiques ou industriels, où plusieurs machines doivent se partager des ressources et respecter un ordre d'exécution. La plupart des travaux sur les modèles vision-langage-action (VLA) et sur la navigation évaluent un agent isolé. Le benchmark rend mesurable la coordination elle-même : qui fait quoi, dans quel ordre, avec quel objet, sans blocage mutuel. Le résultat le plus instructif est négatif. Les auteurs affirment que TRISS établit une base de comparaison complète mais laisse une marge de progression importante à chaque étage, ordonnancement, planification et exécution. Autrement dit, même avec un LLM qui planifie, la coordination sous contraintes reste loin d'être résolue. Les scores chiffrés ne figurent pas dans le résumé, et les 145 scènes simulées ne disent rien de la robustesse en environnement réel. Pour un intégrateur, cela relativise les promesses d'orchestration de flottes hétérogènes pilotées par langage naturel.
Ce travail s'inscrit dans la montée des benchmarks VLN, puis des approches où un LLM sert de planificateur de haut niveau, jusqu'ici surtout mono-agent. Il complète des systèmes de flottes déjà commercialisés, comme les AMR d'Exotec en France, dont l'orchestration repose sur des optimiseurs classiques plutôt que sur des consignes en langage libre. Côté humanoïdes, des acteurs comme Figure avec Helix ou Tesla avec Optimus visent aussi le travail en équipe, sans métrique publique équivalente. Les suites probables sont l'adoption de MAVLN comme banc d'essai par d'autres laboratoires, des évaluations sur robots réels et l'intégration de modèles VLA capables d'agir, pas seulement de se déplacer.
Dans nos dossiers




