Raisonnement structuré sur l'état du monde pour la recherche robotique à base d'agents
Des chercheurs proposent WORLDS (World-state Observation and Reasoning for Language-guided Discovery and Search), un cadre pour la recherche robotique guidée par le langage naturel sur de longs horizons, détaillé dans un preprint publié sur arXiv (arXiv:2609.23841). Le système construit un graphe persistant initialisé à partir de priors géospatiaux, mis à jour par la perception, dans lequel des "Reasoners" parallèles maintiennent plusieurs interprétations candidates concurrentes et déclenchent la collecte d'observations pour les départager, avant qu'un "Examiner" multimodal traite ces observations et qu'un "Judge" choisisse une cible ou redemande une passe supplémentaire. Sur le benchmark CityNav, WORLDS atteint 51,8% de succès de navigation sur l'ensemble des 5 311 épisodes de test, le meilleur taux publié à ce jour, soit 15,7 points de plus que la référence précédente, sous un protocole limité aux données OpenStreetMap et à l'imagerie orthographique haute résolution. Sur un sous-ensemble comparatif de 1 000 épisodes, à modèle, prior, chaîne de perception et budget de déplacement identiques, WORLDS obtient 50,0% contre 27,9% pour la meilleure base adaptée. La vérification par observations de l'Examiner apporte à elle seule 5,9 points, et même avec un effort de raisonnement réduit, WORLDS dépasse encore la référence GeoNav adaptée de 18,8 points tout en générant moins de tokens.
Pour les intégrateurs de robotique autonome et les équipes travaillant sur la navigation par instructions en langage naturel, ce résultat suggère que l'écart provient bien de l'architecture de raisonnement, avec maintien d'hypothèses concurrentes et vérification active par perception, plutôt que d'un simple gain de puissance de calcul, puisque la comparaison se fait à modèle et budget identiques. Le fait que la performance se maintienne, voire s'améliore relativement, à effort de raisonnement réduit et avec moins de tokens générés est un signal concret pour des applications embarquées où la latence et la puissance de calcul sont contraintes, comme les drones.
Le cadre a aussi été testé sur un quadrirotor, qui exécute les points de passage de détection générés par le système et identifie trois cibles langagières à partir de son imagerie embarquée, dont un véhicule absent de la carte initiale. Il s'agit toutefois d'un preprint de recherche non encore évalué par les pairs, sans nom d'entreprise ni date de déploiement commercial associée: la démonstration drone reste un test de validation en conditions contrôlées, pas un produit déployé sur le terrain.
Dans nos dossiers




