Aller au contenu principal
RecherchearXiv cs.RO 

Prise de décision conditionnée par les affordances : combler l'écart sémantico-spatial en navigation vision-langage inter-étages zéro-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent PACE (Preference-refined Affordance-Conditioned Execution), un module d'exécution locale supervisé qui vient se greffer sur des planificateurs sémantiques « zero-shot » figés pour la navigation guidée par le langage (VLN) entre étages. Le module convertit les indices sémantiques liés aux transitions (escalier, porte, passage étroit) en une pose d'affordance traversable, à long horizon et centrée sur l'agent. Il conditionne ensuite la génération d'actions à court horizon sur cette cible spatiale. Un post-entraînement par raffinement de préférences tenant compte des échecs s'appuie sur des paires issues de rollouts, qui opposent les comportements normaux ou de récupération aux comportements amplifiant la déviation. PACE a été intégré à six navigateurs VLN zero-shot open source. Sur les sous-ensembles multi-étages de R2R-CE et RxR-CE, le taux de succès moyen passe de 16,35 % à 27,65 % et de 4,76 % à 12,06 %. Des essais en conditions réelles, dans des environnements inédits, sont également rapportés.

L'enjeu tient à un écart que les démonstrations masquent souvent : un planificateur fondé sur un grand modèle peut choisir la bonne destination sans que le robot sache franchir l'obstacle. Atteindre le pied d'un escalier ou l'entrée d'une porte ne garantit pas la traversée, car il faut trouver une pose exécutable et corriger les erreurs d'action qui s'accumulent. Le gain relatif est net (environ +70 % sur R2R-CE, presque le triple sur RxR-CE), et il est obtenu sur six planificateurs différents sans les modifier. Cela plaide pour une couche d'exécution spatiale séparée du raisonnement sémantique. Il faut toutefois relativiser : les taux absolus restent bas, à 27,65 % et 12,06 %, très loin d'une fiabilité exploitable en site industriel, et les tests réels ne sont pas chiffrés dans le résumé. Les résultats portent sur des benchmarks simulés, pas sur un produit ni un déploiement.

Ce travail s'inscrit dans le courant des navigateurs VLN généralistes, où des modèles vision-langage ou des grands modèles de langage planifient sans entraînement spécifique à la tâche. Leur point faible reste l'exécution physique dans les zones contraintes, en particulier le changement d'étage, sous-représenté dans les évaluations classiques. PACE s'attaque à ce cas précis avec une approche modulaire, là où d'autres acteurs de l'IA embarquée privilégient des politiques VLA de bout en bout. Il s'agit d'une publication de recherche (arXiv, version 2), sans annonce de pilote ni calendrier commercial. La suite logique serait une validation quantifiée sur robots réels, avec des mesures de robustesse en conditions variées, avant toute intégration dans des piles de navigation industrielles.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Une enquête complète et une évaluation systématique en conditions réelles de la navigation incarnée par vision et langage
1arXiv cs.RO 

Une enquête complète et une évaluation systématique en conditions réelles de la navigation incarnée par vision et langage

Une nouvelle étude publiée sur arXiv (2607.09792v1) dresse un état des lieux complet de la navigation par vision et langage (VLN), cette capacité qui permet à un robot de comprendre une instruction en langage naturel et de s'orienter dans un environnement inconnu à partir de ses seules perceptions visuelles. Les auteurs classent les méthodes existantes selon deux axes indépendants : le paradigme d'action, qui distingue les architectures hiérarchiques des architectures monolithiques, et le paradigme de modèle, qui oppose les approches discriminatives aux approches génératives. Fait notable, l'étude ne se limite pas à une synthèse bibliographique : elle inclut une évaluation systématique en conditions réelles, menée sur une plateforme robotique physique dans dix scènes différentes. Les résultats chiffrés sont sans appel. Une méthode monolithique représentative, fonctionnant uniquement à partir d'images RGB, atteint 61% de réussite en simulation mais chute à seulement 22% lors des tests réels. À l'inverse, une architecture hiérarchique conserve un taux de succès de 51% en conditions réelles, un écart bien plus faible avec ses performances simulées. Pour l'industrie robotique, ce résultat vient confirmer un soupçon déjà répandu chez les intégrateurs : les scores impressionnants annoncés en simulation ne se transposent pas automatiquement sur le terrain, et l'écart simulation-réel reste un obstacle majeur, y compris pour des approches VLA jugées prometteuses sur le papier. La supériorité relative des architectures hiérarchiques suggère qu'une décomposition explicite des tâches, plutôt qu'un modèle unique bout-en-bout, apporte davantage de robustesse face aux aléas de perception et de contrôle du monde réel, un signal utile pour les décideurs B2B qui évaluent quelle famille d'architecture privilégier avant un déploiement. Ce travail s'inscrit dans un contexte de recherche en pleine expansion autour du VLN, porté par les progrès récents des modèles vision-langage-action, mais où les validations en environnement réel restaient jusqu'ici rares et dispersées. Les auteurs concluent en identifiant les verrous restants en matière de perception, de prise de décision et de contrôle, autant de pistes qu'ils appellent la communauté à approfondir dans les prochains travaux.

RecherchePaper
1 source
C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot
2arXiv cs.RO 

C²Nav : comparer avant de s'engager, pour la navigation vision-langage en zero-shot

Publié sur arXiv le 15 septembre 2026 (2609.15142), C2Nav est un framework de navigation vision-langage zero-shot pour environnements continus (VLN-CE), sans entraînement supplémentaire. Trois modules le composent : Seeing élit par comparaison ordinale une vue parmi des candidates validées physiquement ; Remembering maintient un croquis de route et compare les hypothèses d'étapes d'instruction voisines ; Arriving combine une échelle d'hésitation, une comparaison rétrospective et un retour en arrière révocable pour décider l'arrêt. Sur le protocole public OpenNav R2R-CE 100, C2Nav avec Qwen3-VL-8B-Instruct obtient 41,0% de taux de réussite oracle (OSR), 31,0% de taux de réussite (SR) et 16,7% de SPL, le taux pondéré par la longueur du trajet ; avec GPT-5.5, ces scores montent à 54,0%, 44,0% et 29,0%. Sans Seeing, Remembering ou Arriving, le SR tombe respectivement à 14,0%, 25,0% et 29,0% ; remplacer les réponses comparatives par des questions cardinales le réduit à entre 12,0% et 28,0% selon l'étape du trajet. L'apport tient à l'interface entre modèle et robot plutôt qu'au modèle seul. La plupart des systèmes VLN-CE font produire au VLM des sorties cardinales, points de passage, pixels, caps, décisions d'arrivée absolues, couplant une réponse générative incertaine à une magnitude géométrique ou à un engagement irréversible. C2Nav inverse cette logique : le VLM compare des alternatives déjà construites par le contrôleur, tandis que géométrie, seuils et exécution restent du côté physique du robot. Les résultats montrent qu'une interface décisionnelle contrainte et un raisonnement de VLM plus puissant sont complémentaires et non substituables, ce qui suggère aux intégrateurs un gain de fiabilité accessible sans fine-tuning, par simple reformulation des questions posées au modèle. Le travail s'inscrit dans la navigation vision-langage en environnement continu, où l'essor des VLM généralistes pousse les chercheurs à les insérer directement dans la boucle de commande, souvent en zero-shot pour éviter un entraînement dédié à chaque environnement. C2Nav se positionne face aux architectures existantes exigeant des sorties géométriques directes, en s'appuyant sur deux VLM distincts, Qwen3-VL-8B-Instruct en version compacte et GPT-5.5 en référence plus puissante, évalués sur le protocole public OpenNav R2R-CE 100. Il s'agit à ce stade d'un article de recherche déposé sur arXiv, sans intégration dans un robot commercial ni déploiement réel, et sans suite annoncée par les auteurs.

RecherchePaper
1 source
CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage
3arXiv cs.RO 

CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage

La navigation par instructions en langage naturel (Vision-Language Navigation, VLN) a surtout progressé ces dernières années sur le raisonnement de haut niveau : compréhension des consignes, mémoire, cartographie globale, découpage des instructions en sous-tâches. La représentation d'action de bas niveau, elle, restait largement négligée. Une équipe de recherche propose CoFL-S (papier arXiv 2607.02222, publié début juillet 2026), un framework vision-langage-action qui prédit un champ de flux ("flow field") conditionné par le langage sur le secteur local visible du robot, puis génère des trajectoires continues en suivant ce champ. Pour l'entraîner, les chercheurs ont converti les épisodes du jeu de données VLN-CE, initialement des instructions complètes associées à des séquences d'actions, en supervision locale image par image, avec sous-instructions alignées, actions, trajectoires et champs de flux appariés. Ils introduisent aussi un nouveau benchmark Habitat en temps continu, qui isole l'interface d'action de bas niveau du découpage des instructions et fait passer toutes les méthodes par un contrôleur de commande de vitesse partagé, permettant une comparaison en boucle fermée indépendante de la fréquence du planificateur, plutôt que les transitions discrètes fixes (avancer/tourner) de VLN-CE classique. Cette distinction entre haut niveau et bas niveau touche un vrai angle mort du secteur : une bonne compréhension d'instruction ne garantit pas une exécution fluide si la couche de contrôle reste rigide ou dépendante d'une fréquence de planification fixe. En isolant cette couche et en la testant à différentes fréquences, l'équipe évalue si une politique d'action tient réellement la route en conditions variables, un enjeu direct pour tout déploiement réel de robots mobiles guidés par le langage, où la latence de calcul et la fréquence de décision varient selon le matériel. Sous encodeurs et réglages d'entraînement identiques, CoFL-S dépasse de façon constante les méthodes de référence à base de tokens d'action et de blocs d'action ("action-chunk"), quelle que soit la fréquence du planificateur testée. Les auteurs rapportent également un déploiement réel en zero-shot, en boucle fermée, où l'avantage de leur approche se confirme au-delà de la simulation, un point notable puisque le transfert sim-to-real reste l'un des obstacles les plus fréquemment cités dans la littérature VLN.

RecherchePaper
1 source
GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus
4arXiv cs.RO 

GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus

Des chercheurs ont évalué GPT-6-Astra comme agent de navigation dans un système zero-shot de Vision-and-Language Navigation en environnements continus (VLN-CE), où le modèle interprète des instructions en langage naturel, observe son environnement et propose des actions de déplacement. Le système s'appuie sur un cycle observation-décision-exécution avec des appels directs à l'API du modèle, sans harnais d'agent package ni fine-tuning spécifique à la navigation : chaque requête reçoit un sous-ensemble d'observations visuelles, un retour d'exécution des actions précédentes et un historique de progression conservé. L'étude, publiée sur arXiv (2609.20116), porte sur 50 des 100 épisodes val-unseen du benchmark R2R-CE utilisés par le système de référence Open-Nav. Résultats obtenus : taux de réussite de 52,0 %, SPL (Success weighted by Path Length) de 48,9 % et nDTW (normalized Dynamic Time Warping) de 70,8 %. À l'arrêt, 36,0 % des épisodes réussissent via un signal STOP validé par le workflow, et 16,0 % supplémentaires atteignent seulement le critère de distance, à la limite du nombre de pas autorisés. Cette évaluation illustre à la fois le potentiel et les limites d'un grand modèle multimodal utilisé tel quel comme agent de navigation, sans entraînement dédié à la tâche. L'analyse des réponses montre que le modèle relie correctement repères visuels et actions passées aux instructions fournies, et qu'il sait demander des vues supplémentaires ou revenir sur un jugement incertain, un comportement de raisonnement explicite rarement documenté avec ce niveau de détail. Mais l'écart mis en évidence entre compréhension locale et achèvement autonome de la tâche, par exemple un franchissement reconnu comme inachevé alors que le modèle continue de pivoter sur lui-même, pointe une faiblesse structurelle : savoir qu'une action est correcte ne suffit pas à produire un comportement cohérent jusqu'à l'arrêt. Pour les intégrateurs qui envisagent des LLM généralistes pour piloter des robots mobiles ou des AMR, ce résultat tempère l'idée que les modèles zero-shot actuels suffisent en production, d'autant que l'échantillon reste limité à 50 épisodes. Le protocole reprend le sous-ensemble d'épisodes de validation R2R-CE (Room-to-Room en environnements continus) déjà utilisé par Open-Nav, système de navigation antérieur servant de point de comparaison implicite. L'approche se distingue des architectures VLA spécialisées, entraînées de bout en bout sur des données de navigation, en testant directement les capacités générales d'un modèle multimodal via son API, sans fine-tuning ni harnais logiciel dédié. Les auteurs présentent ce travail comme une analyse comportementale plutôt qu'une revendication de performance record, en documentant précisément où le raisonnement du modèle réussit et où il échoue à se traduire en actions physiques cohérentes jusqu'à l'arrêt. Aucun déploiement réel ni produit commercial n'est annoncé : il s'agit d'une évaluation de recherche en preprint, dont les résultats invitent à des travaux futurs sur le contrôle de la terminaison des épisodes et sur l'articulation entre jugement local et planification de trajectoire à plus long terme.

RechercheActu
1 source