Aller au contenu principal
CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage
RecherchearXiv cs.RO 

CoFL-S : champs de flux sectoriels interrogeables spatialement pour la navigation locale conditionnée par le langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La navigation par instructions en langage naturel (Vision-Language Navigation, VLN) a surtout progressé ces dernières années sur le raisonnement de haut niveau : compréhension des consignes, mémoire, cartographie globale, découpage des instructions en sous-tâches. La représentation d'action de bas niveau, elle, restait largement négligée. Une équipe de recherche propose CoFL-S (papier arXiv 2607.02222, publié début juillet 2026), un framework vision-langage-action qui prédit un champ de flux ("flow field") conditionné par le langage sur le secteur local visible du robot, puis génère des trajectoires continues en suivant ce champ. Pour l'entraîner, les chercheurs ont converti les épisodes du jeu de données VLN-CE, initialement des instructions complètes associées à des séquences d'actions, en supervision locale image par image, avec sous-instructions alignées, actions, trajectoires et champs de flux appariés. Ils introduisent aussi un nouveau benchmark Habitat en temps continu, qui isole l'interface d'action de bas niveau du découpage des instructions et fait passer toutes les méthodes par un contrôleur de commande de vitesse partagé, permettant une comparaison en boucle fermée indépendante de la fréquence du planificateur, plutôt que les transitions discrètes fixes (avancer/tourner) de VLN-CE classique.

Cette distinction entre haut niveau et bas niveau touche un vrai angle mort du secteur : une bonne compréhension d'instruction ne garantit pas une exécution fluide si la couche de contrôle reste rigide ou dépendante d'une fréquence de planification fixe. En isolant cette couche et en la testant à différentes fréquences, l'équipe évalue si une politique d'action tient réellement la route en conditions variables, un enjeu direct pour tout déploiement réel de robots mobiles guidés par le langage, où la latence de calcul et la fréquence de décision varient selon le matériel.

Sous encodeurs et réglages d'entraînement identiques, CoFL-S dépasse de façon constante les méthodes de référence à base de tokens d'action et de blocs d'action ("action-chunk"), quelle que soit la fréquence du planificateur testée. Les auteurs rapportent également un déploiement réel en zero-shot, en boucle fermée, où l'avantage de leur approche se confirme au-delà de la simulation, un point notable puisque le transfert sim-to-real reste l'un des obstacles les plus fréquemment cités dans la littérature VLN.

À lire aussi

Modélisation du monde conditionnée par le langage pour la navigation visuelle
1arXiv cs.RO 

Modélisation du monde conditionnée par le langage pour la navigation visuelle

Une équipe de chercheurs publie sur arXiv (2603.26741, version 2) un travail sur la navigation visuelle conditionnée par le langage, baptisée LCVN. Dans cette tâche, un agent incarné doit suivre une instruction en langage naturel en ne disposant que d'une observation égocentrique initiale, sans image du but. La perception et le contrôle continu doivent donc être guidés uniquement par le texte. Les auteurs introduisent le jeu de données LCVN, qui regroupe 39 016 trajectoires et 117 048 instructions vérifiées par des humains, couvrant des environnements et des styles de consigne variés. Ils comparent deux approches. La première, l'imagination latente, associe un modèle du monde à base de diffusion (LCVN-WM), qui imagine les observations futures, à un agent acteur-critique (LCVN-AC) dont la politique est apprise entièrement dans cet espace latent imaginé. La seconde, la prédiction autorégressive unifiée (LCVN-Uni), utilise un seul backbone multimodal qui prédit actions et observations en une passe sur une séquence de tokens partagée. Les résultats montrent que les deux approches sont complémentaires. L'imagination latente produit des déroulés plus cohérents dans le temps, tandis que la prédiction unifiée généralise mieux à des environnements jamais vus. Pour un ingénieur robotique ou un intégrateur, l'enseignement porte sur l'arbitrage d'architecture entre un modèle du monde explicite, utile pour la planification, et un modèle unique de type VLA (vision-langage-action), plus robuste hors distribution. Des ablations isolent l'effet du guidage linguistique, des signaux de conditionnement et du style d'instruction. Elles permettent de savoir si le goulot d'étranglement vient de l'ancrage du langage ou de la modélisation de la dynamique. Cette distinction est précieuse pour orienter les investissements, entre meilleures données langagières et meilleurs modèles dynamiques. Il faut cependant rester prudent : il s'agit d'un travail académique évalué sur un benchmark, sans déploiement sur robot physique annoncé. Il ne dit rien du transfert sim-to-real ni des temps de latence en conditions industrielles. Ce travail s'inscrit dans la longue tradition de la navigation visuelle conditionnée par un but image, qui sert de banc d'essai à l'IA incarnée depuis des années. Il rejoint la tendance actuelle qui combine modèles du monde génératifs et politiques linguistiques, portée par des modèles du monde comme ceux de la famille Genie ou Cosmos et par les VLA généralistes (Pi-0, GR00T, Helix), qui visent surtout la manipulation. La navigation par instruction reste moins couverte par ces modèles. Le jeu de données, relativement volumineux pour la tâche, peut servir de référence commune. Aucune suite commerciale ni calendrier de pilote n'est annoncé. La prochaine étape logique serait de tester ces approches hybrides sur du matériel réel, ou d'unifier imagination latente et prédiction autorégressive dans une même architecture.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Prise de décision conditionnée par les affordances : combler l'écart sémantico-spatial en navigation vision-langage inter-étages zéro-shot
2arXiv cs.RO 

Prise de décision conditionnée par les affordances : combler l'écart sémantico-spatial en navigation vision-langage inter-étages zéro-shot

Des chercheurs proposent PACE (Preference-refined Affordance-Conditioned Execution), un module d'exécution locale supervisé qui vient se greffer sur des planificateurs sémantiques « zero-shot » figés pour la navigation guidée par le langage (VLN) entre étages. Le module convertit les indices sémantiques liés aux transitions (escalier, porte, passage étroit) en une pose d'affordance traversable, à long horizon et centrée sur l'agent. Il conditionne ensuite la génération d'actions à court horizon sur cette cible spatiale. Un post-entraînement par raffinement de préférences tenant compte des échecs s'appuie sur des paires issues de rollouts, qui opposent les comportements normaux ou de récupération aux comportements amplifiant la déviation. PACE a été intégré à six navigateurs VLN zero-shot open source. Sur les sous-ensembles multi-étages de R2R-CE et RxR-CE, le taux de succès moyen passe de 16,35 % à 27,65 % et de 4,76 % à 12,06 %. Des essais en conditions réelles, dans des environnements inédits, sont également rapportés. L'enjeu tient à un écart que les démonstrations masquent souvent : un planificateur fondé sur un grand modèle peut choisir la bonne destination sans que le robot sache franchir l'obstacle. Atteindre le pied d'un escalier ou l'entrée d'une porte ne garantit pas la traversée, car il faut trouver une pose exécutable et corriger les erreurs d'action qui s'accumulent. Le gain relatif est net (environ +70 % sur R2R-CE, presque le triple sur RxR-CE), et il est obtenu sur six planificateurs différents sans les modifier. Cela plaide pour une couche d'exécution spatiale séparée du raisonnement sémantique. Il faut toutefois relativiser : les taux absolus restent bas, à 27,65 % et 12,06 %, très loin d'une fiabilité exploitable en site industriel, et les tests réels ne sont pas chiffrés dans le résumé. Les résultats portent sur des benchmarks simulés, pas sur un produit ni un déploiement. Ce travail s'inscrit dans le courant des navigateurs VLN généralistes, où des modèles vision-langage ou des grands modèles de langage planifient sans entraînement spécifique à la tâche. Leur point faible reste l'exécution physique dans les zones contraintes, en particulier le changement d'étage, sous-représenté dans les évaluations classiques. PACE s'attaque à ce cas précis avec une approche modulaire, là où d'autres acteurs de l'IA embarquée privilégient des politiques VLA de bout en bout. Il s'agit d'une publication de recherche (arXiv, version 2), sans annonce de pilote ni calendrier commercial. La suite logique serait une validation quantifiée sur robots réels, avec des mesures de robustesse en conditions variées, avant toute intégration dans des piles de navigation industrielles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
3arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source
WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée
4arXiv cs.RO 

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée

Un article publié sur arXiv (référence 2608.07267, catégorie "cross-listing" signalant un croisement entre disciplines) présente WNM-3D, un modèle de navigation "world-action" conçu pour la navigation vision-langage en boucle fermée, c'est-à-dire des robots qui suivent des instructions en langage naturel à partir de flux vidéo égocentriques. Le système combine un encodeur de géométrie gelé, qui extrait des représentations 3D à partir de l'historique RGB monoculaire de l'agent, avec un adaptateur entraînable appelé 3D Scene-to-Token, qui convertit ces représentations en un préfixe de longueur fixe injecté dans un Transformer de diffusion. Grâce à un mécanisme d'attention "block-causal", ce contexte géométrique conditionne à la fois la génération des futures vues visuelles et celle des actions de navigation. L'entraînement se déroule en trois étapes : un ajustement supervisé sur des démonstrations générées par l'algorithme A*, une adaptation de type DAgger sur les états visités par la politique elle-même, puis une optimisation en boucle fermée via une méthode appelée DanceGRPO. Sur le benchmark GN-Bench, WNM-3D surpasse des politiques de navigation basées sur des modèles vision-langage classiques ainsi que sa propre variante conditionnée en 2D, avec une meilleure cohérence entre flux visuel et action et une erreur de mouvement visuel réduite sur un jeu d'évaluation proche de l'objectif. L'intérêt de ces travaux réside dans le diagnostic qu'ils posent sur les approches VLA (vision-language-action) actuelles, qui associent directement observations et instructions à des actions sans modéliser explicitement comment la scène visuelle doit évoluer sous l'effet du mouvement prédit. En ancrant la prédiction conjointe d'images futures et d'actions dans une représentation 3D persistante plutôt que dans un simple contexte 2D, WNM-3D vise à réduire la dérive en boucle fermée, un problème classique où les erreurs de navigation s'accumulent au fil des pas de temps. Pour les intégrateurs de robots mobiles autonomes, ce résultat suggère qu'un conditionnement géométrique explicite améliore la robustesse par rapport à des politiques purement basées sur des modèles vision-langage préentraînés, sans toutefois constituer une preuve de déploiement réel : les résultats restent circonscrits à un benchmark, sans essai terrain ni robot physique mentionné. Ce travail s'inscrit dans la lignée des modèles génératifs "world-action" (WAM), une famille d'approches qui prédisent conjointement observations futures et actions mais qui, jusqu'ici, ne conditionnaient pas cette génération sur une représentation géométrique de l'historique observé pour la navigation continue. WNM-3D se positionne explicitement contre les politiques VLA de référence et contre une variante 2D du même modèle, utilisée comme ablation pour isoler l'apport du conditionnement 3D. Aucun partenariat industriel, aucun calendrier de déploiement ni acteur commercial n'est mentionné dans l'abstract, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit prêt à l'intégration.

RechercheActu
1 source