Aller au contenu principal
RecherchearXiv cs.RO 

WayFinder : modèle vision-langage-action hiérarchique pour la génération de points de passage sans apprentissage préalable et le contrôle cinématique bas niveau

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent WayFinder, un cadre hiérarchique de type Vision-Langage-Action (VLA) destiné à la navigation autonome. Il évite le fine-tuning, coûteux et propre à chaque robot et à chaque tâche. L'architecture sépare deux niveaux. Un modèle de langage multimodal (MLLM) tourne hors du robot, en zero-shot. Il reçoit le contexte linguistique et des cartes d'état, puis génère des waypoints stratégiques. En parallèle et de façon asynchrone, une politique légère embarquée assure le contrôle cinématique en temps réel, à haute fréquence, à partir du retour continu des capteurs. Les tests ont eu lieu uniquement en simulation, dans Microsoft AirSim, sur quatre environnements de complexité variable et avec trois tailles de MLLM, pour arbitrer entre efficacité de prédiction et coût de calcul. Le MLLM n'est interrogé que lors des échecs de navigation. Les auteurs annoncent un taux de réussite supérieur aux politiques bas niveau de référence, avec un gain pouvant atteindre 27,45 %.

Ce travail s'attaque à un point de friction connu des VLA : la généralisation impressionnante des modèles se heurte, sur le terrain, à une exécution peu fiable et à des coûts d'adaptation par plateforme. Découpler le raisonnement lent, délégué à un grand modèle distant, du contrôle rapide embarqué est une approche pragmatique pour un intégrateur. Elle évite de réentraîner un modèle pour chaque morphologie et limite les appels d'inférence coûteux, puisque le MLLM n'intervient qu'en cas de blocage. Il faut toutefois relativiser. Le « jusqu'à 27,45 % » est un maximum, dépendant de la configuration retenue. Le papier ne donne ici aucun résultat sur matériel réel, et l'écart entre simulation et déploiement reste entier. La dépendance à un modèle hors bord pose aussi la question de la latence et de la connectivité en environnement industriel. Enfin, la comparaison porte sur des politiques bas niveau de référence, pas sur d'autres VLA hiérarchiques.

Le contexte est celui d'une littérature qui multiplie les architectures à deux niveaux, un module de raisonnement lent au-dessus d'un contrôleur rapide, illustrées côté humanoïdes par des systèmes comme Helix ou GR00T. WayFinder applique cette logique à la navigation, en s'appuyant sur AirSim, simulateur classique pour drones et véhicules. Il s'agit d'une prépublication arXiv (v1) et non d'un produit livré, sans partenaire industriel ni pilote annoncé. Les prochaines étapes utiles seraient une validation sur robot physique, une mesure de la latence de bout en bout et des comparaisons directes avec les autres approches hiérarchiques.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

HAM-VLN : une mémoire agentique hiérarchique pour la navigation vision-langage sans apprentissage préalable
1arXiv cs.RO 

HAM-VLN : une mémoire agentique hiérarchique pour la navigation vision-langage sans apprentissage préalable

Une équipe de recherche présente HAM-VLN, un système de navigation robotique par instructions en langage naturel (Vision-and-Language Navigation) fonctionnant sans aucun entraînement spécifique, exploitant un modèle multimodal de type LLM pour interpréter les observations visuelles et décider de l'action suivante. Le système introduit une mémoire agentique hiérarchique : à chaque appel du modèle servant à choisir le prochain déplacement, HAM-VLN enregistre aussi des informations sémantiques et réflexives, type de pièce, objets détectés, progression de la navigation, notes d'échec, dans un graphe du monde persistant et ancré en profondeur (depth-grounded). Les points de passage récents restent conservés textuellement dans une fenêtre bornée, tandis que l'historique plus ancien n'est réintégré au contexte que via une recherche pondérée par pertinence, récence et importance, complétée par une expansion topologique à un saut. Sur les benchmarks standards, HAM-VLN atteint 61,0% de taux de réussite sur VLN-CE R2R, 52,7% sur VLN-CE RxR et 79,7% sur HM3D-v2 ObjectNav, avec une réduction de plus de 65% de la longueur de contexte par rapport aux approches précédentes, sans appel LLM supplémentaire au-delà de la décision par point de passage. L'enjeu principal est le goulot d'étranglement mémoire qui limite aujourd'hui la navigation robotique à long horizon pilotée par LLM : empiler des flux d'images ou des cartes denses dans le contexte d'un modèle devient vite ingérable en coût de calcul et en cohérence de raisonnement. En couplant la génération de mémoire à la décision d'action elle-même, sans multiplier les appels au modèle, HAM-VLN répond à une critique récurrente des approches "training-free" en robotique : leur dépendance à des contextes toujours plus longs et coûteux. Une réduction de 65% de ce contexte, à performances égales ou supérieures, est un signal concret pour les équipes qui cherchent à déployer des agents de navigation en environnement inconnu sans phase de fine-tuning coûteuse. Ce travail s'inscrit dans la lignée des méthodes récentes de VLN "zero-shot" apparues avec la généralisation des LLM multimodaux, qui remplacent les pipelines de navigation entraînés end-to-end par du raisonnement en langage naturel au moment de l'inférence. Les benchmarks utilisés, VLN-CE (R2R et RxR) et HM3D-v2 ObjectNav, sont des références académiques standard du domaine, ce qui permet une comparaison directe avec les approches concurrentes basées sur mémoire d'images ou cartographie dense. L'article, publié sur arXiv, ne mentionne pas d'implémentation matérielle sur robot réel ni de calendrier de déploiement industriel.

RecherchePaper
1 source
2arXiv cs.RO 

MotorMind : structurer des modèles vision-langage généralistes pour la manipulation robotique sans apprentissage préalable

Des chercheurs présentent MotorMind, un « harness » de manipulation robotique (arXiv 2609.38078, première version) qui permet à un modèle vision-langage (VLM) généraliste de piloter directement un bras, sans entraînement spécifique à la tâche. Le système ne recourt ni à un expert d'actions appris, ni à un agent de codage, ni à un outil de grounding comme SAM3. Le VLM propose des actions de niveau intermédiaire, exécutées par un contrôle robotique déterministe qui renvoie un retour d'exécution. Un suivi asynchrone et des mises à jour de mémoire en arrière-plan complètent l'ensemble. Sur la suite LIBERO-PRO de base, MotorMind atteint 66,7 % de réussite, et 53,8 % sous perturbations. Les méthodes zéro-shot antérieures évaluées plafonnent à 13,3 % et 19,2 %. Sur un robot xArm6 réel, la même interface affiche 95 % de réussite moyenne, en manipulation directe comme en présence de perturbations humaines. Les auteurs n'indiquent ici ni le VLM utilisé, ni le nombre de tâches, ni le nombre d'essais réels. Il s'agit d'un résultat de laboratoire, sans déploiement industriel. L'intérêt tient à la voie proposée. Les modèles VLA (vision-langage-action) généralisent encore mal, hors distribution, à de nouvelles tâches et de nouveaux environnements. Leur entraînement spécialisé les coupe aussi des progrès rapides des VLM généralistes. MotorMind suggère qu'une bonne représentation d'actions intermédiaires, associée à une exécution asynchrone, permet d'exploiter ces VLM tels quels, comme un téléopérateur humain qui regarde, agit et corrige. Les auteurs constatent que remplacer le VLM par un modèle plus puissant améliore les scores. Les échecs restants viennent surtout du grounding visuel, du raisonnement incarné et de la connaissance des actions, et ils diminuent avec la capacité du modèle. Pour les intégrateurs, cela laisse entrevoir des robots qui bénéficient mécaniquement des mises à jour des modèles de fondation, sans réentraînement. La prudence reste de mise : LIBERO-PRO est un benchmark en simulation, l'écart avec les baselines est calculé sur des méthodes zéro-shot choisies par les auteurs, et rien n'est dit sur le temps de cycle, la latence ni le coût d'inférence, décisifs en production. Ce travail s'inscrit dans deux courants. Les VLA généralistes de type Pi-0 ou GR00T comptent sur de vastes données robotiques. Les systèmes « agentiques » utilisent des VLM pour le raisonnement de haut niveau, ou des agents de codage pour générer le contrôle, au prix d'une chaîne d'outils lourde et coûteuse. MotorMind cherche un compromis plus simple, avec un seul modèle. La suite dépendra de sa reproductibilité sur d'autres bras, de sa robustesse sur des tâches longues et de sa comparaison avec des VLA entraînés. Aucun pilote ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
3arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)
4arXiv cs.RO 

Modèle du monde critique pour l'apprentissage par renforcement vision-langage-action (WCM)

Des chercheurs ont publié fin juillet 2026 un article arXiv (2607.29613) présentant le World Critic Model (WCM), une nouvelle architecture pour l'apprentissage par renforcement (RL) appliqué aux modèles Vision-Language-Action (VLA) utilisés en manipulation robotique. Le problème ciblé est celui des méthodes RL à base de critique, qui évaluent la valeur d'une action à partir d'une seule image ou d'un seul instant du flux visuel, un choix mal adapté au contrôle robotique où l'observation est par nature partielle et séquentielle. Bâti sur une architecture légère dérivée de LeJEPA, WCM prédit conjointement l'état latent futur de la scène et estime la valeur de l'action, ce qui force le critique à apprendre la dynamique temporelle plutôt qu'à simplement régresser un score. Le système s'intègre aux pipelines on-policy et off-policy et fonctionne avec les backbones VLA de référence Pi0, Pi0.5 et OpenVLA-OFT. Les auteurs rapportent des résultats état de l'art sur 149 tâches réparties sur quatre benchmarks, avec des gains marqués en généralisation hors distribution, ainsi qu'une validation sur sept tâches de manipulation réelles combinant OpenVLA-OFT et Pi0.5 en RL off-policy. L'enjeu dépasse la seule performance chiffrée: le RL post-entraînement des modèles VLA est aujourd'hui l'un des leviers les plus regardés pour fiabiliser les politiques robotiques au-delà de l'imitation pure, mais les critiques scalaires classiques peinent justement là où le contrôle réel exige de la mémoire et de l'anticipation. Si les gains de généralisation se confirment en dehors du cadre des benchmarks académiques, WCM pourrait devenir un composant standard pour les équipes qui affinent des VLA en production plutôt qu'une simple curiosité de laboratoire, en particulier pour les intégrateurs qui cherchent à réduire l'écart entre démonstration en simulation et déploiement réel. L'article s'inscrit dans la lignée des travaux récents sur l'apprentissage par prédiction de représentations latentes (JEPA, popularisé par Meta AI) appliqués à la robotique, et complète les approches critic-based existantes du RL pour VLA. Les auteurs ne précisent pas de plan de mise en open source ni de calendrier d'intégration dans des stacks robotiques commerciales; l'étape suivante logique serait une validation à plus grande échelle sur des plateformes industrielles.

RechercheActu
1 source