Aller au contenu principal
RecherchearXiv cs.RO 

NaviRrator : la navigation du robot à partir de cartes lisibles par l'humain, guidée par un itinéraire visuel appris

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent NaViRRator, un système qui traduit un point de départ et une destination désignés sur une carte lisible par un humain en instructions de navigation pour une politique de navigation vision-langage (VLN) déjà entraînée. Decrit dans un preprint mis en ligne sur arXiv le 21 septembre 2026 (2609.21316), il repose sur RouteScribe, une méthode qui sépare l'inférence de trajectoire de sa formulation en langage. RouteScribe génère d'abord un squelette de route dans les coordonnées de l'image de carte, via une technique nommée SGL-CFM qui déformé une ligne droite entre départ et arrivée pour épouser la géométrie du lieu, puis un modèle vision-langage pré-entraine convertit ce squelette en instruction textuelle. En tests réels, le système obtient des taux de réussite et des scores SPL (success weighted by path length) supérieurs a trois méthodes de référence : génération directe carte-vers-instruction, squelette calcule par l'algorithme A*, et flow matching a source gaussienne.

L'enjeu concret touche un goulot d'étranglement bien connu du déploiement de robots mobiles autonomes en entrepôt ou en bâtiment industriel : relier la géométrie schématique d'un plan aux observations a hauteur de robot. En gardant la carte et le squelette de route en amont, hors du module exécuteur, l'architecture permet de changer de politique VLN sans reentrainer les modules qui relient carte et langage, un atout pour des intégrateurs qui assemblent des briques logicielles distinctes. Les résultats vont a l'encontre de l'idée qu'une génération directe d'instructions depuis la carte suffirait : l'ancrage explicite de la route améliore la clarté des virages saillants et la fidélité de la séquence de manoeuvres voulue.

NaViRRator reste, a ce stade, une contribution de recherche publiée en preprint, sans acteur industriel, produit commercial, site de déploiement ni pilote annonces dans l'article : il s'agit d'une démonstration en environnement réel contrôle, non d'une mise en production. Le travail s'inscrit dans la lignée des politiques de navigation vision-langage pré-entraînées, traitées ici comme des exécuteurs interchangeables places en aval d'un pipeline carte-vers-instruction, une logique modulaire proche des approches vision-langage-action qui structurent aujourd'hui la robotique mobile et manipulatrice, mais appliquée spécifiquement a la navigation. Aucune date de suite, de financement ou de transfert vers un produit n'est précisée, ce qui situe cette publication comme une preuve de concept méthodologique plutôt qu'une annonce commerciale.

À lire aussi

1arXiv cs.RO 

KnowDemo : génération de démonstrations robotiques guidée par la connaissance à partir de vidéos humaines

Des chercheurs présentent KnowDemo, un framework décrit dans une prépublication arXiv (2609.21229, fin septembre 2026) qui génère des démonstrations robotiques diversifiées à partir de vidéos humaines, sans collecte réelle coûteuse. Un modèle vision-langage (VLM) extrait de chaque vidéo une connaissance structurée de la tâche, distinguant conditions requises et variations d'exécution admissibles des choix propres au geste filmé. Cette connaissance est recalée sur la géométrie de la scène cible pour guider la génération et le filtrage de candidats, avant planification de mouvement et simulation. Les démonstrations obtenues montrent un comportement multimodal, avec stratégies de contact alternatives et ordres de sous-tâches variés, étiquetés de façon structurée. Pour les valider, les auteurs affinent le modèle pré-entraîné π0.5, architecture vision-langage-action de Physical Intelligence, sur des données simulées, et démontrent un transfert sim-to-real sur trois tâches de manipulation, projet documenté sur zhiyuan-gao.github.io/knowdemo. Pour l'industrie robotique, l'enjeu dépasse le produit : il touche un goulot d'étranglement central de l'apprentissage par imitation, la collecte de démonstrations réelles restant coûteuse et lente. Les méthodes existantes, qui adaptent des trajectoires extraites de vidéos humaines, reproduisent souvent la stratégie de contact et l'ordre des sous-tâches observés, ce qui limite la diversité utile à l'entraînement des politiques. En conditionnant la génération sur une compréhension explicite des contraintes de tâche plutôt que sur la seule référence de mouvement, KnowDemo augmente le taux de candidats valides et le nombre de modes d'exécution vérifiés. Le transfert sim-to-real obtenu après fine-tuning de π0.5 appuie l'hypothèse que des données synthétiques structurées, plutôt que massivement collectées, peuvent faire progresser les modèles vision-langage-action à l'échelle, un enjeu suivi par les intégrateurs cherchant à réduire le coût de l'apprentissage robotique. Le travail prolonge une lignée de méthodes générant des démonstrations par adaptation de mouvements extraits de vidéos humaines puis validées en simulation, une piste explorée pour contourner la téléopération. KnowDemo répond aux limites de ces approches centrées sur la seule reproduction du geste de référence, en y ajoutant un raisonnement sémantique via VLM. Le choix de π0.5 situe le travail dans l'écosystème des VLA génériques, aux côtés d'architectures comme GR00T de NVIDIA ou Helix de Figure. Sans affiliation d'entreprise indiquée dans le résumé, l'étude reste à ce stade une validation de laboratoire sur trois tâches, sans calendrier de déploiement industriel ni partenariat annoncé.

RecherchePaper
1 source
Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles
2arXiv cs.RO 

Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles

Un article de recherche publié sur arXiv (2608.16476v1) présente un framework destiné à entraîner des politiques de navigation urbaine "point-goal" (rejoindre un point cible donné) à partir de vidéos égocentriques web-scale non curées, c'est-à-dire des séquences filmées en conditions réelles et disponibles en grande quantité sur le web. Le système annote automatiquement ces vidéos avec des trajectoires métriques et une sémantique de navigation structurée, puis exploite ces annotations pour entraîner une politique vision-langage-action (VLA) capable de produire des plans de navigation interprétables plutôt que des sorties de type boîte noire. Les auteurs caractérisent ensuite la "long tail", c'est-à-dire la distribution des cas rares, en croisant la performance du modèle avec les patterns de perception-mouvement observés, et s'appuient sur une analyse par réflexion pour diagnostiquer les modes d'échec récurrents. Le dispositif est validé à la fois sur des données vidéo web et sur des tâches de navigation urbaine réelles. L'enjeu pour l'industrie de la robotique mobile tient à un frein bien identifié : la collecte de données spécifiques à la navigation coûte cher, et les scénarios rares mais critiques pour la sécurité, piétons imprévisibles, intersections complexes, obstacles inhabituels, restent sous-représentés dans les jeux de données robotiques classiques constitués par téléopération ou simulation. En montrant un transfert de connaissances efficace depuis des vidéos web non contraintes vers une politique de navigation opérationnelle, l'étude nourrit l'hypothèse selon laquelle les modèles VLA peuvent s'appuyer sur des sources massives et bon marché plutôt que sur des flottes dédiées à la collecte. Pour les intégrateurs d'AMR et les concepteurs de plateformes mobiles ou humanoïdes déployées en environnement urbain, la couverture des cas limites demeure le principal verrou avant une mise en production fiable, ce qui rend cette piste méthodologique directement pertinente. Ce travail s'inscrit dans la dynamique plus large des politiques VLA combinant perception visuelle, compréhension du langage et génération d'actions, déjà explorée pour la manipulation comme pour la navigation robotique. Il s'agit ici d'une contribution de recherche méthodologique et non d'une annonce produit : l'article, classé "new" sur arXiv, ne mentionne ni entreprise, ni partenaire industriel, ni calendrier de déploiement commercial. Sa valeur ajoutée revendiquée dépasse la performance agrégée classique en mettant en évidence une structure cohérente dans les échecs de type long tail, un axe d'évaluation encore peu formalisé dans la littérature sur la navigation incarnée. Les suites naturelles concerneraient l'extension du pipeline d'annotation à davantage de vidéos in-the-wild et une validation sur des flottes robotiques réelles, mais aucune date ni terrain de déploiement précis n'est fourni dans l'article.

RecherchePaper
1 source
Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable
3arXiv cs.RO 

Voir ce qui compte : la planification vidéo guidée par indices visuels pour une navigation robotique généralisable

Un preprint arXiv (2609.16737, mis en ligne mi-septembre 2026) présente CueNav, un système de navigation robotique combinant planification vidéo guidée par indices visuels et modèle inverse-dynamique (IDM) propre a chaque plateforme. Le planificateur vidéo s'appuie sur deux indices : une carte vue-du-dessus (Bird's-Eye View) donnant le contexte global de la tache, et le maintien d'une partie du corps du robot dans le champ égocentrique pour exposer le contexte d'embodiment. L'IDM traduit ensuite les champs de flux optique extraits de la vidéo en commandes d'actuation. Sur un test de labyrinthe, CueNav quasiment double le taux de réussite par rapport a une planification sans indice global, et atteint 70% de réussite dans un couloir étroit la ou les méthodes comparées échouent majoritairement. Les auteurs démontrent aussi une navigation conditionnée sémantiquement en zero-shot et le déploiement d'un même planificateur vidéo sur plusieurs plateformes robotiques, avec code et résultats sur cuenav.github.io. Le travail cible un angle mort des approches actuelles de navigation par modèle vidéo, qui conditionnent généralement la planification sur un horizon court et récupèrent des points de passage géométriques via reconstruction de scene, au détriment du long horizon et d'une traduction vidéo-vers-action précise. En couplant contexte global et ancrage d'action spécifique a l'embodiment, CueNav esquisse une piste pour transformer les modèles vidéo génératifs en véritable backbone de politique de navigation généralisable, plutôt qu'en simple outil de visualisation a court terme. Pour les intégrateurs qui explorent les architectures vision-langage-action (VLA) au-delà de la manipulation, cela suggère qu'une même logique de planification vidéo peut se transférer entre plateformes, un enjeu pour les flottes hétérogènes d'AMR et de robots humanoïdes. Ce travail s'inscrit dans une tendance ou des modèles vidéo génératifs sont testes comme backbone de politiques robotiques, en parallèle d'architectures VLA comme Pi-0 ou GR00T N2 employées en manipulation, et se positionne explicitement contre les méthodes limitant la planification a un horizon court avec reconstruction géométrique. Il s'agit d'un preprint non encore revu par les pairs, dont les taux de réussite annonces (quasi-doublement en labyrinthe, 70% en couloir étroit) proviennent de bancs d'essai contrôles propres a l'étude, sans précision sur le nombre d'essais ni déploiement en environnement industriel réel. Aucune entreprise ni feuille de route commerciale n'est associée a l'annonce : il s'agit d'une contribution académique, sans calendrier de pilote a ce jour.

RecherchePaper
1 source
Vol à l'aveugle : la délibération spatiale guidée par vision pour la navigation "voir et atteindre" des drones
4arXiv cs.RO 

Vol à l'aveugle : la délibération spatiale guidée par vision pour la navigation "voir et atteindre" des drones

Une équipe de recherche présente DBFly, un système de navigation pour drones capable d'approcher et de s'arrêter précisément près d'une cible désignée en langage naturel et visible dès la prise de vue initiale, une tâche connue sous le nom de "see-and-reach navigation". Le problème identifié par les auteurs est que les méthodes existantes associent directement les représentations vision-langage aux commandes de vol, sans étape intermédiaire de décision spatiale fine, ce qui provoque un désalignement entre la compréhension sémantique et le contrôle réel et rend les manœuvres incohérentes et les arrêts peu fiables. DBFly introduit à la place une chaîne de décision de manœuvre spatiale en trois étapes : ancrage de la direction cible, diagnostic spatial, puis décision de manœuvre, qui guide explicitement la génération continue de points de passage (waypoints). Le système construit aussi un "corridor de vol implicite", une référence géométrique persistante dérivée de la direction cible initiale et recalculée en continu selon la position du drone, pour affiner les corrections de trajectoire. Une stratégie d'arrêt tenant compte de la convergence du mouvement à court terme complète le dispositif. Sur des jeux de test couvrant des scènes vues, des objets inédits et des scènes inédites, DBFly améliore le taux de succès de 25,07 points de pourcentage en moyenne par rapport à la meilleure méthode existante (SOTA). Cette avancée s'inscrit dans un enjeu central pour la navigation autonome des drones commandés en langage naturel : le fossé entre la compréhension d'une instruction ("va vers la voiture rouge") et l'exécution physique précise qui doit en découler. Un gain de 25 points sur des scènes et objets jamais vus est significatif, car c'est justement la généralisation qui échoue le plus souvent dans les approches "bout-en-bout" pilotées uniquement par des modèles vision-langage. Pour les intégrateurs travaillant sur des drones d'inspection, de livraison ou de surveillance guidés par instruction vocale ou textuelle, ce type d'architecture en couches explicites (perception, diagnostic spatial, décision de manœuvre) offre une piste pour réduire les échecs d'atterrissage ou d'approche qui limitent aujourd'hui le déploiement en conditions réelles, au-delà des démonstrations en environnement contrôlé. Le travail se situe dans la continuité des recherches sur la navigation UAV pilotée par le langage (vision-language navigation appliquée aux drones), un domaine qui a jusqu'ici largement repris les architectures VLA (vision-language-action) développées pour la robotique au sol et les bras manipulateurs, sans toujours les adapter aux contraintes spécifiques du vol. Les auteurs comparent leur approche à une base de référence qualifiée d'état de l'art (SOTA), sans que l'abstract ne précise son nom, laissant supposer une comparaison directe sur les mêmes bancs d'essai plutôt qu'une performance en conditions réelles de terrain. Une page projet dédiée (xuefanfu.github.io/DBFly-Page) et l'annonce sur arXiv suggèrent une publication académique à ce stade, sans indication de déploiement commercial ou de partenariat industriel ; les prochaines étapes attendues seraient une validation sur drones physiques en extérieur et une comparaison avec des architectures VLA génériques comme celles utilisées en robotique mobile terrestre.

RecherchePaper
1 source