Aller au contenu principal
RecherchearXiv cs.RO 

ReVNM : navigation visuelle par apprentissage à partir d'une caméra distante

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ReVNM (Remote Visual Navigation Model), un système de navigation robotique qui remplace les cameras embarquées classiques par une unique camera de surveillance fixe et distante du robot. Publie sur arXiv sous la référence 2609.28976 en septembre 2026, le modèle s'appuie sur une architecture VNM (Visual Navigation Model) de référence, enrichie d'un module baptise exo2ego qui convertit la vue exocentrique de la camera fixe en une estimation de profondeur égocentrique, soit la perspective que percevrait le robot lui-même face aux obstacles. Cette conversion permet au système de planifier une trajectoire sans collision même lorsque la camera distante, au champ de vision limite, ne cadre pas les obstacles sous le même angle que le robot. Le modèle a été entraine exclusivement sur des mondes synthétiques générés aléatoirement, avec des dispositions d'obstacles et des points de vue de camera varies, sans aucune donnée réelle. Les auteurs rapportent des résultats positifs en simulation comme sur robot réel, sans réglage fin supplémentaire après cet entrainement purement synthétique.

Pour l'industrie de la robotique mobile, l'intérêt est concret: les modèles de navigation visuelle usuels exigent soit une carte préalablement construite pour les trajets longs, soit un traitement d'image embarque couteux en calcul. En s'appuyant sur l'infrastructure de vidéosurveillance déjà présente dans nombre d'entrepôts, usines ou espaces commerciaux, ReVNM ouvre la voie a des robots plus légers et moins chers, délestés de camera et de puissance de calcul embarquées, la camera fixe faisant office a la fois de capteur et de carte implicite de l'environnement. Cela concerne directement les intégrateurs d'AMR cherchant a réduire le cout matériel par unité déployée. La généralisation revendiquée du simulateur au monde réel, sans aucune donnée physique d'entrainement, reste toutefois un résultat obtenu sur des scenarios générés de manière procédurale, et sa robustesse face a la variabilité réelle des entrepôts (éclairage, occlusions, positionnement des cameras existantes) demande a être confirmee au-delà des expériences publiées dans l'article.

Le travail s'inscrit dans la lignée des VNM, ces modèles qui font naviguer un robot a partir de simples images plutôt que d'une cartographie géométrique classique de type SLAM, une approche qui a gagne du terrain ces dernières années pour simplifier le déploiement en environnements changeants. Jusqu'ici, ces modèles restaient cantonnes aux trajets courts sans carte préalable ou exigeaient une cartographie géométrique pour la navigation longue distance. ReVNM cherche a lever cette limite en misant sur un capteur d'un genre différent, déjà largement présent dans le monde industriel et commercial, plutôt que sur la vision embarquée. L'article ne mentionne aucun partenaire industriel ni calendrier de déploiement pilote: il s'agit a ce stade d'un travail de recherche valide en simulation et sur un banc d'essai réel restreint, dont l'étape logique suivante serait une évaluation a plus grande échelle dans des sites industriels réels, face a des configurations de camera non vues a l'entrainement.

Impact France/UE

Aucun acteur ni déploiement français ou européen n'est mentionne, mais l'approche pourrait intéresser les intégrateurs d'AMR européens cherchant a réduire les couts matériels embarques.

Dans nos dossiers

À lire aussi

MM-Nav : un modèle VLA multi-vues pour la navigation visuelle robuste par apprentissage multi-expert
1arXiv cs.RO 

MM-Nav : un modèle VLA multi-vues pour la navigation visuelle robuste par apprentissage multi-expert

Des chercheurs ont publié MM-Nav (arXiv:2510.03142v2), un modèle de navigation visuelle de type Vision-Language-Action (VLA) capable d'exploiter des observations omnidirectionnelles à 360 degrés pour piloter un robot mobile sans recours à des capteurs de profondeur explicites comme le LiDAR. L'architecture repose sur des modèles de langage et des fondations visuelles pré-entraînés, auxquels s'ajoutent trois experts par renforcement (RL) entraînés séparément avec accès privilégié à l'information de profondeur dans des environnements synthétiques conçus pour trois compétences distinctes : l'atteinte de cible, le passage dans des espaces contraints (squeezing), et l'évitement d'obstacles. Les données générées par ces experts alimentent itérativement le modèle élève selon un ratio d'entraînement ajusté dynamiquement en fonction des performances par compétence. Des expériences en environnement réel viennent compléter la validation en simulation. L'intérêt principal de MM-Nav réside dans ce que les auteurs appellent un "effet synergique" : le modèle élève dépasse les performances de chacun de ses enseignants RL pris individuellement, ce qui suggère que la fusion multi-capacités via un VLA n'est pas simplement additive mais crée une généralisation émergente. Pour les intégrateurs robotiques, cela ouvre la voie à des politiques de navigation robustes sans nécessiter de capteurs LiDAR ou de cartes de profondeur explicites, en s'appuyant uniquement sur des caméras RGB omnidirectionnelles. La capacité à transférer une politique apprise en simulation vers le monde réel (sim-to-real) constitue le vrai enjeu ici, et les auteurs affirment l'avoir validé expérimentalement, bien que les détails sur les environnements réels testés restent limités dans le résumé disponible. MM-Nav s'inscrit dans une dynamique de recherche qui voit les VLA (Vision-Language-Action), popularisés par des travaux comme RT-2 de Google DeepMind ou Pi-0 de Physical Intelligence, s'étendre au-delà de la manipulation pour couvrir la navigation autonome. La différenciation de MM-Nav tient à son approche multi-expert à apprentissage itératif, par opposition aux approches à expert unique ou aux méthodes de distillation statique. Les acteurs concurrents dans ce segment incluent notamment des groupes académiques travaillant sur NavVLP ou ViNT, ainsi que des startups comme Skild AI qui ciblent des politiques de locomotion généralisées. Ce travail en est au stade de preprint arXiv (version 2, mise à jour d'un article d'octobre 2025) : il n'y a pas de déploiement industriel annoncé, et les résultats doivent être interprétés comme une validation académique en attente de revue par les pairs.

RechercheOpinion
1 source
Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit
2arXiv cs.RO 

Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit

Des chercheurs ont publié le 18 septembre 2026 sur arXiv (référence 2609.19272) une méthode de navigation autonome pour robots humanoïdes baptisée RoM-Nav, testée sur un Unitree G1. Le problème de départ est concret: un pipeline d'apprentissage par renforcement (RL) classique à un seul étage échoue à monter en échelle sur des terrains multi-niveaux et multi-étages, freiné par la difficulté des interactions pied-terrain complexes comme les escaliers. La solution proposée décompose la navigation en deux étapes. D'abord, une politique entraînée sur une dynamique d'ordre réduit (reduced order model) mais alimentée par des observations LiDAR 3D complètes apprend à se repérer dans un terrain complexe à plusieurs étages. Cette connaissance sert ensuite à amorcer une seconde politique opérant sur la dynamique complète du robot, avec une politique de locomotion déjà entraînée et figée intégrée dans la boucle. Un filtre de sécurité dit de Poisson est ajouté en sortie de la politique de navigation pour garantir la sécurité face à des obstacles inédits, sans dégrader le taux de réussite. Sur le G1, les essais ont couvert une navigation sans carte préalable (mapless) avec plus de 10 mètres de dénivelé vertical cumulé et plus de 100 mètres de trajet parcouru. L'intérêt pour le secteur tient à ce que ce travail s'attaque directement à un angle mort connu de la robotique humanoïde: la locomotion pure a beaucoup progressé, mais l'autonomie de navigation en environnement bâti réel, avec escaliers et changements d'étage, reste un goulot d'étranglement pour tout déploiement industriel ou logistique. En montrant qu'une décomposition hiérarchique (modèle réduit puis politique complète) permet de dépasser les limites du RL monolithique, et qu'un filtre de sécurité formel peut être ajouté sans sacrifier la performance, l'étude apporte un argument concret dans le débat sur la fiabilité des humanoïdes hors des démonstrations scénarisées. Ce résultat s'inscrit dans une recherche académique en cours plutôt que dans un produit commercial: il s'agit d'un preprint arXiv, non encore validé par relecture par les pairs, mais démontré sur du matériel réel plutôt qu'en simulation seule. Le choix du Unitree G1, plateforme largement utilisée par les laboratoires universitaires pour son accessibilité, souligne aussi que ce type d'expérimentation reste pour l'instant du ressort de la recherche plutôt que du déploiement en flotte. Les auteurs mettent à disposition une page projet avec vidéos (wdc3iii.github.io/rom-nav) mais n'annoncent pas de calendrier de transfert vers l'industrie.

RecherchePaper
1 source
Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles
3arXiv cs.RO 

Révéler les cas limites de la navigation urbaine incarnée via un apprentissage évolutif à partir de vidéos réelles

Un article de recherche publié sur arXiv (2608.16476v1) présente un framework destiné à entraîner des politiques de navigation urbaine "point-goal" (rejoindre un point cible donné) à partir de vidéos égocentriques web-scale non curées, c'est-à-dire des séquences filmées en conditions réelles et disponibles en grande quantité sur le web. Le système annote automatiquement ces vidéos avec des trajectoires métriques et une sémantique de navigation structurée, puis exploite ces annotations pour entraîner une politique vision-langage-action (VLA) capable de produire des plans de navigation interprétables plutôt que des sorties de type boîte noire. Les auteurs caractérisent ensuite la "long tail", c'est-à-dire la distribution des cas rares, en croisant la performance du modèle avec les patterns de perception-mouvement observés, et s'appuient sur une analyse par réflexion pour diagnostiquer les modes d'échec récurrents. Le dispositif est validé à la fois sur des données vidéo web et sur des tâches de navigation urbaine réelles. L'enjeu pour l'industrie de la robotique mobile tient à un frein bien identifié : la collecte de données spécifiques à la navigation coûte cher, et les scénarios rares mais critiques pour la sécurité, piétons imprévisibles, intersections complexes, obstacles inhabituels, restent sous-représentés dans les jeux de données robotiques classiques constitués par téléopération ou simulation. En montrant un transfert de connaissances efficace depuis des vidéos web non contraintes vers une politique de navigation opérationnelle, l'étude nourrit l'hypothèse selon laquelle les modèles VLA peuvent s'appuyer sur des sources massives et bon marché plutôt que sur des flottes dédiées à la collecte. Pour les intégrateurs d'AMR et les concepteurs de plateformes mobiles ou humanoïdes déployées en environnement urbain, la couverture des cas limites demeure le principal verrou avant une mise en production fiable, ce qui rend cette piste méthodologique directement pertinente. Ce travail s'inscrit dans la dynamique plus large des politiques VLA combinant perception visuelle, compréhension du langage et génération d'actions, déjà explorée pour la manipulation comme pour la navigation robotique. Il s'agit ici d'une contribution de recherche méthodologique et non d'une annonce produit : l'article, classé "new" sur arXiv, ne mentionne ni entreprise, ni partenaire industriel, ni calendrier de déploiement commercial. Sa valeur ajoutée revendiquée dépasse la performance agrégée classique en mettant en évidence une structure cohérente dans les échecs de type long tail, un axe d'évaluation encore peu formalisé dans la littérature sur la navigation incarnée. Les suites naturelles concerneraient l'extension du pipeline d'annotation à davantage de vidéos in-the-wild et une validation sur des flottes robotiques réelles, mais aucune date ni terrain de déploiement précis n'est fourni dans l'article.

RecherchePaper
1 source
Apprentissage de marges de sécurité adaptatives pour la navigation visuelle
4arXiv cs.RO 

Apprentissage de marges de sécurité adaptatives pour la navigation visuelle

Des chercheurs présentent un nouveau système de sélection de trajectoires pour la navigation robotique en intérieur encombré, détaillé dans un preprint arXiv (2607.18200v1). Le problème ciblé : les marges de sécurité fixes utilisées par les robots mobiles sont mal calibrées, trop conservatrices elles provoquent détours et dépassements de temps, trop permissives elles autorisent des trajectoires limites dangereuses en cas de biais de perception. Les auteurs proposent un "safety critic" conditionné par le contexte qui apprend une préférence de dégagement adaptative pour classer les propositions générées par un planificateur par diffusion à partir d'images RGB-D égocentriques. Le critique combine trois composantes : un terme de sécurité avec pénalité de budget de dégagement et résidu de fonction barrière de contrôle, un terme d'efficacité mêlant lissage et pénalité de détour conditionnée à la sécurité, et un terme d'ancrage aux clearances ESDF réelles pour éviter l'effondrement de la marge apprise. L'entraînement s'appuie sur une géométrie ESDF privilégiée en simulation, puis le modèle est distillé en un sélecteur ne nécessitant que la perception, via une procédure enseignant-élève en deux temps. Sur les benchmarks PointGoal HM3D et MP3D, y compris en transfert cross-dataset, la méthode obtient les meilleurs taux de réussite et scores SPL face à des références par diffusion, par optimisation et par apprentissage par renforcement. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement concret : la plupart des planificateurs par diffusion génèrent déjà des trajectoires diverses et valables, mais peinent à choisir laquelle exécuter en toute sécurité. Une marge de sécurité apprise et adaptative plutôt que codée en dur pourrait réduire les échecs de navigation des robots déployés en environnements réels, entrepôts, usines, intérieurs domestiques, sans réglage manuel site par site. Le transfert direct vers un humanoïde Unitree G1, entraîné uniquement en simulation et sans ajustement spécifique à la tâche, illustre une réduction crédible de l'écart simulation-réel, un point sensible pour les intégrateurs qui restent souvent méfiants face aux démonstrations purement simulées. Ce travail s'inscrit dans la lignée des planificateurs par diffusion pour la navigation, une approche récente qui a gagné du terrain face aux méthodes d'optimisation classiques et au RL, en s'appuyant sur les fonctions barrière de contrôle et les champs de distance signée (ESDF) pour formaliser la sécurité. Le papier reste à ce stade une publication de recherche non revue par les pairs, sans lien annoncé avec un acteur industriel ; aucune date de déploiement produit ni partenariat n'est mentionné.

RecherchePaper
1 source