Aller au contenu principal
NAViLoss : un objectif à double résidu tenant compte de la navigation sous-marine pour un apprentissage cohérent avec la physique
RecherchearXiv cs.RO 

NAViLoss : un objectif à double résidu tenant compte de la navigation sous-marine pour un apprentissage cohérent avec la physique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les véhicules sous-marins autonomes (AUV) s'appuient généralement sur une navigation inertielle (INS) recalée par un loch Doppler (DVL), de sorte que la qualité de l'estimation de vitesse fournie par ce dernier conditionne directement la réussite des missions. Une équipe de chercheurs propose NAViLoss, une nouvelle fonction de perte pour l'apprentissage de cette estimation, intégrée à une architecture DeepONet pour former le modèle NAVi-DeepONet. La fonction pénalise simultanément deux résidus: l'écart d'estimation de vitesse dans l'espace d'état de navigation, et l'incohérence entre les faisceaux dans l'espace de mesure du DVL. Sa formulation bornée limite l'influence des grands résidus, tandis qu'un mécanisme adaptatif ajuste l'incertitude liée à la géométrie des faisceaux. L'évaluation porte sur environ 10 000 m de données expérimentales semi-synthétiques, issues de plusieurs campagnes en mer réelles. Les auteurs annoncent un gain de 44 % de précision d'estimation de vitesse par rapport aux méthodes de référence, classiques comme basées sur l'apprentissage.

L'intérêt tient moins à l'architecture qu'à la manière d'entraîner. Les méthodes d'apprentissage récentes améliorent l'estimation de vitesse du DVL quand les mesures sont dégradées (fond mal réfléchissant, perte de faisceaux, bruit), mais elles reposent sur des pertes de régression standard, sensibles aux valeurs aberrantes et aveugles à la physique du capteur. Intégrer la cohérence entre faisceaux directement dans l'objectif revient à injecter une contrainte physique là où elle compte, sans alourdir le modèle. Pour les intégrateurs d'AUV, d'engins d'inspection ou de véhicules d'exploration, c'est une piste pour réduire la dérive de navigation lors des pertes de fond ou de qualité de mesure, sans matériel supplémentaire. La robustesse aux observations corrompues est aussi un point de passage obligé pour sortir ces approches du laboratoire.

Le chiffre de 44 % demande toutefois à être lu avec prudence. Il provient de données qualifiées de semi-synthétiques, probablement des mesures réelles auxquelles des dégradations ont été ajoutées, et d'un parcours d'environ 10 000 m seulement, ce qui reste modeste. Le résumé ne précise ni les baselines exactes, ni la métrique, ni les conditions de fonds marins testées, et rien n'indique un déploiement embarqué en temps réel. Il s'agit d'un travail de recherche publié sur arXiv, pas d'un produit livré. Il prolonge une série de travaux sur l'estimation de vitesse DVL par réseaux de neurones, qui visent à compenser les faiblesses d'une navigation inertielle dont l'erreur dérive avec le temps. La suite logique est une validation sur d'autres plateformes, d'autres types de fonds et en boucle fermée avec un filtre de navigation.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA
1arXiv cs.RO 

SIEVE : sélection de données tenant compte de la structure pour l'apprentissage par imitation avec des modèles VLA

Des chercheurs proposent SIEVE, une méthode de sélection de données pour l'apprentissage par imitation des modèles Vision-Language-Action (VLA), publiée sur arXiv en juillet 2026. Contrairement aux approches existantes qui évaluent les démonstrations au niveau de la trajectoire complète ou de la paire état-action, SIEVE découpe les démonstrations en primitives visuo-motrices réutilisables et en interfaces de transition entre ces primitives. La méthode alloue ensuite un budget de sélection aux motifs de composition en maximisant l'exposition structurelle sous rendement décroissant, puis retient dans chaque groupe les trajectoires médianes, jugées les plus centrales, stables et propices à l'imitation. Testée sur plusieurs jeux de données, bancs d'essai et modèles VLA, SIEVE dépasse systématiquement les méthodes de sélection concurrentes. Résultat le plus marquant : la méthode surpasse un entraînement sur l'intégralité des données tout en n'utilisant que 50% des démonstrations et 50% des étapes d'entraînement. Pour les équipes qui entraînent des modèles VLA de type Pi-0, GR00T N2 ou Helix, ce travail s'attaque à un goulot d'étranglement concret : la collecte de démonstrations robotiques coûte cher, en téléopération humaine comme en génération synthétique, et empiler toujours plus de données ne garantit pas de meilleures politiques en raison de la redondance et du bruit. En démontrant qu'un entraînement sur moitié moins de données peut surpasser l'usage du jeu complet, SIEVE remet en question l'hypothèse du « plus de données égale de meilleures performances » dans l'apprentissage par imitation, et ouvre une piste d'optimisation des coûts pour les laboratoires et startups qui n'ont pas les ressources de calcul des géants du secteur. C'est un signal direct pour les décideurs B2B qui doivent arbitrer entre volume de collecte et qualité de curation avant de déployer des politiques VLA en production. L'apprentissage par imitation sur de larges jeux de démonstrations est devenu le paradigme dominant pour entraîner les modèles VLA, dans la lignée de travaux comme RT-2, OpenVLA ou les politiques génératives de Physical Intelligence et NVIDIA. La curation des données reste toutefois un problème ouvert : les méthodes précédentes se limitaient à des critères de diversité ou de qualité au niveau de la trajectoire entière, sans capturer les structures réutilisables qui composent les comportements à long horizon, comme saisir puis orienter un objet avant de le placer. SIEVE s'inscrit dans cette lignée de recherche sur l'efficacité des données et ouvre la voie à des travaux futurs sur la généralisation de cette approche structurelle à d'autres familles de modèles VLA et à des tâches de manipulation plus complexes.

RecherchePaper
1 source
Apprentissage auto-régressif forcé : vers un modèle du monde pour la navigation robotique à long horizon
2arXiv cs.RO 

Apprentissage auto-régressif forcé : vers un modèle du monde pour la navigation robotique à long horizon

Une équipe de chercheurs (arXiv:2605.31314, mai 2026) propose AR Forcing, une stratégie d'entraînement autorégressive pour les world models de navigation robotique basés sur la diffusion. Le problème adressé est un écart de distribution persistant : ces modèles sont entraînés avec une supervision parallèle, mais exécutent une inférence autorégressive au moment du planning de trajectoire. Cette asymétrie déstabilise les prédictions sur des horizons longs. AR Forcing l'attaque à la source en intégrant la fonction de perte diffusion standard dans la boucle autorégressive : à chaque étape, le modèle utilise ses propres prédictions pour mettre à jour le contexte et optimiser l'objectif de prédiction de bruit pas à pas. Les expériences ont été menées sur quatre jeux de données multi-domaines couvrant des environnements variés : RECON et SCAND (navigation urbaine et extérieure), HuRoN (interactions humain-robot) et TartanDrive (tout-terrain). L'intérêt pratique de cette approche tient à sa sobriété architecturale : AR Forcing ne requiert ni discriminateur supplémentaire, ni fonction de distribution-matching, et conserve le framework diffusion d'origine ainsi que son sampler. Pour les équipes développant des robots mobiles autonomes (AMR) ou des systèmes de navigation vision-only, cela signifie une intégration sans refonte de pipeline. Les résultats déclarés montrent une meilleure cohérence des images générées sur de longs horizons temporels et une amélioration de la précision des trajectoires prédites, y compris dans des environnements inconnus. Le bémol habituel s'applique ici : les métriques sont évaluées sur des datasets publics en conditions contrôlées, et le gap sim-to-real sur du hardware réel reste à démontrer. Les world models pour la navigation robotique constituent un axe de recherche actif, en lien direct avec les VLA (Vision-Language-Action models) et des travaux comme DreamerV3 ou UniSim. La dérive cumulative sur les horizons longs est précisément le verrou historique que AR Forcing tente de lever, là où les approches concurrentes recourent souvent à des mécanismes d'ancrage externes plus lourds. Le code source doit être publié prochainement selon les auteurs, ce qui permettra à la communauté de valider les résultats sur ses propres domaines applicatifs. Ce papier est un preprint arXiv non encore évalué par les pairs, sans financement industriel déclaré ni déploiement annoncé.

RecherchePaper
1 source
RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection
3arXiv cs.RO 

RACO : optimisation de l'objectif grossier tenant compte de la fiabilité pour la navigation vision-langage des drones d'inspection

Un article publié en août 2026 sur arXiv (référence 2608.22678) présente RACO, un framework de navigation pour drones guidés par instructions en langage naturel (UAV-VLN), pensé pour les missions d'inspection plutôt que pour la simple atteinte d'un objectif, et LG-UVI, un protocole d'évaluation associé dérivé des jeux de données CityNav et CityRefer. Les auteurs pointent une faiblesse des architectures existantes en deux temps ("coarse-to-fine"): l'objectif grossier prédit avant le raffinement local est traité comme fiable alors qu'il peut dériver vers une région plausible mais erronée, ce que l'étape de raffinement fine ne parvient ensuite pas à corriger. LG-UVI ajoute à ces scènes urbaines simulées des objets cibles, des distracteurs visuellement ou sémantiquement proches, des zones d'inspection typées, ainsi que des métriques distinctes pour l'arrivée en zone et pour la confirmation de l'objet. RACO traite l'objectif grossier comme une hypothèse à vérifier en temps réel plutôt qu'un point de passage fixe, en s'appuyant sur des ancres candidates au niveau objet pour corriger la localisation avant la première étape de navigation puis à la frontière entre les deux étapes, avant d'appliquer un raffinement terminal adaptatif pour les cas de quasi-échec en fin de trajectoire. Sous un protocole d'évaluation en ligne unifié, il améliore le taux de succès de 9,53 points de pourcentage sur le jeu de validation "unseen" et de 7,98 points sur le jeu de test "unseen", par rapport à une reproduction de la référence antérieure HETT. Ce résultat touche un point sensible pour l'inspection industrielle par drone: dans un scénario réel de contrôle d'infrastructure, un appareil qui s'arrête devant le mauvais objet mais confirme tout de même une anomalie représente un risque opérationnel plus grave qu'un simple échec de navigation. En montrant qu'une part importante des erreurs vient d'une dérive précoce de l'objectif grossier, non rattrapée par le raffinement local classique, les auteurs remettent en cause l'hypothèse implicite de nombreux pipelines coarse-to-fine selon laquelle l'étape fine peut compenser une estimation grossière imparfaite. Pour les équipes travaillant sur la navigation vision-langage appliquée aux drones d'inspection, l'implication pratique est qu'une vérification explicite et intermédiaire de l'objectif doit être budgétisée, plutôt que de tout reposer sur la puissance du modèle de perception final. Un gain de 8 à 10 points de taux de succès mesuré sur un protocole en ligne unifié, et non sur des scénarios sélectionnés, reste notable dans un domaine où les progrès se comptent généralement en unités de pourcentage. RACO s'inscrit dans la lignée des travaux sur la navigation vision-langage pour drones en environnement urbain simulé, qui s'appuient historiquement sur CityNav et CityRefer pour l'entraînement et l'évaluation. La comparaison se fait face à HETT, une architecture coarse-to-fine antérieure que les auteurs ont reproduite faute de protocole standardisé pour les tâches d'inspection, un manque que LG-UVI vise justement à combler en distinguant l'atteinte d'un objectif générique de la confirmation fiable d'un objet précis en présence de distracteurs. L'article ne mentionne ni déploiement sur drone physique ni partenariat industriel: il s'agit d'une contribution de recherche évaluée en simulation, dont la suite logique serait une validation sur plateforme réelle et une extension à d'autres familles de distracteurs et de zones d'inspection.

RecherchePaper
1 source
Apprentissage par renforcement conditionné par objectif et informé par la physique sous dynamique de contact hybride
4arXiv cs.RO 

Apprentissage par renforcement conditionné par objectif et informé par la physique sous dynamique de contact hybride

Des chercheurs ont publié sur arXiv (réf. 2605.30503) une analyse critique des méthodes de GCRL physico-informé (Pi-GCRL) appliquées à la manipulation robotique en contact, accompagnée de deux nouvelles formulations architecturales pour corriger leurs limites. Le GCRL (goal-conditioned reinforcement learning) vise à entraîner des agents capables d'atteindre des objectifs arbitraires à partir d'un signal de récompense rare, en apprenant une notion générale d'accessibilité dans l'espace état-but. Les approches Pi-GCRL enrichissent cette idée en injectant des biais inductifs issus de la commande optimale dans l'apprentissage de la fonction de valeur. L'article montre que, dès lors que les dynamiques deviennent hybrides, c'est-à-dire discontinues lors de transitions de contact, ces biais, appliqués naïvement, dégradent la performance : les paysages de valeur deviennent non-lisses, la contrôlabilité dépend du mode de contact actif, et les hypothèses de régularité sous-jacentes aux méthodes Pi-GCRL ne tiennent plus. L'enjeu est structurel pour la robotique de manipulation industrielle. La quasi-totalité des tâches réelles, assemblage, insertion, saisie d'objets déformables, impliquent des contacts intermittents qui créent précisément ces dynamiques hybrides. Jusqu'ici, Pi-GCRL avait démontré sa robustesse sur la navigation et le goal-reaching sans contact, mais son extension aux tâches de manipulation restait une question ouverte. Ce travail répond en quantifiant rigoureusement l'échec et en proposant deux correctifs : une formulation contact-aware qui adapte les biais inductifs au mode de contact détecté, et une formulation hiérarchique qui décompose le problème de manipulation en sous-problèmes à dynamiques plus régulières. Ces contributions ouvrent une voie méthodologique précise, distincte des approches VLA (vision-language-action) et sim-to-real classiques qui dominent actuellement les annonces industrielles. Le contexte est celui d'une compétition intense dans l'apprentissage pour la manipulation : DeepMind avec RoboCAT, Physical Intelligence avec pi0, Google avec RT-X, et des dizaines de labos universitaires cherchent à franchir le fossé démo-vers-réalité. Pi-GCRL représente une ligne de recherche distincte, héritée des travaux en commande optimale et en GCRL (Andrychowicz, Plappert et al., 2017 et suivants), qui mise sur la structure mathématique du problème plutôt que sur la puissance brute des données. Ce preprint est une contribution académique sans déploiement annoncé ni partenaire industriel identifié ; les suites probables sont des benchmarks sur des environnements contact-rich standardisés (MuJoCo, IsaacGym) et une éventuelle extension aux robots à plusieurs points de contact.

RecherchePaper
1 source