Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage de représentations de traversabilité conditionnées par le langage pour une navigation visuelle adaptative

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv (2610.11622) LaTraNav, un cadre de navigation visuelle qui apprend des représentations de traversabilité conditionnées par le langage. L'architecture est asynchrone: un modèle vision-langage (VLM) lent produit des représentations latentes de la traversabilité et du but de navigation, tandis qu'un planificateur rapide par flow matching, conditionné sur ces représentations, génère les trajectoires directement dans l'espace pixel. L'entraînement repose sur un pipeline de génération de données en simulation, avec trajectoires contrôlables, qui fournit des observations associées à des instructions en langage naturel, des cartes de traversabilité, des positions de but et des trajectoires variées. Une étape de traduction d'image photoréaliste réduit l'écart visuel avec le monde réel. Les évaluations, menées sur des jeux de données de sources multiples, portent sur la segmentation de traversabilité guidée par le langage et la localisation du but (VLM lent), ainsi que sur la planification adaptative de chemin (planificateur rapide). Le résultat chiffré principal est une cadence de mise à jour des trajectoires multipliée par 6,05 à cadence sémantique identique grâce à l'ordonnancement asynchrone.

L'intérêt tient à ce que la traversabilité cesse d'être codée en dur. Les chaînes classiques reposent sur des cartes de coûts explicites ou des masques de segmentation avec des critères prédéfinis, qui exigent des règles manuelles et un réglage minutieux pour chaque robot. Ici, la même perception peut s'adapter aux capacités d'une plateforme ou aux préférences d'un opérateur par simple instruction (par exemple éviter l'herbe, accepter un gravier ou franchir un petit obstacle). Pour les intégrateurs, cela réduit le coût de re-paramétrage d'une flotte hétérogène. Le résultat le plus instructif est que le conditionnement latent surpasse l'usage de masques de segmentation explicites, ce qui nuance l'idée que la sortie intermédiaire interprétable est toujours préférable. Les masques dépendent aussi du point de vue et deviennent obsolètes quand la latence de perception augmente, un problème que l'approche asynchrone contourne en laissant le planificateur rapide corriger la trajectoire entre deux mises à jour sémantiques.

Ce travail s'inscrit dans la tendance des architectures à deux vitesses, popularisées en manipulation et en humanoïde par des systèmes comme Helix de Figure ou GR00T de NVIDIA, où un module de raisonnement lent guide un contrôleur rapide. Il transpose cette logique à la navigation visuelle, face aux approches VLM directes, trop lentes pour le contrôle réactif, et aux pipelines de cartes de coûts classiques, plus rapides mais rigides. Il faut toutefois rester prudent: l'entraînement est majoritairement simulé, les données d'évaluation sont des jeux de données et non des déploiements sur robot, et le gain de 6,05 fois mesure une fréquence de mise à jour, pas une réussite de mission. Aucun déploiement sur robot réel, plateforme matérielle ni calendrier de transfert industriel n'est annoncé dans le résumé. La validation sur robot physique, en environnement non structuré et sous latence réelle, sera l'étape décisive.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Apprentissage de marges de sécurité adaptatives pour la navigation visuelle
1arXiv cs.RO 

Apprentissage de marges de sécurité adaptatives pour la navigation visuelle

Des chercheurs présentent un nouveau système de sélection de trajectoires pour la navigation robotique en intérieur encombré, détaillé dans un preprint arXiv (2607.18200v1). Le problème ciblé : les marges de sécurité fixes utilisées par les robots mobiles sont mal calibrées, trop conservatrices elles provoquent détours et dépassements de temps, trop permissives elles autorisent des trajectoires limites dangereuses en cas de biais de perception. Les auteurs proposent un "safety critic" conditionné par le contexte qui apprend une préférence de dégagement adaptative pour classer les propositions générées par un planificateur par diffusion à partir d'images RGB-D égocentriques. Le critique combine trois composantes : un terme de sécurité avec pénalité de budget de dégagement et résidu de fonction barrière de contrôle, un terme d'efficacité mêlant lissage et pénalité de détour conditionnée à la sécurité, et un terme d'ancrage aux clearances ESDF réelles pour éviter l'effondrement de la marge apprise. L'entraînement s'appuie sur une géométrie ESDF privilégiée en simulation, puis le modèle est distillé en un sélecteur ne nécessitant que la perception, via une procédure enseignant-élève en deux temps. Sur les benchmarks PointGoal HM3D et MP3D, y compris en transfert cross-dataset, la méthode obtient les meilleurs taux de réussite et scores SPL face à des références par diffusion, par optimisation et par apprentissage par renforcement. Pour l'industrie robotique, ce travail s'attaque à un goulot d'étranglement concret : la plupart des planificateurs par diffusion génèrent déjà des trajectoires diverses et valables, mais peinent à choisir laquelle exécuter en toute sécurité. Une marge de sécurité apprise et adaptative plutôt que codée en dur pourrait réduire les échecs de navigation des robots déployés en environnements réels, entrepôts, usines, intérieurs domestiques, sans réglage manuel site par site. Le transfert direct vers un humanoïde Unitree G1, entraîné uniquement en simulation et sans ajustement spécifique à la tâche, illustre une réduction crédible de l'écart simulation-réel, un point sensible pour les intégrateurs qui restent souvent méfiants face aux démonstrations purement simulées. Ce travail s'inscrit dans la lignée des planificateurs par diffusion pour la navigation, une approche récente qui a gagné du terrain face aux méthodes d'optimisation classiques et au RL, en s'appuyant sur les fonctions barrière de contrôle et les champs de distance signée (ESDF) pour formaliser la sécurité. Le papier reste à ce stade une publication de recherche non revue par les pairs, sans lien annoncé avec un acteur industriel ; aucune date de déploiement produit ni partenariat n'est mentionné.

RecherchePaper
1 source
RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue
2arXiv cs.RO 

RayViT : représentations visuelles conditionnées par rayons pour l'apprentissage par imitation robuste au point de vue

RayViT, ou Ray-conditioned Vision Transformer Encoder, est une nouvelle architecture légère proposée par des chercheurs pour rendre l'apprentissage par imitation visuelle plus robuste aux changements de camera. Le problème cible est simple: les politiques robotiques entraînées sur des images RGB brutes manquent d'indices géométriques explicites, ce qui les rend fragiles des qu'une camera est déplacée ou réorientée. RayViT injecte la géométrie de la camera directement dans des backbones ViT pré-entraines, en représentant cette géométrie sous forme de carte de rayons de Plucker, découpée en patches de features de rayons. Une attention croisée a portes (gated cross-attention) génère ensuite un token de classe conditionne par ces rayons, qui remplace le token de classe original du ViT tandis que les features de rayons sont ajoutées comme embeddings positionnels denses. Une fonction de perte auxiliaire par similarité cosinus renforce la cohérence de ces tokens géométriques. Sur le benchmark simulate RoboCasa multi-taches, la méthode améliore la robustesse d'environ 13 points de pourcentage face aux perturbations de camera, et sur des taches robotiques réelles multi-taches elle ajoute en moyenne 1,78 étape complétée par rapport aux méthodes de référence. L'enjeu dépasse la seule performance sur benchmark: c'est un problème très concret pour l'industrie robotique, ou les cameras embarquées se désalignent avec l'usure, les chocs ou des remontages successifs sur une chaine de production. Un système qui dégradé fortement des que le point de vue change n'est pas déployable a l'échelle chez un intégrateur, même s'il performe bien en démo contrôlée. En rendant les représentations visuelles conditionnées par la géométrie plutôt que par l'apparence brute, RayViT s'attaque directement a l'écart entre démonstration en laboratoire et fiabilité en conditions réelles, un des points de friction récurrents des approches VLA actuelles. Cette piste s'inscrit dans une tendance de recherche plus large visant a doter les politiques d'apprentissage par imitation d'une meilleure conscience 3D, plutôt que de compter uniquement sur le volume de données d'entrainement pour généraliser. En réutilisant des backbones ViT déjà pré-entraines et en ajoutant un module de conditionnement géométrique relativement léger, les auteurs proposent une voie peu couteuse a intégrer dans des pipelines existants, sans reentrainement complet du modèle visuel.

RecherchePaper
1 source
Modélisation du monde conditionnée par le langage pour la navigation visuelle
3arXiv cs.RO 

Modélisation du monde conditionnée par le langage pour la navigation visuelle

Une équipe de chercheurs publie sur arXiv (2603.26741, version 2) un travail sur la navigation visuelle conditionnée par le langage, baptisée LCVN. Dans cette tâche, un agent incarné doit suivre une instruction en langage naturel en ne disposant que d'une observation égocentrique initiale, sans image du but. La perception et le contrôle continu doivent donc être guidés uniquement par le texte. Les auteurs introduisent le jeu de données LCVN, qui regroupe 39 016 trajectoires et 117 048 instructions vérifiées par des humains, couvrant des environnements et des styles de consigne variés. Ils comparent deux approches. La première, l'imagination latente, associe un modèle du monde à base de diffusion (LCVN-WM), qui imagine les observations futures, à un agent acteur-critique (LCVN-AC) dont la politique est apprise entièrement dans cet espace latent imaginé. La seconde, la prédiction autorégressive unifiée (LCVN-Uni), utilise un seul backbone multimodal qui prédit actions et observations en une passe sur une séquence de tokens partagée. Les résultats montrent que les deux approches sont complémentaires. L'imagination latente produit des déroulés plus cohérents dans le temps, tandis que la prédiction unifiée généralise mieux à des environnements jamais vus. Pour un ingénieur robotique ou un intégrateur, l'enseignement porte sur l'arbitrage d'architecture entre un modèle du monde explicite, utile pour la planification, et un modèle unique de type VLA (vision-langage-action), plus robuste hors distribution. Des ablations isolent l'effet du guidage linguistique, des signaux de conditionnement et du style d'instruction. Elles permettent de savoir si le goulot d'étranglement vient de l'ancrage du langage ou de la modélisation de la dynamique. Cette distinction est précieuse pour orienter les investissements, entre meilleures données langagières et meilleurs modèles dynamiques. Il faut cependant rester prudent : il s'agit d'un travail académique évalué sur un benchmark, sans déploiement sur robot physique annoncé. Il ne dit rien du transfert sim-to-real ni des temps de latence en conditions industrielles. Ce travail s'inscrit dans la longue tradition de la navigation visuelle conditionnée par un but image, qui sert de banc d'essai à l'IA incarnée depuis des années. Il rejoint la tendance actuelle qui combine modèles du monde génératifs et politiques linguistiques, portée par des modèles du monde comme ceux de la famille Genie ou Cosmos et par les VLA généralistes (Pi-0, GR00T, Helix), qui visent surtout la manipulation. La navigation par instruction reste moins couverte par ces modèles. Le jeu de données, relativement volumineux pour la tâche, peut servir de référence commune. Aucune suite commerciale ni calendrier de pilote n'est annoncé. La prochaine étape logique serait de tester ces approches hybrides sur du matériel réel, ou d'unifier imagination latente et prédiction autorégressive dans une même architecture.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
BiRoAD : apprentissage de représentations partagées et adaptatives par rôle pour la manipulation bimanuelle
4arXiv cs.RO 

BiRoAD : apprentissage de représentations partagées et adaptatives par rôle pour la manipulation bimanuelle

Publiée en septembre 2026 sur arXiv sous la référence 2609.23445v1, BiRoAD (Bimanual Role-Adaptive Decomposition) est une méthode d'apprentissage par imitation pour robots à deux bras. Elle s'attaque à un défaut courant des politiques bimanuelles: celles-ci prédisent des actions dans des espaces fixes bras gauche et bras droit, sans indiquer comment un comportement doit changer quand les rôles s'échangent selon la scène, alors que les démonstrations d'entraînement sont souvent déséquilibrées entre rôles. BiRoAD décompose les représentations de trajectoire en une composante symétrique, qui capture la coordination invariante entre les deux bras, et une composante antisymétrique, propre à chaque rôle, recombinées ensuite en mises à jour résiduelles des représentations d'origine. Le module ne modifie ni les entrées de la politique ni l'objectif d'apprentissage par imitation, et se passe d'étiquetage manuel des rôles. Le problème visé est concret: un opérateur humain privilégie souvent un bras pour une sous-tâche donnée, et les politiques bimanuelles classiques généralisent mal quand un objet apparaît du côté opposé à celui majoritairement vu à l'entraînement, un cas fréquent hors environnement contrôlé. En se greffant sur des politiques déjà entraînées plutôt qu'en exigeant une nouvelle architecture, BiRoAD propose une correction peu coûteuse pour les équipes qui entraînent des robots humanoïdes ou des bras doubles fixes. Les auteurs rapportent des gains de robustesse par rapport aux politiques de base, particulièrement marqués sur les configurations de rôles sous-représentées, un enjeu directement lié à l'écart entre performance en démonstration et généralisation réelle qui préoccupe tout le secteur des politiques de manipulation apprises. Le travail s'inscrit dans la recherche sur l'apprentissage par imitation bimanuelle, où la paramétrisation bras gauche/bras droit hérite directement des interfaces de téléopération sans mécanisme dédié à l'échange de rôles. BiRoAD est présenté comme un module additionnel comparé à des politiques de base, et non comme une architecture concurrente autonome. L'article, classé comme nouvelle soumission arXiv, ne précise ni la plateforme robotique utilisée pour les évaluations ni la disponibilité d'un code source: il s'agit pour l'instant d'une contribution méthodologique, à un stade de recherche, plutôt que d'un système prêt à être déployé.

RecherchePaper
1 source