Aller au contenu principal
Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée
RecherchearXiv cs.RO 

Uni-LaViRA : traduction d'actions langage-vision-robot pour une navigation incarnée unifiée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Uni-LaViRA (Language-Vision-Robot Actions Translation), une architecture de navigation incarnée publiée le 28 mai 2026 sur arXiv (2605.27582), capable de piloter quatre types de robots distincts, robots à roues, quadrupèdes, humanoïdes et un drone à voilure fixe construit sur mesure, sans aucun entraînement spécifique sur des trajectoires robot. Le système s'appuie sur des grands modèles multimodaux de langage préentraînés (MLLMs) pour décomposer la navigation en deux types de commandes : une commande directionnelle sémantique en langage naturel, et une cible visuelle au niveau pixel. En mode zéro-shot, Uni-LaViRA atteint 60,7 % de taux de succès sur VLN-CE R2R, 51,3 % sur VLN-CE RxR, 77,7 % sur HM3D-v2, 60,0 % sur HM3D-OVON, 54,7 % sur MP3D-EQA et 40,0 % sur OpenUAV. Deux mécanismes structurent la boucle d'agent : le TODO List Memory (TDM), qui maintient une liste de sous-objectifs mise à jour à chaque pas et réinjectée dans la fenêtre d'attention du modèle, et le Second Chance Backtrack (SCB), qui ramène le robot à son état précédant une erreur et force le replanning à partir de la sous-trajectoire échouée.

Ce résultat interpelle directement le paradigme dominant des VLA à grande échelle, qui réclame des millions de trajectoires et des milliers d'heures GPU pour atteindre des niveaux de performance comparables. Si les chiffres se confirment en environnements non contrôlés, Uni-LaViRA suggère qu'une partie du problème de généralisation en navigation peut être résolue structurellement, via un raisonnement sur la géométrie de l'action, plutôt que par accumulation de données. Pour les intégrateurs robotiques, cela réduit potentiellement le coût d'adaptation à de nouveaux sites ou morphologies de robots, deux points de friction majeurs dans les déploiements industriels. La capacité à unifier wheeled AMR, quadrupèdes et humanoïdes sous une même architecture sans fine-tuning est particulièrement notable.

L'article s'inscrit dans un contexte de compétition intense autour des architectures VLA : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, et les approches OpenVLA ou RoboFlamingo ont chacun nécessité des pipelines de collecte de données coûteux. Uni-LaViRA ne cherche pas à remplacer ces modèles sur des tâches de manipulation précise, mais positionne le raisonnement structuré comme alternative crédible pour la navigation. Les benchmarks utilisés (HM3D, MP3D, R2R) sont des standards académiques en simulation ; la validation sur robots réels reste limitée aux quatre plateformes de l'étude, et les performances en conditions industrielles non contrôlées restent à démontrer. Aucune timeline de déploiement ni partenariat industriel n'est mentionné.

À lire aussi

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage
1arXiv cs.RO 

FutureNav : modélisation unifiée monde-action pour la navigation vision-langage

FutureNav est un cadre de modélisation unifiée monde-action pour la navigation vision-langage (VLN) en environnements continus, présenté sous forme de preprint sur arXiv (arXiv:2606.30367). Le système encode conjointement des features textuelles, visuelles et spatiales dans un grand modèle de langage, entraîné sur quatre objectifs simultanés : prédiction d'action de navigation, dynamiques inverse et forward pour modéliser les transitions d'états, et génération future pour anticiper les états spatiaux à venir. Avec un backbone de 4 milliards de paramètres, FutureNav revendique des performances state-of-the-art sur plusieurs benchmarks VLN, surpassant les méthodes antérieures selon ses auteurs. Le code et les modèles seront publiés en open source. La contribution centrale est architecturale : la plupart des modèles de navigation fondationnels récents traitent la tâche comme une génération directe d'actions, sans modéliser explicitement l'état du monde ni son évolution future. FutureNav cherche à combler cet écart en forçant le modèle à représenter des transitions d'états, ce qui est censé renforcer la robustesse sur des séquences d'actions longues en environnement non discrétisé. Pour les chercheurs en navigation incarnée ou les intégrateurs de robots mobiles autonomes, cela pointe vers une approche où le raisonnement spatial prospectif améliore la politique d'action sans surcoût d'inférence notable, un point clé pour l'embarqué. La VLN en environnements continus est un domaine actif depuis les benchmarks R2R, VLN-CE et REVERIE. Des travaux comme NavGPT, MapGPT ou EmbodiedScan ont scalé des VLM sur la navigation, mais en mode "action pure". FutureNav s'inscrit dans la tendance des world models appliqués à la navigation incarnée, parallèlement aux approches VLA comme OpenVLA ou aux travaux de DeepMind sur la robotique prédictive. Il s'agit pour l'instant d'un preprint non évalué par les pairs, et les gains annoncés sur les benchmarks méritent une vérification indépendante avant conclusions définitives. La prochaine étape annoncée est la publication publique du code.

RechercheActu
1 source
VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens
2arXiv cs.RO 

VLN en vol : une pile de navigation vision-langage embarquée pour robots aériens

Une équipe de chercheurs a publié sur arXiv, le 18 septembre 2026 (référence 2609.20191), une étude décrivant "VLN on the Fly", une pile logicielle de navigation par instructions en langage naturel (vision-language navigation, VLN) fonctionnant intégralement à bord d'un robot aérien. Le système enchaîne quatre étages distincts et inspectables plutôt qu'un unique réseau de bout en bout : un modèle vision-langage (VLM) quantifié associe l'instruction textuelle à une cellule grossière de l'image caméra, la carte de profondeur convertit cette cellule en un objectif 3D, un planificateur de trajectoire rapide basé sur des splines B calcule un chemin faisable, puis une politique d'apprentissage par renforcement préentraînée traduit cette trajectoire en commandes moteur pour des quadricoptères. Sur 15 vols embarqués testant trois objets de référence du quotidien dans un volume intérieur contrôlé, le drone atteint sa cible dans 13 cas sur 15, avec une erreur moyenne de 5,72 cm par rapport à l'objectif et une utilisation moyenne du GPU embarqué de 39,3 %. Six essais supplémentaires en environnement encombré montrent des trajectoires sans collision grâce à un filtrage de la perception embarquée. L'intérêt de ces travaux tient à la contrainte de calcul propre aux drones, bien plus sévère que sur des robots au sol ou humanoïdes : grounding, planification et contrôle doivent se partager une puissance embarquée limitée, et une erreur dans un pipeline fusionné en un seul réseau (comme le font la plupart des politiques VLA de bout en bout) est difficile à isoler en vol. En conservant des étages séparés et observables, l'équipe défend une architecture plus sûre et plus facile à diagnostiquer, au prix probable d'une latence ou d'une flexibilité moindre qu'une politique end-to-end. Le chiffre de 39,3 % d'utilisation GPU suggère une marge de calcul disponible, preuve que l'exécution embarquée complète reste viable sans déport vers une station sol ou le cloud, un point clé pour les intégrateurs de drones d'inspection ou de logistique intéressés par un pilotage vocal ou textuel autonome. Il faut toutefois noter la portée limitée de la démonstration : 15 vols, trois objets, un environnement intérieur contrôlé, et un taux d'échec de 2 essais sur 15, loin d'un déploiement industriel validé. Ces travaux s'inscrivent dans le débat plus large opposant les architectures VLA de bout en bout, popularisées par des modèles comme Pi-0 ou GR00T N2 sur des plateformes au sol, à des pipelines modulaires jugés plus sûrs pour des systèmes critiques comme les drones volant à proximité d'humains ou d'obstacles. Aucun acteur français ou européen n'est mentionné dans cette étude, qui reste un prototype de recherche sans annonce de partenariat industriel ni de calendrier de déploiement commercial. Les essais en environnement encombré laissent entrevoir une prochaine étape vers des scénarios plus réalistes, mais aucun pilote opérationnel n'est pour l'instant annoncé.

RecherchePaper
1 source
3arXiv cs.RO 

Vers une navigation créative de trajectoires : la navigation des robots par l'interaction incarnée

Des chercheurs proposent la « Path-Creative Navigation » (PCN), un paradigme où le robot ne se contente pas de chercher un chemin dans l'espace libre existant, mais le crée en coordonnant locomotion et interaction physique avec son environnement. Le travail, publié sur arXiv (2610.11072), part d'un constat simple : une route peut être obstruée par une structure articulée (une porte, par exemple), un objet déplaçable ou un piéton, et atteindre le but exige alors d'agir sur l'obstacle. Les auteurs traitent une classe de tâches PCN avec un cadre sans carte préalable (mapless) qui fusionne vision, LiDAR et odométrie. Ce système unifié combine observations locales, géométrie des obstacles et estimation de l'état du robot pour fournir une information sémantique et géométrique stable à la navigation comme à l'interaction. Une méthode de décision sensible à la traversabilité exploite les distances visuelles et LiDAR pour déterminer si un blocage est « actionnable » et s'il peut être contourné en sécurité. Le robot ne interagit ainsi que lorsque c'est nécessaire. Quatre comportements sont couverts : pousser une structure articulée, pousser un objet mobile, éviter un obstacle et solliciter un piéton. L'évaluation combine des scénarios de simulation conçus pour l'occasion et deux tâches réelles qu'une navigation conventionnelle ne peut pas accomplir sans interaction. Le résumé ne précise ni la plateforme robotique, ni les taux de réussite chiffrés, ni les méthodes de référence comparées. L'enjeu est pratique pour tout déploiement en environnement non structuré : bureaux, hôpitaux, entrepôts ou sites logistiques. La plupart des piles de navigation autonome (AMR, robots de service) traitent l'environnement comme figé et déclarent l'échec, ou attendent, dès qu'une porte semi-ouverte, un chariot ou une personne bloque le passage. Intégrer la décision « dois-je agir sur cet obstacle ? » dans la boucle de navigation vise à réduire ces blocages, qui pèsent sur la disponibilité réelle des flottes. L'approche sans carte est aussi un atout pour les intégrateurs, car elle limite la dépendance à une cartographie préalable qui vieillit vite dans des lieux changeants. Les résultats restent toutefois à prendre avec prudence : le résumé annonce un « taux de complétion supérieur » aux références sans donner de chiffres, la validation réelle se limite à deux tâches, et le code est publié sur un dépôt anonymisé, signe d'une soumission en relecture. Rien n'indique encore une robustesse sur de longues durées ni sur des morphologies variées. Ce travail s'inscrit dans le rapprochement entre navigation et manipulation mobile, longtemps traitées séparément. Les travaux de « navigation parmi des obstacles déplaçables » (NAMO) existent depuis des années, mais reposaient souvent sur des cartes complètes et une planification coûteuse. La vague actuelle de modèles vision-langage-action et de robots humanoïdes ou quadrupèdes à locomotion robuste rend l'interaction opportuniste plus accessible, ce qui rapproche cette recherche des ambitions de plateformes généralistes comme Figure, Tesla Optimus ou Agility. La suite logique serait une validation sur davantage de scénarios et de plateformes, des comparaisons chiffrées publiées, puis une intégration à des politiques apprises plus générales. Pour l'instant, il s'agit d'une contribution académique en prépublication, sans pilote industriel annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
NAC : un codec neuronal d'actions pour les modèles vision-langage-action
4arXiv cs.RO 

NAC : un codec neuronal d'actions pour les modèles vision-langage-action

Des chercheurs publient une version mise à jour (v2) du préprint arXiv 2606.21372, intitulé « NAC: Neural Action Codec for Vision-Language-Action Models », qui introduit un nouveau tokenizer d'actions pour les modèles vision-langage-action (VLA). Le NAC reprend l'architecture des codecs audio neuronaux, encodeur-décodeur convolutif à quantification vectorielle résiduelle (RVQGAN) utilisée dans les modèles de fondation audio, en traitant les courtes trajectoires d'actions robotiques comme des signaux 1D multicanaux compressés à plusieurs échelles. Le système produit un espace de tokens compact et ordonné via des codebooks décalés, ce qui permet à des politiques autorégressives standard de fonctionner sur des séquences courtes et structurées ; la reconstruction des trajectoires s'appuie sur un décodeur de style Vocos, avec tête ISTFT et discriminateurs adversariaux. Évalué sur les bancs d'essai LIBERO-10 et RoboMimic, ainsi que sur une série de tâches de manipulation réelles, NAC atteint une fidélité de reconstruction élevée et des taux de réussite moyens supérieurs au binning, à FAST et aux tokenizers VQ antérieurs, à taux de compression comparable ou meilleur. Le tokenizer d'actions est le goulot d'étranglement discret entre commande continue du robot et modélisation de séquence autorégressive au cœur de tout VLA ; jusqu'ici, binning, FAST et quantification vectorielle classique forçaient un compromis entre compression, latence et performance. En montrant qu'une architecture éprouvée pour l'audio se transpose presque sans changement structurel au contrôle robotique, ce travail suggère que la tokenisation d'actions n'est plus le facteur limitant majeur pour faire passer à l'échelle les politiques VLA, un enjeu concret pour tout intégrateur entraînant des politiques génériques de manipulation sur plusieurs tâches et morphologies de robot. Le gain de taux de réussite à compression égale ou supérieure compte surtout pour le temps réel, où latence d'inférence et longueur de séquence conditionnent le temps de cycle. Les résultats restent toutefois issus de bancs d'essai académiques, simulation complétée d'un nombre limité de tâches réelles, donc d'un stade de recherche et non d'un produit ou d'un déploiement industriel. Le travail s'inscrit dans la lignée des tokenizers développés pour les VLA récents, dont FAST, méthode associée à la famille de modèles Pi-0 de Physical Intelligence et prise ici comme référence de comparaison, ainsi que les approches par binning et par quantification vectorielle discrète plus anciennes. L'idée de recycler les codecs audio neuronaux à quantification résiduelle, déjà standard pour les modèles de fondation audio, illustre une tendance plus large du secteur à importer des briques génératives multimodales vers la robotique. Publiée sous forme de préprint arXiv, sans annonce de licence, d'intégration produit ni de calendrier de déploiement, la contribution demeure un résultat de recherche dont la portée dépendra de sa reproduction sur des politiques VLA de plus grande échelle et de tests au-delà des bancs d'essai contrôlés utilisés dans l'article.

RechercheActu
1 source