Aller au contenu principal
TANGO : navigation humanoïde en environnements encombrés grâce à un modèle vision-langage-action (VLA) du corps entier
RecherchearXiv cs.RO 

TANGO : navigation humanoïde en environnements encombrés grâce à un modèle vision-langage-action (VLA) du corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (identifiant 2609.09158, deuxième version) TANGO, un modèle vision-langage-action (VLA) qui permet à un robot humanoïde de traverser des environnements intérieurs encombrés à partir d'une consigne en langage naturel. Le système prend en entrée la consigne et des images RGB égocentriques, puis prédit directement des actions articulaires pour 29 DOF, transmises à un contrôleur du corps entier. L'entraînement s'est fait uniquement en simulation. Un pipeline génère des comportements de traversée sans collision: planification de trajectoire globale, génération cinématique de mouvements du corps entier, édition de mouvements tenant compte des obstacles, puis suivi par apprentissage par renforcement, qui garantit la faisabilité dynamique des actions servant de supervision. Selon les auteurs, TANGO atteint l'état de l'art en navigation vision-langage en simulation et dépasse des bases modulaires solides sur les scènes exigeant de négocier des obstacles. Le modèle a ensuite été déployé en zero-shot sur un Unitree G1, sans aucune donnée de navigation réelle, avec une traversée guidée par le langage jugée robuste dans des scènes encombrées réelles.

L'intérêt tient au changement de paradigme. La navigation y est traitée comme un problème 3D de coordination du corps entier (placement des bras, ajustement du buste, modulation de la démarche), et non comme une planification 2D de type AMR, où le robot se réduit à une empreinte au sol. Cette logique convient mal à des humanoïdes appelés à circuler dans des entrepôts, ateliers ou bureaux denses. Le résultat, s'il se confirme, appuie aussi la thèse d'un transfert sim-to-real efficace pour des comportements complexes, sans collecte coûteuse de téléopération réelle. Il faut toutefois rester prudent: il s'agit d'un preprint, les chiffres détaillés (taux de succès, nombre d'essais, diversité des scènes réelles) ne figurent pas dans le résumé, et la revendication de « première » approche reste à vérifier. Une démonstration sur un seul robot ne vaut pas un déploiement.

Le contexte est celui d'une course aux VLA, de Pi-0 de Physical Intelligence à GR00T de NVIDIA ou Helix de Figure, surtout orientés vers la manipulation. TANGO déplace l'effort vers la locomotion pilotée par le langage et la perception, avec une plateforme accessible, le G1 d'Unitree, très répandue dans les laboratoires. Les approches modulaires, qui séparent perception, planification et contrôle, restent la référence industrielle et servent ici de point de comparaison. Les suites probables sont l'ouverture du code ou des données, des tests sur d'autres morphologies et, surtout, une évaluation en environnements dynamiques et en conditions de production.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu
1arXiv cs.RO 

SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu

Des chercheurs ont publié le 11 août 2026 sur arXiv (référence 2608.07548v1) un article présentant SC²-WM, un modèle du monde auto-correcteur destiné à la navigation par vision et langage en environnement continu (VLN-CE), une tâche où un agent robotique doit suivre des instructions en langage naturel pour se déplacer dans un espace qu'il ne perçoit que partiellement. Contrairement à la plupart des méthodes existantes, qui fonctionnent en boucle ouverte sans mécanisme pour détecter une dérive de leur représentation interne pendant l'exécution, SC²-WM introduit une boucle de rétroaction fermée : le modèle du monde anticipe les conséquences d'une action avant de l'exécuter et affine le plan de navigation au niveau de l'état interne. Pour les cas les plus difficiles, les auteurs ajoutent un mécanisme d'adaptation conditionnelle qui met à jour le modèle du monde lui-même au moment du test, lorsque la rétroaction signale que ses capacités sont insuffisantes pour la situation rencontrée. Les expériences, menées sur les benchmarks standards de VLN-CE, montrent une robustesse et une généralisation améliorées par rapport aux approches en boucle ouverte. Le code est mis à disposition sur GitHub (sunrise-ikun/SC2_WM). Aucun chiffre précis de gain de performance ni comparaison avec des systèmes commerciaux n'est communiqué dans le résumé. Cette contribution touche un point sensible de la navigation robotique par instructions : le fossé entre les démonstrations en simulation et la fiabilité en conditions réelles. Un agent en boucle ouverte accumule des erreurs de perception ou d'interprétation du langage sans pouvoir les corriger, ce qui dégrade rapidement ses performances dès que l'environnement s'écarte des données d'entraînement. En donnant au modèle du monde la capacité de vérifier ses propres prédictions avant d'agir, puis de se réadapter localement quand ses connaissances ne suffisent plus, SC²-WM s'inscrit dans une tendance de fond de la recherche en IA incarnée : rendre les architectures de type modèle du monde ou VLA plus robustes à l'inférence, sans réentraînement complet. Pour les intégrateurs travaillant sur des AMR ou des plateformes mobiles guidées par langage naturel, ce type de mécanisme de correction interne est un prérequis pour sortir des scénarios de laboratoire scriptés et s'approcher d'un déploiement fiable en environnement non structuré. SC²-WM s'inscrit dans la lignée des travaux récents combinant modèles du monde et navigation instruite par le langage, un domaine où la littérature s'est jusqu'ici surtout concentrée sur l'amélioration de la perception et de la planification en boucle ouverte, laissant de côté la correction d'erreurs pendant l'exécution. L'article ne précise ni affiliation institutionnelle ni partenariat industriel ; il s'agit d'une publication de recherche accompagnée d'un code open source, sans annonce de produit ni de déploiement commercial. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation sur des plateformes robotiques physiques et une comparaison directe avec d'autres architectures de navigation par le langage, notamment les approches fondées sur des modèles VLA génériques.

RecherchePaper
1 source
HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier
2arXiv cs.RO 

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier

Des chercheurs présentent HOTICE, un framework d'apprentissage pour robots humanoïdes dédié au transport d'objets en environnement encombré, détaillé dans un preprint publié sur arXiv (2609.25363v1). Le système combine des « champs de potentiel découplés humanoïde-objet », qui calculent simultanément l'évitement de collision pour le corps du robot et pour l'objet porté, et une architecture de renforcement à deux agents séparant le contrôle du haut et du bas du corps tout en gardant une coordination globale via des observations et récompenses partagées. Pour généraliser à des scènes variées, les auteurs distillent plusieurs politiques enseignantes « privilégiées » en une seule politique étudiante déployable. HOTICE a été testé en simulation MuJoCo puis sur un robot Unitree G1 réel, transportant des objets de formes différentes à travers des obstacles ; le papier ne cite toutefois aucun chiffre de taux de réussite, de charge utile ou de temps de cycle, se limitant à des qualificatifs comme « efficace » et « robuste ». Le transport d'objets en espace contraint reste une capacité rare dans les démonstrations humanoïdes actuelles, la plupart des systèmes commerciaux comme Figure 03 ou Optimus Gen 3 étant montrés en environnement dégagé. En traitant simultanément l'évitement de collision du robot et de sa charge, HOTICE cible un problème concret pour les intégrateurs logistiques confrontés à des couloirs d'entrepôt ou des ateliers exigus. L'approche illustre aussi une alternative aux modèles vision-langage-action monolithiques comme Pi-0 ou GR00T N2 : découper la loco-manipulation en agents spécialisés coordonnés réduit l'espace d'action à apprendre et facilite, selon les auteurs, le transfert de la simulation vers un robot réel. HOTICE demeure un résultat de recherche en preprint, sans affiliation institutionnelle précisée ni partenariat industriel ou pilote commercial annoncé. Il s'inscrit dans une recherche active sur la loco-manipulation humanoïde, où plusieurs équipes explorent des architectures multi-agents pour coordonner bras et jambes, aux côtés de modèles généralistes comme Helix chez Figure AI ou GR00T N2 chez NVIDIA. Le choix du Unitree G1, plateforme chinoise largement adoptée par les laboratoires académiques pour son coût abordable, confirme son rôle de banc d'essai de référence pour ce type de travaux. Aucun calendrier de transfert vers un produit n'est mentionné ; les auteurs annoncent seulement la validation technique de leur méthode.

RecherchePaper
1 source
WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action
3arXiv cs.RO 

WOLF-VLA : framework de locomotion optimale corps entier pour humanoïdes avec apprentissage vision-langage-action

Des chercheurs ont publié le 25 juin 2026 sur arXiv (arXiv:2606.25591) WOLF-VLA, un cadre unifié qui combine la synthèse de trajectoires par contrôle optimal (OC) en corps entier avec un dataset multimodal à grande échelle, dans le but d'entraîner des modèles VLA (Vision-Language-Action) capables de piloter la locomotion d'humanoïdes directement depuis des instructions en langage naturel. Le dataset couvre six familles de tâches de locomotion, paramétrées par des variations d'environnement, de couleurs d'objets, de placements et de distracteurs visuels. L'entrainement utilise des trajectoires articulaires dynamiquement cohérentes, des observations visuelles ego-centriques et des instructions textuelles. Les résultats annoncés font état d'une robustesse notable aux variations de conditions initiales et de performances compétitives sur plusieurs tâches et configurations d'environnement. Le dataset complet, les checkpoints de modèle et la suite de benchmarks en simulation seront publiés en open source. Ce travail comble un angle mort important : si les VLA ont prouvé leur efficacité en manipulation (voir Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA), leur extension à la locomotion en corps entier, contact-riche et dynamiquement contrainte, restait quasi inexploitée. Les trois verrous identifiés par les auteurs sont précis -- pénurie de données, absence de démonstrations dynamiquement consistantes, et difficulté à encoder optimalité et sécurité dans un pipeline d'apprentissage -- ce sont exactement les obstacles qui ont maintenu la locomotion hors du champ VLA. La génération de trajectoires via contrôle optimal comme source de données supervisées est une approche méthodologiquement solide pour contourner la dépendance aux démonstrations humaines ou téléopérées. Ce papier s'inscrit dans un mouvement plus large vers des politiques de locomotion instruction-guidées, concurrent de travaux comme ANYmal (ETH Zurich / ANYbotics), Digit (Agility Robotics) ou les approches reinforcement learning de Boston Dynamics. La release open source du benchmark constitue la contribution potentiellement la plus durable : établir un référentiel reproductible pour la locomotion humanoïde VLA permettrait de structurer les comparaisons dans un domaine où les métriques sont encore disparates. Aucun déploiement physique n'est mentionné dans cet article, qui reste une contribution de recherche en simulation -- le transfert sim-to-real sur des plateformes comme Unitree H1 ou Figure 03 constitue la prochaine étape non résolue.

UELe benchmark open source pourrait servir de référence aux laboratoires européens travaillant sur la locomotion humanoïde (ETH Zurich/ANYbotics notamment), mais aucun acteur français ni institution de l'UE n'est directement impliqué dans cette publication.

RechercheOpinion
1 source
GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus
4arXiv cs.RO 

GPT-6-Astra dans un flux de navigation : analyse comportementale en navigation vision-langage zéro-shot dans des environnements continus

Des chercheurs ont évalué GPT-6-Astra comme agent de navigation dans un système zero-shot de Vision-and-Language Navigation en environnements continus (VLN-CE), où le modèle interprète des instructions en langage naturel, observe son environnement et propose des actions de déplacement. Le système s'appuie sur un cycle observation-décision-exécution avec des appels directs à l'API du modèle, sans harnais d'agent package ni fine-tuning spécifique à la navigation : chaque requête reçoit un sous-ensemble d'observations visuelles, un retour d'exécution des actions précédentes et un historique de progression conservé. L'étude, publiée sur arXiv (2609.20116), porte sur 50 des 100 épisodes val-unseen du benchmark R2R-CE utilisés par le système de référence Open-Nav. Résultats obtenus : taux de réussite de 52,0 %, SPL (Success weighted by Path Length) de 48,9 % et nDTW (normalized Dynamic Time Warping) de 70,8 %. À l'arrêt, 36,0 % des épisodes réussissent via un signal STOP validé par le workflow, et 16,0 % supplémentaires atteignent seulement le critère de distance, à la limite du nombre de pas autorisés. Cette évaluation illustre à la fois le potentiel et les limites d'un grand modèle multimodal utilisé tel quel comme agent de navigation, sans entraînement dédié à la tâche. L'analyse des réponses montre que le modèle relie correctement repères visuels et actions passées aux instructions fournies, et qu'il sait demander des vues supplémentaires ou revenir sur un jugement incertain, un comportement de raisonnement explicite rarement documenté avec ce niveau de détail. Mais l'écart mis en évidence entre compréhension locale et achèvement autonome de la tâche, par exemple un franchissement reconnu comme inachevé alors que le modèle continue de pivoter sur lui-même, pointe une faiblesse structurelle : savoir qu'une action est correcte ne suffit pas à produire un comportement cohérent jusqu'à l'arrêt. Pour les intégrateurs qui envisagent des LLM généralistes pour piloter des robots mobiles ou des AMR, ce résultat tempère l'idée que les modèles zero-shot actuels suffisent en production, d'autant que l'échantillon reste limité à 50 épisodes. Le protocole reprend le sous-ensemble d'épisodes de validation R2R-CE (Room-to-Room en environnements continus) déjà utilisé par Open-Nav, système de navigation antérieur servant de point de comparaison implicite. L'approche se distingue des architectures VLA spécialisées, entraînées de bout en bout sur des données de navigation, en testant directement les capacités générales d'un modèle multimodal via son API, sans fine-tuning ni harnais logiciel dédié. Les auteurs présentent ce travail comme une analyse comportementale plutôt qu'une revendication de performance record, en documentant précisément où le raisonnement du modèle réussit et où il échoue à se traduire en actions physiques cohérentes jusqu'à l'arrêt. Aucun déploiement réel ni produit commercial n'est annoncé : il s'agit d'une évaluation de recherche en preprint, dont les résultats invitent à des travaux futurs sur le contrôle de la terminaison des épisodes et sur l'articulation entre jugement local et planification de trajectoire à plus long terme.

RechercheActu
1 source