
TANGO : navigation humanoïde en environnements encombrés grâce à un modèle vision-langage-action (VLA) du corps entier
Des chercheurs ont publié sur arXiv (identifiant 2609.09158, deuxième version) TANGO, un modèle vision-langage-action (VLA) qui permet à un robot humanoïde de traverser des environnements intérieurs encombrés à partir d'une consigne en langage naturel. Le système prend en entrée la consigne et des images RGB égocentriques, puis prédit directement des actions articulaires pour 29 DOF, transmises à un contrôleur du corps entier. L'entraînement s'est fait uniquement en simulation. Un pipeline génère des comportements de traversée sans collision: planification de trajectoire globale, génération cinématique de mouvements du corps entier, édition de mouvements tenant compte des obstacles, puis suivi par apprentissage par renforcement, qui garantit la faisabilité dynamique des actions servant de supervision. Selon les auteurs, TANGO atteint l'état de l'art en navigation vision-langage en simulation et dépasse des bases modulaires solides sur les scènes exigeant de négocier des obstacles. Le modèle a ensuite été déployé en zero-shot sur un Unitree G1, sans aucune donnée de navigation réelle, avec une traversée guidée par le langage jugée robuste dans des scènes encombrées réelles.
L'intérêt tient au changement de paradigme. La navigation y est traitée comme un problème 3D de coordination du corps entier (placement des bras, ajustement du buste, modulation de la démarche), et non comme une planification 2D de type AMR, où le robot se réduit à une empreinte au sol. Cette logique convient mal à des humanoïdes appelés à circuler dans des entrepôts, ateliers ou bureaux denses. Le résultat, s'il se confirme, appuie aussi la thèse d'un transfert sim-to-real efficace pour des comportements complexes, sans collecte coûteuse de téléopération réelle. Il faut toutefois rester prudent: il s'agit d'un preprint, les chiffres détaillés (taux de succès, nombre d'essais, diversité des scènes réelles) ne figurent pas dans le résumé, et la revendication de « première » approche reste à vérifier. Une démonstration sur un seul robot ne vaut pas un déploiement.
Le contexte est celui d'une course aux VLA, de Pi-0 de Physical Intelligence à GR00T de NVIDIA ou Helix de Figure, surtout orientés vers la manipulation. TANGO déplace l'effort vers la locomotion pilotée par le langage et la perception, avec une plateforme accessible, le G1 d'Unitree, très répandue dans les laboratoires. Les approches modulaires, qui séparent perception, planification et contrôle, restent la référence industrielle et servent ici de point de comparaison. Les suites probables sont l'ouverture du code ou des données, des tests sur d'autres morphologies et, surtout, une évaluation en environnements dynamiques et en conditions de production.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




