
HumanoidVLN : simulateur et référentiel physiques pour la navigation vision-langage sur robots humanoïdes variés
HumanoidVLN, un simulateur et benchmark ancré dans la physique pour la navigation par instructions vision-langage chez les robots humanoïdes, a été détaillé dans un article publié en août 2026 (arXiv:2608.12860v1). Bâti sur NVIDIA Isaac Sim, il couvre quatre robots aux morphologies distinctes, les Unitree G1 et H1 ainsi que deux plateformes internes baptisées Internal-A et Internal-B, avec 10 à 12 degrés de liberté aux jambes et des tailles de 1,17 m à 1,80 m, pilotés par une architecture combinant une politique de locomotion par apprentissage par renforcement et des suiveurs de trajectoire PD ou MPC interchangeables. Un pipeline multi-agent avec supervision humaine génère 933 épisodes de référence sans collision, chacun assorti d'une instruction précise et de trois variantes stylistiques, testés sur quatre modèles VLN existants : NaVILA, DualVLN, StreamVLN et JanusVLN. JanusVLN arrive en tête avec 43,55% de réussite moyenne et un score nDTW de 48,38, tandis qu'un pilote sim-to-real de 20 épisodes avec DualVLN sur un Unitree G1 réel affiche une corrélation d'erreur de r=0,935 et un écart moyen de 0,68 mètre.
Ce travail comble un angle mort des benchmarks VLN existants, conçus pour des agents à roues et donc aveugles aux contraintes propres à la bipédie, comme l'instabilité ou la distorsion des observations liée à la démarche. Un simulateur physique compatible avec plusieurs contrôleurs et morphologies réduit le risque de sur-optimiser un modèle pour un environnement qui ne reflète pas le comportement réel du robot. La forte corrélation entre résultats simulés et réels suggère un proxy fiable pour anticiper le comportement en conditions réelles, un enjeu central alors que l'écart sim-to-real reste un frein majeur à la commercialisation des humanoïdes autonomes. Un taux de réussite plafonnant sous 44% pour le meilleur modèle confirme aussi que la navigation par instructions naturelles demeure largement non résolue, loin des discours commerciaux vantant la maturité des architectures vision-langage-action pour l'humanoïde.
HumanoidVLN s'inscrit dans une vague de benchmarks cherchant à combler l'écart entre simulations conçues pour robots à roues ou bras manipulateurs et les exigences propres aux humanoïdes bipèdes, à mesure que les Unitree G1 et H1 se banalisent dans la recherche académique. En confrontant simultanément quatre modèles VLN sur quatre morphologies distinctes, les auteurs positionnent leur outil comme un banc d'essai neutre plutôt qu'une vitrine pour une architecture donnée. Il s'agit d'un travail académique, sans entreprise commerciale directement impliquée dans la publication. Code, benchmark et données doivent être publiés sur humanoid-vln.github.io après acceptation de l'article, mais ne sont pas encore accessibles, ce qui empêche pour l'instant toute reproduction indépendante des résultats annoncés.
Dans nos dossiers




