
H-VLA : modèle vision-langage-action hiérarchique avec raisonnement par actions clés et planification de mouvement dans un espace d'action unifié
Une équipe de recherche présente H-VLA, un modèle vision-langage-action hiérarchique pour la manipulation robotique, publié le 22 septembre 2026 sur arXiv (2609.22895). Contrairement aux VLA classiques, qui traduisent langage et images en actions continues et deviennent fragiles si la position des objets, la scène ou la caméra changent, H-VLA sépare le raisonnement de haut niveau de la génération du mouvement. L'architecture combine un Key-Action Model, qui prédit le sous-objectif de manipulation suivant, un Motion Planning Model, qui génère les actions denses correspondantes, et un espace d'action unifié centré sur la caméra. L'entraînement se fait en deux étapes: raisonnement sur les actions clés au pré-entraînement, puis génération de mouvement dense au fine-tuning. Sur le simulateur SimplerEnv, H-VLA atteint 91% de réussite sur Google Robot en configuration standard, 84% en variantes, et 81% sur WidowX; sur robot réel Agilex, il dépasse la meilleure référence de 10, 47 et 16 points selon que les conditions sont connues, la position d'objet est inédite, ou la scène et les objets sont inédits.
Ces résultats visent le point faible des VLA en usage réel: la chute de performance quand un objet bouge ou que la caméra change. Le gain de 47 points en généralisation de position sur robot réel est le chiffre le plus parlant pour les intégrateurs, cet écart entre démonstration contrôlée et production freinant aujourd'hui l'adoption industrielle des VLA. Si cette approche hiérarchique, séparer quoi faire et comment le faire, se confirme au-delà des bancs d'essai internes, elle pourrait réduire le réentraînement nécessaire à chaque nouveau site, un enjeu de coût central pour les décideurs B2B.
H-VLA s'inscrit dans la lignée des VLA existants, RT-2 et OpenVLA en recherche, Pi-0 de Physical Intelligence, GR00T de NVIDIA, Helix de Figure AI, tous confrontés au même problème de généralisation spatiale que H-VLA attaque par découplage hiérarchique plutôt que par mise à l'échelle des données. L'article, non encore revu par les pairs, limite les essais réels à la plateforme Agilex, sans partenariat industriel annoncé. Reste à voir si l'architecture sera reprise ailleurs et si les gains tiennent sur des tâches plus longues et des robots variés.
Dans nos dossiers




