Plans rapides, actions fidèles : combler l'écart entre planification et exécution dans les modèles VLA hiérarchiques
Une équipe de recherche publie sur arXiv (2609.30833) une étude sur les systèmes hiérarchiques vision-langage-action (VLA), où un planificateur vision-langage pilote un module d'action bas niveau. Sur un pipeline de waypoints adapté du modèle Pi-0.5 de Physical Intelligence, le décodage token par token (Token-AR) du planificateur exige jusqu'à 57 passes du modèle vision-langage par plan, un coût incompatible avec le temps réel ; effacer les points d'arrivée des trajectoires ne dégrade quasiment pas le taux de réussite. La solution proposée, un décodage par blocs (Block-AR) combiné à une modulation d'objectif normalisée (NGM), fait tomber ce nombre de passes de 57 à 8 sur le benchmark LIBERO et divise par 8,7 la latence sur un robot bimanuel Rokae, tandis que le taux de réussite sur LIBERO-Long grimpe de 91,0% à 96,2% et la moyenne des quatre suites de 95,85% à 98,45%.
Ce travail met en lumière un angle mort des architectures VLA hiérarchiques, popularisées par des modèles comme GR00T N2 de NVIDIA ou Helix de Figure : la course actuelle privilégie les capacités du planificateur, alors que l'étude situe le véritable goulot d'étranglement dans l'articulation entre plan et exécution. Que des plans tronqués ou peu exploités n'affectent pas les performances contredit l'idée qu'une planification plus détaillée garantit plus de fiabilité. Pour les intégrateurs, la latence des VLM reste le principal frein à un déploiement en cadence réelle ; la diviser par plus de huit sans perte de précision, avec un gain de près de trois points sur les tâches longues, indique qu'un contrôle temps réel est atteignable sans sacrifier le raisonnement vision-langage.
Le pipeline de référence s'appuie sur Pi-0.5, le modèle VLA hiérarchique de Physical Intelligence, dont l'approche par waypoints s'inscrit dans le même courant que GR00T N2 (NVIDIA) ou Helix (Figure). Il s'agit d'une contribution de recherche algorithmique, validée en simulation sur LIBERO et testée sur un bras bimanuel Rokae, non d'un produit commercialisé ni d'un déploiement industriel. Sans calendrier d'intégration à une plateforme commerciale annoncé, la publication vise à documenter une méthode reproductible pour réduire le coût de calcul des VLA hiérarchiques tout en renforçant la fidélité entre plan et action, une piste que d'autres laboratoires travaillant sur des architectures similaires pourraient reprendre.
Dans nos dossiers




