
AdaHVLA : harnais adaptatifs pour l'exécution VLA à horizon long
Une équipe de recherche présente AdaHVLA (Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution), publié sur arXiv sous la référence 2609.29204. Le système ajoute une couche de coordination adaptative aux modèles vision-langage-action (VLA), qui gèrent bien le contrôle local et le suivi d'instructions mais peinent sur les tâches longues nécessitant mémoire et planification. La solution repose sur un "harnais" de tâche, une politique de coordination écrite en code qui conserve l'historique d'exécution et suit la progression, révisée automatiquement à partir de l'expérience du robot. Le processus d'adaptation multi-agent sépare trois contextes de travail distincts : analyse des preuves d'exécution, révision du harnais, et évaluation comportementale des résultats après chaque déploiement. Un graphe de révision relie preuves, hypothèses de coordination testables, révisions et effets observés, en conservant les versions alternatives du harnais pour affiner le système d'une tentative à l'autre et le réutiliser d'une tâche ou d'un environnement à l'autre. En simulation, AdaHVLA fait passer le taux de succès moyen sur le benchmark de navigation longue durée NaVILA-LH de 22,5% à 57,5%, et améliore la manipulation jusqu'à 30,8 points de pourcentage par rapport au harnais initial, sur trois architectures VLA différentes. Un test en conditions réelles est mentionné pour illustrer une exécution plus stable entre les étapes de tâche, mais sans chiffres associés.
Cette approche cible un goulot d'étranglement bien identifié en robotique par apprentissage: les VLA réussissent des commandes courtes mais s'effondrent sur des séquences longues où il faut se souvenir de ce qui a déjà été accompli. Plutôt que de réentraîner le modèle VLA lui-même, AdaHVLA agit au niveau de la coordination externe, ce qui rend la méthode potentiellement portable d'un backbone à un autre, comme le suggèrent les gains observés sur trois architectures distinctes. Pour des intégrateurs envisageant des VLA sur des tâches multi-étapes en logistique ou en usine, ce résultat trace une piste pour réduire l'écart entre démonstration et exécution fiable, sans attendre une nouvelle génération de modèles fondationnels. Les gains chiffrés restent toutefois majoritairement issus de simulation, le volet réel demeurant qualitatif à ce stade.
AdaHVLA s'inscrit dans la lignée des modèles VLA type Pi-0 ou GR00T N2, dont la limite sur les tâches longues est documentée par plusieurs équipes du secteur. La méthode transpose au robotique une idée déjà répandue chez les agents logiciels fondés sur des grands modèles de langage: déléguer mémoire et planification à un harnais externe plutôt qu'au modèle central, via des sous-agents spécialisés qui analysent, révisent et valident les changements. L'article ne précise ni institution ni calendrier de suites, et se présente comme une publication de recherche nouvelle, sans partenaire industriel ni annonce de déploiement commercial à ce jour.
Dans nos dossiers




