Aller au contenu principal
AdaHVLA : harnais adaptatifs pour l'exécution VLA à horizon long
RecherchearXiv cs.RO 

AdaHVLA : harnais adaptatifs pour l'exécution VLA à horizon long

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente AdaHVLA (Adaptive Harnesses for Long-Horizon Vision-Language-Action Execution), publié sur arXiv sous la référence 2609.29204. Le système ajoute une couche de coordination adaptative aux modèles vision-langage-action (VLA), qui gèrent bien le contrôle local et le suivi d'instructions mais peinent sur les tâches longues nécessitant mémoire et planification. La solution repose sur un "harnais" de tâche, une politique de coordination écrite en code qui conserve l'historique d'exécution et suit la progression, révisée automatiquement à partir de l'expérience du robot. Le processus d'adaptation multi-agent sépare trois contextes de travail distincts : analyse des preuves d'exécution, révision du harnais, et évaluation comportementale des résultats après chaque déploiement. Un graphe de révision relie preuves, hypothèses de coordination testables, révisions et effets observés, en conservant les versions alternatives du harnais pour affiner le système d'une tentative à l'autre et le réutiliser d'une tâche ou d'un environnement à l'autre. En simulation, AdaHVLA fait passer le taux de succès moyen sur le benchmark de navigation longue durée NaVILA-LH de 22,5% à 57,5%, et améliore la manipulation jusqu'à 30,8 points de pourcentage par rapport au harnais initial, sur trois architectures VLA différentes. Un test en conditions réelles est mentionné pour illustrer une exécution plus stable entre les étapes de tâche, mais sans chiffres associés.

Cette approche cible un goulot d'étranglement bien identifié en robotique par apprentissage: les VLA réussissent des commandes courtes mais s'effondrent sur des séquences longues où il faut se souvenir de ce qui a déjà été accompli. Plutôt que de réentraîner le modèle VLA lui-même, AdaHVLA agit au niveau de la coordination externe, ce qui rend la méthode potentiellement portable d'un backbone à un autre, comme le suggèrent les gains observés sur trois architectures distinctes. Pour des intégrateurs envisageant des VLA sur des tâches multi-étapes en logistique ou en usine, ce résultat trace une piste pour réduire l'écart entre démonstration et exécution fiable, sans attendre une nouvelle génération de modèles fondationnels. Les gains chiffrés restent toutefois majoritairement issus de simulation, le volet réel demeurant qualitatif à ce stade.

AdaHVLA s'inscrit dans la lignée des modèles VLA type Pi-0 ou GR00T N2, dont la limite sur les tâches longues est documentée par plusieurs équipes du secteur. La méthode transpose au robotique une idée déjà répandue chez les agents logiciels fondés sur des grands modèles de langage: déléguer mémoire et planification à un harnais externe plutôt qu'au modèle central, via des sous-agents spécialisés qui analysent, révisent et valident les changements. L'article ne précise ni institution ni calendrier de suites, et se présente comme une publication de recherche nouvelle, sans partenaire industriel ni annonce de déploiement commercial à ce jour.

À lire aussi

TemporalFlow-VLA : un historique d'exécution physiquement ancré pour la manipulation robotique à long horizon
1arXiv cs.RO 

TemporalFlow-VLA : un historique d'exécution physiquement ancré pour la manipulation robotique à long horizon

Des chercheurs ont publié en août 2026 sur arXiv (référence 2608.26821) un article présentant TemporalFlow-VLA, un modèle vision-langage-action (VLA) conçu pour la manipulation robotique multi-étapes de longue durée. Le système construit un flux temporel robot-surface à partir des états enregistrés du robot, de sa géométrie et de caméras calibrées, utilisé uniquement comme signal d'entraînement pour superviser deux requêtes temporelles alignées sur l'exécution qui fournissent un historique structuré à l'expert d'action du modèle. Sur le benchmark LIBERO, le système atteint un taux de réussite moyen de 97,63% (+/- 0,26 point), dont 96,60% (+/- 0,87) sur le sous-ensemble LIBERO Long dédié aux tâches longues. Sur RoboTwin, qui regroupe 12 tâches de manipulation, il obtient 85,5% de réussite en conditions propres et 84,2% en conditions randomisées. La voie de supervision géométrique n'intervient qu'à l'entraînement et n'est pas évaluée au déploiement, ce qui, combiné à une mise en cache asynchrone des caractéristiques, permet de conserver une latence d'inférence côté serveur équivalente à celle d'un traitement image par image, sans surcoût lié à l'encodage de l'historique. L'enjeu pointé par les auteurs est concret pour l'industrie: empiler simplement des images historiques dans un modèle VLA ne suffit pas à capter un changement physique récent, en particulier quand deux états visuellement quasi identiques appellent des actions différentes selon ce qui a été exécuté juste avant, un piège classique dans les tâches à plusieurs étapes comme l'empilement ou l'assemblage séquentiel. Des interventions contrôlées sur l'historique fourni au modèle montrent que la prédiction d'action dépend à la fois du contenu de cet historique et de son ordre temporel, confirmant que le raisonnement temporel agit comme un facteur causal de performance et non comme un simple bonus. Pour les intégrateurs et décideurs qui évaluent des piles VLA face à des offres comme Pi-0, GR00T N2 ou Helix, ce travail suggère qu'une part significative de l'écart de performance sur les tâches longues tient moins à la taille du modèle qu'à la façon dont l'historique d'exécution est structuré et injecté, sans alourdir la latence en production. Le papier s'inscrit dans une vague de recherches cherchant à combler l'écart entre démonstrations en laboratoire et généralisation réelle des VLA sur les tâches longues, un problème récurrent du secteur. Il se positionne explicitement en alternative aux approches qui nécessitent une estimation de mouvement ou un traitement géométrique explicite au moment de l'inférence, coûteux en calcul et en latence pour un déploiement en production. Aucun acteur industriel ni site de déploiement commercial n'est mentionné: il s'agit à ce stade d'un travail de recherche évalué uniquement sur les bancs d'essai en simulation LIBERO et RoboTwin, sans validation annoncée sur robot physique ni calendrier de mise en production. Reste à voir si cette approche de supervision temporelle sera reprise par des laboratoires ou fournisseurs de piles VLA commerciales pour la manipulation industrielle de longue durée.

RechercheOpinion
1 source
CheckVLA : vérification à l'exécution par modèle du monde conditionné aux actions pour la manipulation mobile à long horizon
2arXiv cs.RO 

CheckVLA : vérification à l'exécution par modèle du monde conditionné aux actions pour la manipulation mobile à long horizon

Des chercheurs présentent CheckVLA (arXiv:2607.26789v1), un système de vérification en temps d'exécution pour les politiques vision-langage-action (VLA) appliquées à la manipulation mobile sur des tâches longues. Ces politiques exécutent des blocs d'actions en boucle ouverte, c'est-à-dire sans recevoir de nouvelle image tant que le bloc n'est pas terminé, ce qui les rend incapables de réagir à une déviation survenue après le lancement. CheckVLA ajoute un modèle du monde conditionné par l'action, entraîné séparément et figé, qui compare l'observation réelle à ce que le bloc d'actions engagé impliquait. Un seuil de risque calibré par méthode conforme borne la probabilité d'une intervention inutile par épisode et décide du moment où intervenir; son dépassement dose le remplacement du bloc restant, un préfixage sensible à la latence limite ce remplacement aux actions encore déployables, et une banque d'images-clés préserve la trace de la progression à travers les réparations. Sur le benchmark simulé RoboCasa365, à budget d'invocation identique, le taux de réussite moyen atteint 36,1%, contre 27,6% pour une replanification périodique classique, soit un gain de 8,5 points. L'enjeu dépasse le simple gain chiffré: il s'agit de restaurer une boucle de rétroaction dans des politiques qui s'exécutent en aveugle pendant plusieurs pas de temps, exactement là où les démonstrations VLA échouent le plus souvent en conditions réelles, quand un léger dérapage en début de séquence se propage jusqu'à l'échec complet de la tâche. Les résultats montrent qu'un signal conditionné par l'action, plutôt qu'une simple détection d'anomalie sur l'observation, est nécessaire pour distinguer un effet attendu d'une dérive réelle: à un objectif de fausses alertes fixé à 5% par épisode, le rappel de détection utile atteint 77,9% avec conditionnement par l'action, contre 48,6% pour un contrôle basé uniquement sur l'observation et 37,9% pour un contrôle à actions mélangées. L'écart entre démonstrations impressionnantes et fiabilité en production tiendrait donc moins à la politique elle-même qu'à l'absence de vérification adaptée à l'exécution par blocs. Ce travail s'inscrit dans la recherche actuelle sur la fiabilisation des politiques VLA, alors que le secteur multiplie les architectures enchaînant perception, langage et action sur des tâches longues en environnements domestiques ou industriels. Contrairement à la replanification périodique, qui réévalue l'état à intervalles fixes sans tenir compte de ce qui se passe réellement, ou aux détecteurs d'anomalies purement visuels, CheckVLA se positionne comme une couche de vérification générique, ajoutable à une politique existante sans réentraînement. Les auteurs précisent que ces résultats restent obtenus en simulation sur RoboCasa365, et non sur du matériel réel: la généralisation à des robots physiques, avec leurs propres sources de bruit et de latence, reste une question ouverte pour de futurs travaux.

RecherchePaper
1 source
ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon
3arXiv cs.RO 

ChainVLA : enchaînement des requêtes vision-langage-action via un état d'exécution unifié pour la manipulation à long horizon

Une équipe de recherche présente ChainVLA, une politique vision-langage-action (VLA) de 1,2 milliard de paramètres conçue pour la manipulation robotique à long horizon. Le système introduit un "Progress Context", combinant un état de travail récurrent et une mémoire d'événements éparse pour suivre la progression de la tâche à partir des observations, ainsi qu'un "Motion Tail" qui réinjecte la portion non exécutée de la prédiction précédente dans la génération de l'action suivante. Ces deux composants conditionnent un décodeur qui régénère chaque horizon d'action à partir de la dernière observation, permettant à l'état porté de guider la prédiction suivante sans la figer. Sur le benchmark RMBench, ChainVLA atteint 62,8% de réussite moyenne, et 98,8% sur les quatre suites LIBERO. Les ablations montrent l'importance critique de chaque composant : retirer le Motion Tail fait chuter le score RMBench à 11,2%, et retirer le Progress Context à seulement 3,0%. Ce travail cible un problème structurel connu des politiques VLA actuelles à découpage par blocs d'actions ("action-chunked") : à chaque nouvelle requête, le modèle replanifie depuis zéro à partir de l'entrée courante, perdant la continuité entre ce qui a déjà été accompli et ce qui reste à faire. Les approches existantes ne couvrent qu'une partie du problème, soit en préservant la mémoire de tâche à long terme, soit la continuité de mouvement à court terme via la réutilisation ou l'ensembling d'actions, mais pas les deux simultanément. Pour les intégrateurs et chercheurs en robotique manipulatrice, cette lacune du "handoff" entre requêtes successives est directement liée à l'échec des tâches longues et multi-étapes, un point de friction majeur pour le déploiement de VLA en conditions réelles au-delà des démonstrations en laboratoire. L'ampleur des écarts de performance observés dans les ablations suggère que la continuité de mouvement joue un rôle clé pour préserver le flux d'observations dont dépend l'inférence de progression, un mécanisme jusqu'ici sous-exploré. Le papier, publié sur arXiv (2608.02326v1) début août 2026, s'inscrit dans la lignée des travaux récents sur les politiques VLA à grande échelle comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à améliorer la robustesse des robots manipulateurs sur des tâches complexes et prolongées. ChainVLA se positionne comme une réponse ciblée à la limite du replanning répété à chaque requête, un défaut partagé par de nombreuses architectures action-chunked actuelles. Les benchmarks utilisés, RMBench et LIBERO, sont des références standard du domaine pour évaluer la manipulation robotique, ce qui permet une comparaison directe avec les approches concurrentes. Le document ne précise pas de calendrier de déploiement matériel ni de partenariat industriel identifié à ce stade ; il s'agit pour l'instant d'un travail de recherche évalué en simulation et sur benchmarks standardisés, sans validation annoncée sur robot physique en conditions réelles de production.

RechercheActu
1 source
SparkVLA : un VLA hiérarchique conscient des arrêts, avec segmentation d'action adaptative pour la manipulation à long horizon
4arXiv cs.RO 

SparkVLA : un VLA hiérarchique conscient des arrêts, avec segmentation d'action adaptative pour la manipulation à long horizon

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.16172) SparkVLA, une architecture hiérarchique Vision-Language-Action conçue pour la manipulation robotique sur des tâches longues et multi-étapes. Le système règle un problème d'interface récurrent : à chaque point de ré-observation, il faut décider si la sous-tâche en cours s'arrête et jusqu'où exécuter le segment d'actions proposé, deux choix interdépendants que les architectures existantes évaluaient jusqu'ici séparément. SparkVLA les fusionne en un seul classement, où l'option d'arrêt est mise en concurrence avec chaque longueur possible de préfixe d'actions et le meilleur score l'emporte, sans seuil à régler manuellement. Le mécanisme repose sur deux modules : un encodeur contextuel ancré qui met en cache une représentation de la sous-tâche tenant compte de l'historique pour guider l'élagage des tokens visuels vers les zones pertinentes, et une tête de sélection qui note tous les candidats par auto-attention aux frontières des segments. Sur le benchmark RoboCerebra, SparkVLA atteint 47,12% de réussite, soit 30,57 points de plus que la référence hiérarchique officielle et 26,83 points de plus que la meilleure méthode reproductible connue, des gains confirmés par des essais complémentaires sur robot réel. Ce résultat cible un goulot d'étranglement classique des VLA hiérarchiques, où un module de planification en langage naturel et un module d'exécution bas niveau doivent se synchroniser : un mauvais calibrage provoque des arrêts prématurés ou des segments trop longs qui font dériver le robot sur les tâches à plusieurs étapes, l'un des écarts récurrents entre démonstrations en simulation et comportement réel. Pour les équipes qui construisent des pipelines de manipulation multi-étapes (kitting, assemblage, logistique), l'intérêt tient aussi à la méthode d'entraînement : SparkVLA ne requiert que des préférences ordinales hors ligne, moins coûteuses à collecter que des récompenses denses. Il s'agit toutefois d'un résultat de recherche mesuré sur un benchmark académique, complété par des essais robot réel que les auteurs présentent eux-mêmes comme de portée limitée, et non d'un produit déployé ou commercialisé. Le travail s'inscrit dans la lignée des modèles VLA hiérarchiques, qui séparent un raisonnement haut niveau découpant l'instruction en sous-tâches d'une politique d'action bas niveau entraînée par imitation, une famille d'architectures étudiée pour dépasser les limites des politiques VLA monolithiques sur l'horizon long. Sa contribution se distingue des approches à découpage d'actions de longueur fixe en rendant la longueur du segment exécuté adaptative et couplée à la décision d'arrêt. L'article compare ses résultats à la référence hiérarchique officielle du benchmark RoboCerebra et à la meilleure méthode reproductible publiée à ce jour, sans nommer d'acteur industriel ni annoncer de calendrier de mise à disposition du code, de partenariat ou de pilote de déploiement.

RechercheActu
1 source