Causeway : restaurer l'accessibilité des tâches pour le changement d'instructions dans les politiques VLA
Des chercheurs ont publié le 30 septembre 2026 sur arXiv (2609.30913v1) un article intitulé "Causeway: Restoring Task Accessibility for Instruction Switching in VLA Policies", qui s'attaque à un problème concret des politiques vision-langage-action (VLA) : une tâche exécutée de façon fiable depuis un état initial standard devient souvent impossible à réaliser si le robot vient d'en terminer une autre, son état physique ayant changé entre-temps. Les auteurs baptisent ces états inaccessibles des "task islands". Leur solution, Causeway, est une intervention sans entraînement appliquée au moment de l'inférence : à partir de l'état courant et d'une pose de réentrée pour la tâche cible, elle rétropropage à travers le calcul de décodage gelé du modèle et applique une écriture ciblée dans la représentation du flux d'actions, laissant le VLA générer lui-même le mouvement de retour, sans mise à jour de paramètres, sans nouvelle tête d'action ni générateur externe. Testée sur 71 paires d'objets croisées, trois moments de changement de consigne et trois architectures VLA différentes sur le benchmark LIBERO-Goal, la méthode fait passer le taux de réussite du changement d'instruction "brut" de 3-26% à 47-65%, et améliore de 42 à 72 points de pourcentage le taux d'atteinte de la zone de transfert intermédiaire, selon les modèles.
Ce résultat pointe un angle mort de l'évaluation actuelle des VLA : la quasi-totalité des benchmarks testent une tâche unique depuis un état initial propre, alors qu'un déploiement industriel réel implique des changements d'instructions en cours d'exécution, par exemple une interruption humaine ou une réorganisation de la file de tâches. Un taux de réussite de base aussi bas que 3 à 26% en cas de changement de consigne illustre un écart net entre les démonstrations contrôlées et la robustesse nécessaire en production. Pour les intégrateurs et décideurs B2B, l'intérêt de Causeway tient surtout à son caractère training-free : un correctif à l'inférence, applicable sans réentraînement ni collecte de données supplémentaire, est nettement moins coûteux à déployer qu'un fine-tuning spécifique.
Le travail s'inscrit dans la vague de recherche sur les politiques VLA généralistes, où un même modèle doit enchaîner des tâches de manipulation à partir d'instructions en langage naturel plutôt que de politiques spécialisées par tâche. Les expériences complémentaires sur LIBERO-Object et sur un bras réel xArm indiquent que la récupération d'accessibilité ne se limite pas au cadre principal LIBERO-Goal et se transfère, au moins partiellement, du simulateur au robot physique. L'article est un dépôt arXiv récent, non encore validé par relecture par les pairs, et ne précise pas de calendrier d'intégration dans des piles VLA commerciales.
Dans nos dossiers




