TaskAnchor : ancrer l'état de la tâche dans des VLA réactifs pour la manipulation à long horizon
Un article publié sur arXiv en septembre 2026 (référence 2609.23580) présente TaskAnchor, un adaptateur léger pour les modèles vision-langage-action (VLA) réactifs utilisés en manipulation robotique à long horizon. Les auteurs décrivent un problème qu'ils nomment « aliasing d'état de tâche » : deux observations visuelles presque identiques peuvent exiger des actions différentes selon l'étape de la tâche, ce qui fait échouer les modèles purement réactifs. TaskAnchor combine un raffinement visuel conditionné par l'historique d'exécution et une coordonnée d'état de tâche, un scalaire supervisé par jalons injecté via les interfaces visuelle et langagière natives du modèle, sans planificateur ni modification du mécanisme de génération d'actions. Sur le benchmark RMBench, il multiplie par 4,9 à 5,5 le taux de succès moyen des modèles π0.5 et X-VLA, avec des gains similaires sur RoboMemArena et sur robots réels, pour un surcoût de seulement 2,08 millisecondes par segment d'action sur π0.5.
Le résultat cible un angle mort des VLA génériques, qui fonctionnent en boucle réactive sans mémoire explicite du travail déjà accompli et échouent dès qu'une tâche comporte plusieurs étapes visuellement ambiguës. Pour les intégrateurs qui évaluent des VLA pour des cellules industrielles ou logistiques, cela montre qu'un module additionnel peu coûteux en calcul peut réduire l'écart entre démonstrations de laboratoire et exécution fiable de séquences longues, sans réentraîner le modèle de base. Cela nuance aussi l'idée que le seul passage à l'échelle des VLA suffirait à résoudre la robustesse sur les tâches longues : le goulot d'étranglement semble autant architectural, l'absence de représentation d'état, qu'une question de volume de données d'entraînement.
π0.5, développé par Physical Intelligence, et X-VLA servent de bases de comparaison et illustrent la génération actuelle de modèles VLA génériques pilotant bras et robots mobiles à partir d'instructions en langage naturel. TaskAnchor s'inscrit dans un courant de recherche visant à doter ces modèles d'une mémoire de progression de tâche, un axe distinct de la course aux plateformes humanoïdes mais déterminant pour l'exécution de tâches industrielles multi-étapes. L'affiliation des auteurs n'est pas précisée dans le résumé, et le travail reste une contribution académique évaluée sur benchmarks de simulation et essais robots limités, sans annonce de produit, de partenariat industriel ni de calendrier de déploiement.




