CAPABLE : adaptation de politique selon les capacités par encodage latent comportemental
Des chercheurs proposent CAPABLE (Capability-Aware Policy Adaptation via Behavioral Latent Encoding), un cadre d'adaptation destiné aux politiques vision-langage-action (VLA) gelées confrontées à une panne d'articulation. Une VLA suppose l'embodiment sur lequel elle a été entraînée, et peut échouer quand un défaut modifie la manière dont les commandes sont exécutées physiquement. CAPABLE infère en ligne la « capacité » de chaque joint, c'est-à-dire la part du mouvement commandé réellement réalisée et sa contribution au comportement de l'effecteur. Il s'appuie sur l'historique commande-réponse et la cinématique, avec un encodeur temporel partagé entre les joints, un ancrage par la jacobienne, une attention inter-joints et une prédiction physique auto-supervisée. Cette représentation conditionne une politique résiduelle, entraînée par apprentissage par renforcement, qui ajoute des corrections bornées à l'action du bras produite par la VLA, sans étiquette de panne ni identifiant du joint défaillant. Sur 28 tâches LIBERO, le taux de réussite avec un actionneur exclu de l'entraînement aux pannes passe de 24,8 % à 59,3 %. Le gain est de 17,4 points face à une base de référence à historique global de même nombre de paramètres, sans dégrader les performances à l'état sain. Des expériences « leave-one-actuator-out » sur six joints montrent que le transfert ne dépend pas d'un actionneur particulier. Des évaluations complémentaires portent sur des familles de pannes inédites, ainsi qu'une démonstration de récupération sur un Franka Panda réel.
L'intérêt tient à la méthode. La plupart des approches de récupération sur panne exigent un réentraînement par tâche, des étiquettes de défaut, un diagnostic explicite ou des informations privilégiées sur l'embodiment, ce qui les rend peu praticables en exploitation. Ici, la VLA reste figée et seule une couche résiduelle légère s'adapte, ce qui préserve l'investissement dans un modèle de fondation. Pour un intégrateur ou un exploitant de flotte, la dégradation d'un actionneur (usure, jeu, couple réduit) est un cas courant, et une robustesse sans maintenance du modèle serait précieuse. Les résultats appellent toutefois à la prudence. Un taux de 59,3 % reste loin d'une fiabilité industrielle, et le gain est mesuré en simulation sur LIBERO, un banc d'essai de manipulation sur table. La validation physique se limite à une démonstration sur un seul bras, sans statistiques annoncées. Le résultat montre surtout que l'inférence de capacité à partir de l'historique de mouvement généralise entre articulations, pas que le problème est résolu.
Ce travail s'inscrit dans le constat que les VLA actuelles sont entraînées sur un embodiment supposé intact. Elles ont progressé en généralisation sémantique et en tâches, mais restent fragiles face à un changement de dynamique du robot lui-même. Les approches voisines relèvent de l'adaptation en ligne, de l'identification de système et de la randomisation de domaine, souvent avec des étiquettes ou un réentraînement. CAPABLE se positionne comme un adaptateur modulaire, compatible avec une VLA gelée. La suite logique serait de tester d'autres plateformes, des pannes combinées et des tâches longues, avec davantage d'essais réels. Le code et les démonstrations sont annoncés sur la page du projet, capable-vla.github.io. Il s'agit d'un preprint arXiv (v1), non encore évalué par les pairs.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




