eRLT : apprentissage par renforcement efficace pour les VLA grâce au routage des tokens pertinents pour l'action
Des chercheurs proposent eRLT, une méthode qui adapte par apprentissage par renforcement (RL) en ligne un modèle Vision-Langage-Action (VLA) dont les poids restent gelés. Le point de départ est l'efficacité en échantillons : elle dépend de la qualité de la représentation d'état fournie à l'acteur et au critique. Les approches existantes utilisent soit des encodeurs visuels indépendants du VLA, soit une compression fixe de ses représentations internes. eRLT construit cette représentation en acheminant l'information utile à l'action à travers les tokens et les couches du VLA. Des « tokens de routage » appris agrègent les caractéristiques visuo-linguistiques à plusieurs profondeurs. Un routeur de couches léger fusionne ensuite ces résumés en un unique « token RL » de dimension fixe. Le module est d'abord initialisé sur des démonstrations expertes, pour capter les caractéristiques qui prédisent les actions de l'expert. Il est ensuite affiné avec le retour du critique pendant les interactions en ligne, afin d'améliorer l'estimation de la valeur des actions. Sur sept tâches des benchmarks LIBERO et RoboTwin, la méthode améliore l'aire sous la courbe d'apprentissage normalisée (AUC) moyenne jusqu'à 23,7 % par rapport aux références représentatives. Sur robot réel, l'insertion d'un connecteur USB et celle d'un câble ruban de carte mère progressent respectivement de 108,9 % et 46,7 % d'AUC face à la meilleure référence.
L'enjeu tient à la dernière étape du déploiement des VLA. Ces modèles fournissent de bons a priori comportementaux, mais les adapter à une tâche de précision reste coûteux en essais physiques. Les deux tâches réelles retenues, des insertions de connecteurs et de nappes, relèvent de l'assemblage électronique, où la tolérance est faible et où les démonstrations seules suffisent rarement. Si l'idée se confirme, elle réduirait le temps de mise au point sur site, un coût que supportent les intégrateurs. Elle suggère aussi que le goulot d'étranglement n'est pas toujours le modèle de base, mais la façon d'en extraire un état exploitable pour le RL. Il faut toutefois relativiser. Les gains sont exprimés en AUC relative, une mesure de vitesse d'apprentissage, et non en taux de réussite final, en temps de cycle ou en fiabilité sur de longues séries. Les résultats réels portent sur deux tâches, sans volumes ni durées d'essai communiqués dans ce résumé.
Ce travail s'inscrit dans le courant de l'adaptation par RL de VLA gelés, qui cherche à dépasser le simple clonage de comportement. Il se positionne contre deux familles de référence : les encodeurs visuels séparés du VLA et la compression fixe de ses représentations. LIBERO et RoboTwin sont des benchmarks de simulation très utilisés, ce qui facilite la comparaison mais n'équivaut pas à un déploiement industriel. Il s'agit d'une prépublication arXiv (v1), sans pilote ni calendrier annoncés. Les prochaines étapes à surveiller sont une validation sur davantage de tâches et de plateformes, ainsi qu'une mesure du coût de calcul réel et de la robustesse face aux variations de conditions, des critères décisifs pour une adoption en atelier.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




