
RouteRLT : apprendre quand et quel spécialiste RL doit contrôler une politique vision-langage-action
Des chercheurs ont présenté RouteRLT, un système d'orchestration qui décide en temps réel quand transférer le contrôle d'un modèle vision-langage-action (VLA) généraliste à un spécialiste entraîné par apprentissage par renforcement (RL) pour une phase précise d'une tâche manipulatrice, comme l'insertion de connecteurs ou la gestion de câbles. Le framework combine un sélecteur de phase identifiant le contrôleur actif, un stabilisateur limitant les bascules trop fréquentes, et un gestionnaire de frontières gérant les transitions entre sorties de politiques produites par blocs. Il a été testé sur des tâches multi-objets du simulateur LIBERO et sur une tâche réelle de prise de câble et d'insertion de port. En simulation, le routage appris égale un routage « oracle » disposant des frontières de phase réelles, sans y avoir accès au déploiement ; sur robot réel, il valide automatiquement le basculement vers les spécialistes de prise et d'insertion. Publié sur arXiv (2609.26467), ce travail reste un résultat de recherche, sans partenaire industriel ni calendrier de commercialisation annoncés.
Ce travail cible une friction bien connue dans la manipulation robotisée : les modèles VLA généralistes, entraînés par clonage comportemental sur de vastes corpus de démonstrations, excellent en polyvalence mais échouent souvent sur les phases exigeant une précision fine, typiques des tâches industrielles à fort contact comme le câblage électronique. Le remède habituel, un fine-tuning RL du modèle entier, risque de dégrader ce comportement généraliste. En approchant les performances d'un routage oracle sans y accéder en production, RouteRLT esquisse une architecture alternative, généraliste plus spécialistes RL orchestrés, potentiellement plus praticable pour les intégrateurs que le pari d'un modèle unique capable de tout faire avec la même précision.
L'approche prolonge les travaux récents associant modèles VLA préentraînés et affinage par renforcement pour combler l'écart entre démonstration et exécution fiable, sans réentraîner l'intégralité du modèle de base. Les auteurs restent prudents sur la portée de leurs résultats : l'évaluation réelle se limite à une seule tâche de câblage à plusieurs étapes, sous un protocole de transfert aligné avec un opérateur humain, et aucun passage à un produit commercial n'est évoqué. La suite logique suggérée serait d'élargir le nombre de spécialistes RL disponibles et la diversité des tâches testées avant d'envisager une intégration dans des pipelines industriels réels.
Dans nos dossiers




