VersualRL : apprentissage par renforcement verbal en boucle fermée avec retour visuel pour la planification robotique au niveau des tâches
VersualRL est un système en boucle fermée pour la planification de tâches robotiques qui exploite le retour visuel d'exécution afin d'affiner en continu des arbres de comportement (Behavior Trees) exécutables, via des critiques formulées en langage naturel structuré. L'architecture associe un modèle vision-langage jouant le rôle de critique, chargé d'analyser les observations visuelles et les traces d'exécution de l'arbre de comportement, à un grand modèle de langage jouant le rôle d'acteur, qui applique des mises à jour de politique discrètes et interprétables. Point notable : pendant le déploiement physique, les deux modèles fondation restent gelés, seul l'arbre de comportement est modifié au niveau symbolique, sans optimisation de politique par descente de gradient en ligne. Les auteurs ont validé leur approche sur un robot mobile réel exécutant une tâche de navigation et de manipulation en plusieurs étapes, dans des conditions d'incertitude d'exécution. Le papier, disponible sur arXiv (2603.22169), en est à sa troisième version.
L'intérêt pour l'industrie robotique tient à l'absence de réentraînement par gradient sur le terrain, une contrainte lourde et coûteuse pour du réel. En figeant les modèles fondation et en ne modifiant que la structure symbolique du plan, VersualRL produit un raisonnement traçable et des évolutions de politique compréhensibles par un humain, un atout pour les intégrateurs et décideurs B2B soucieux d'auditabilité et de sécurité plutôt que de politiques neuronales opaques. Cette approche répond directement à l'écart classique entre démonstration et réalité observé sur le terrain, en offrant un mécanisme explicite de correction des échecs d'exécution plutôt qu'un simple ajustement statistique.
Le travail s'inscrit dans une tendance qui combine raisonnement de modèles de fondation et contrôle symbolique classique, les arbres de comportement étant déjà largement utilisés en robotique industrielle pour la prise de décision hiérarchique. Il se distingue des approches bout-en-bout de type VLA (GR00T N2, Helix, Pi-0), qui misent sur des politiques neuronales continues, en privilégiant l'interprétabilité à la dextérité brute. L'abstract ne précise ni calendrier ni extension prévue à des tâches de manipulation plus complexes, laissant ces suites ouvertes.
Dans nos dossiers




