
ForceRFT : affiner les actions VLA par apprentissage par renforcement résiduel guidé par la force
Des chercheurs publient ForceRFT, un framework de reinforcement learning résiduel guidé par la force pour affiner des politiques vision-language-action (VLA) sensibles au contact, décrit dans un preprint arXiv (2609.22840). Le système combine un modèle prioritaire gelé, basé sur SmolVLA et entraîné par démonstrations, qui génère des blocs d'actions conditionnés par la force, avec un acteur résiduel léger ajustant en temps réel les commandes de pose de l'effecteur terminal à partir du retour de force et de couple mesuré au poignet pendant l'exécution. Les corrections humaines supervisent cet acteur résiduel, tandis que les transitions autonomes vérifiées entraînent des critiques jumelées qui guident des mises à jour additionnelles par valeur, le calcul de différence temporelle étant restreint aux seuls segments autonomes pour éviter toute contamination du signal à travers les interventions humaines. Testé sur robot réel sur trois tâches, insertion de prise électrique, assemblage anneau sur tige et essuyage de tableau blanc, ForceRFT atteint des taux de succès autonomes supérieurs à ceux des politiques entraînées uniquement par démonstration et des références d'imitation résiduelle.
L'enjeu dépasse la performance sur trois tâches de laboratoire. Les politiques VLA conditionnées par la force promettent de gérer le contact physique, mais leur capacité de récupération reste bridée par la couverture des démonstrations, et elles n'apprennent jamais directement des résultats de déploiement, un angle mort classique de l'imitation pure. En couplant supervision humaine ciblée et apprentissage par renforcement sur les issues réelles des tentatives autonomes, ForceRFT propose une voie pour réduire l'écart entre démonstration et robustesse en production, un enjeu central pour les intégrateurs déployant des bras robotiques sur des tâches d'assemblage de précision où un échec silencieux coûte cher en reprise. Les résultats indiquent aussi qu'un ajustement résiduel piloté par la valeur capte mieux les corrections qu'une imitation résiduelle classique, et que le retour de force exploité au moment même de l'exécution, plutôt qu'en post-traitement, apporte un gain mesurable, comme le montrent les ablations menées sur la tâche d'insertion.
Le travail s'inscrit dans la lignée des politiques VLA légères open source comme SmolVLA, ici utilisée comme prior gelé plutôt que réentraînée, une approche qui limite le coût de calcul en concentrant l'apprentissage par renforcement sur une couche résiduelle plus simple à stabiliser que le réseau complet. Il se positionne explicitement contre les approches d'imitation résiduelle pure, auxquelles les auteurs le comparent pour justifier l'apport du guidage par la valeur. Publié comme preprint de recherche, ForceRFT reste à ce stade une contribution évaluée en laboratoire sur un nombre restreint de tâches de contact, sans indication de partenariat industriel ni de calendrier de déploiement; la suite logique évoquée est l'extension à davantage de tâches et la validation de la généralisation du signal de force au-delà des trois scénarios testés.
Dans nos dossiers




