Trouve ce que tu ne sais pas faire : apprentissage par renforcement en conditions réelles à base d'agents pour des modèles VLA auto-améliorants
Des chercheurs proposent FIND, un cadre d'apprentissage par renforcement (RL) en conditions réelles qui permet à un modèle vision-langage-action (VLA) de s'améliorer seul à partir de ses propres échecs. Le dispositif repose sur un VLA π0.5 gelé, complété par un RL « off-policy » résiduel, c'est-à-dire une couche de correction apprise sans toucher aux poids du modèle de base. Sur huit tâches de manipulation réelles, le taux de succès, évalué indépendamment par des humains, passe de 55 % à 71,9 %. Une exécution représentative enchaîne 456 épisodes autonomes en 6 heures d'interaction, avec 30 interventions humaines de remise en ordre de la scène et aucune étiquette de récompense fournie par un humain pendant l'apprentissage en ligne. Un site de projet (FIND.github.io) est annoncé. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel.
L'enjeu porte sur deux verrous du RL en monde réel : les remises à zéro manuelles de l'environnement après chaque essai et la supervision du succès par un opérateur. FIND les contourne. Plutôt que de restaurer une scène prédéfinie, un agent vision-langage observe l'état obtenu après chaque essai, choisit dans une bibliothèque prédéfinie les tâches réalisables, privilégie celles au taux de succès récent le plus faible et juge le résultat en comparant les images avant et après exécution. La pratique devient ainsi un problème de sélection de tâches conditionnée par la scène et par la performance. Pour un intégrateur, cela esquisse des VLA qui progressent sur site sans cellule de reset dédiée ni annotation continue. Des réserves s'imposent : le gain reste de 17 points environ, le plafond est inférieur à 72 %, le périmètre se limite à huit tâches d'une bibliothèque fixe, et 30 interventions humaines subsistent. La fiabilité du juge visuel est examinée dans les ablations, ce qui reste le point à vérifier, car une erreur d'évaluation se propage directement à la politique.
Ces travaux s'inscrivent dans la série des modèles π0 puis π0.5 de Physical Intelligence, généralement déployés comme politiques figées après pré-entraînement et affinage supervisé. Le RL en monde réel sur ces modèles, déjà exploré par d'autres équipes, se heurtait aux coûts humains que FIND cherche à réduire. L'approche rejoint les boucles d'auto-amélioration revendiquées par des acteurs comme Physical Intelligence, Figure ou Tesla, sans que leurs résultats soient comparables, faute de protocole commun. Les suites probables sont l'extension à des bibliothèques de tâches ouvertes, la réduction des interventions restantes et des tests sur d'autres VLA ou en conditions de production.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



