StructRL : apprentissage par renforcement structuré en ligne pour les tâches vision-langage-action à long horizon
Des chercheurs d'Amazon proposent StructRL, un cadre d'apprentissage par renforcement (RL) en ligne destiné à améliorer les modèles vision-langage-action (VLA) sur des tâches longues, c'est-à-dire celles qui exigent plusieurs manipulations dépendantes à partir d'une seule consigne. La méthode découpe chaque tâche en sous-tâches vérifiables. Elle n'accorde une récompense intermédiaire qu'une fois les sous-tâches prérequises accomplies, puis module cette récompense selon le rythme d'achèvement. Les tests portent sur deux bancs d'essai, RoboCasa365 et LIBERO-Long, avec deux modèles de base, GR00T-N1.5 de NVIDIA et pi 0.5 de Physical Intelligence. Selon les auteurs, StructRL dépasse de façon constante les méthodes de RL en ligne auxquelles il est comparé. Le résumé ne donne pas de taux de réussite chiffrés, et le code est publié sur le dépôt GitHub d'Amazon Science. Il s'agit d'un travail de recherche, sans produit ni déploiement associé.
Ce résultat vise un point faible connu des VLA. Ces modèles fonctionnent correctement sur des manipulations courtes, mais leurs performances se dégradent quand les étapes s'enchaînent, car une erreur précoce compromet toute la suite. La plupart des approches de RL en ligne ne récompensent qu'à la réussite complète de la tâche. Ce signal est très rare et ne distingue pas un échec immédiat d'une séquence presque réussie. En structurant la supervision autour de sous-tâches dont l'accomplissement se vérifie, StructRL donne un gradient exploitable sans recourir à un modèle de récompense appris, plus fragile. Pour un intégrateur, l'enjeu est concret : les tâches utiles en cuisine, en logistique ou en assemblage sont presque toujours longues. Cela suggère aussi que le post-entraînement par RL, et pas seulement l'imitation, pourrait devenir l'étape qui fait passer un VLA de la démonstration à la fiabilité.
Il faut toutefois rester prudent. Les évaluations se font en simulation, et le cadre suppose qu'on puisse définir et détecter automatiquement chaque sous-tâche. C'est simple dans un simulateur, beaucoup moins dans un atelier réel, où il faut des capteurs ou des vérificateurs fiables. Le passage au monde physique reste donc à démontrer. Le travail s'inscrit dans une tendance déjà visible : affiner des modèles généralistes comme GR00T ou la famille pi par RL, face à des approches concurrentes fondées sur des modèles de récompense appris ou sur des démonstrations supplémentaires. La suite logique sera de tester la méthode sur robot réel et sur d'autres architectures de VLA.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




