Récompense dense généralisable pour les tâches robotiques à long horizon
Des chercheurs proposent VLLR, un cadre de récompense dense destiné à affiner par apprentissage par renforcement (RL) des politiques robotiques pré-entraînées par imitation, sans écrire de fonction de récompense à la main pour chaque tâche. Il combine deux signaux. Le premier est une récompense extrinsèque. Un grand modèle de langage (LLM) découpe la tâche en sous-tâches vérifiables, puis un modèle vision-langage (VLM) estime l'avancement. Cette estimation initialise la fonction de valeur pendant une courte phase de préchauffage. Le VLM n'est donc pas appelé à chaque pas, ce qui évite un coût d'inférence prohibitif. Le second signal est intrinsèque : l'auto-certitude de la politique (self-certainty) guide chaque pas pendant tout l'affinage par PPO. Sur le benchmark CHORES (manipulation mobile et navigation), VLLR gagne jusqu'à 56 points de taux de succès absolu sur la politique de départ. Il gagne jusqu'à 5 points face aux méthodes d'affinage RL de l'état de l'art sur les tâches connues, et jusqu'à 10 points sur les tâches hors distribution.
Le travail s'attaque à un point faible connu des modèles de fondation robotiques, l'imitation à grande échelle. Face à une dérive de distribution, les erreurs s'accumulent sur les tâches longues. Le RL peut corriger cela, mais il bute sur l'ingénierie manuelle des récompenses, qui ne passe pas à l'échelle sur des tâches variées. Les ablations montrent des effets complémentaires. L'initialisation par VLM améliore surtout l'efficacité d'exécution, tandis que l'auto-certitude améliore surtout le taux de succès, notamment hors distribution. L'écart de 5 points sur les tâches connues reste modeste. L'apport principal est la suppression de l'ingénierie de récompense, pas un gain de performance spectaculaire.
Les résultats portent sur un benchmark académique. Le résumé ne mentionne ni robot réel, ni temps de cycle, ni déploiement, et les visualisations sont publiées sur une page de projet. Les gains « jusqu'à » sont des maxima, sans détail par tâche ici. Le travail s'inscrit dans la tendance des politiques vision-langage-action (VLA) affinées après un pré-entraînement par imitation. Il se compare aux approches RL qui exigent encore des récompenses spécifiques, ou des signaux de VLM trop coûteux pour être appelés tout au long de l'entraînement. La suite logique serait une validation sur matériel réel et sur des tâches plus longues. C'est ce qui dira si le préchauffage par VLM suffit hors simulation.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




