De la préformation à la maîtrise : apprentissage par renforcement des sous-tâches en conditions réelles pour la manipulation à long horizon, avec intervention humaine minimale
PARTS (Policy Adaptation with RL on Targeted Subtasks) est un cadre d'apprentissage par renforcement qui corrige les échecs récurrents des politiques robotiques préentraînées sur des tâches longues, décrit dans un preprint arXiv (2609.21788) publié en septembre 2026. La politique de base reste gelée pour les actions nominales, tandis que des sélecteurs et vérificateurs de succès générés automatiquement déclenchent des corrections résiduelles ciblées sur les sous-tâches en échec et distribuent des récompenses locales, même quand les succès complets restent rares ; les humains se limitent à repérer ces points de blocage et à effectuer les réinitialisations physiques. Le taux de succès complet grimpe de 32% à 61% sur des tâches bimanuelles avec la plateforme YAM, et de 50% à 95% sur des tâches à bras unique avec un robot Franka (Franka Emika, Allemagne), pour quelques dizaines de minutes de rollouts réels par tâche en moyenne.
Ce résultat répond à un problème connu du secteur : les politiques de type VLA impressionnent souvent en démonstration mais s'effondrent sur quelques étapes critiques au déploiement, et le fine-tuning par RL à récompense éparse peine à résoudre des tâches longues. En montrant qu'une correction ciblée sur les seules sous-tâches en échec comble l'essentiel de l'écart avec quelques dizaines de minutes de collecte réelle et une supervision humaine minimale, PARTS réduit le coût du dernier kilomètre de fiabilité, souvent le facteur limitant en usine ou en entrepôt. Comparé aux méthodes RL existantes de fine-tuning en conditions réelles, il améliore le succès complet de plus de 25 points à budget de rollouts identique, avec moins d'intervention humaine.
PARTS s'inscrit dans la course aux politiques de fondation robotique préentraînées sur de larges jeux de démonstrations, que le secteur cherche à fiabiliser sans re-collecte complète. Les auteurs le comparent aux méthodes RL existantes de fine-tuning en conditions réelles, qu'il surpasse nettement à budget de rollouts égal, et au fine-tuning supervisé classique qu'il rend en partie superflu. Publié sans partenariat industriel ni calendrier annoncé, ce résultat de laboratoire, validé sur les seules plateformes YAM et Franka Emika, reste à étendre à davantage de tâches, de robots et de politiques commerciales.
Le framework est validé sur un bras Franka Emika (fabricant allemand), mais sans institution ou entreprise européenne pilotant la recherche, l'impact direct sur la France/UE reste limité.
Dans nos dossiers




