Aller au contenu principal
RecherchearXiv cs.RO 

De la préformation à la maîtrise : apprentissage par renforcement des sous-tâches en conditions réelles pour la manipulation à long horizon, avec intervention humaine minimale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PARTS (Policy Adaptation with RL on Targeted Subtasks) est un cadre d'apprentissage par renforcement qui corrige les échecs récurrents des politiques robotiques préentraînées sur des tâches longues, décrit dans un preprint arXiv (2609.21788) publié en septembre 2026. La politique de base reste gelée pour les actions nominales, tandis que des sélecteurs et vérificateurs de succès générés automatiquement déclenchent des corrections résiduelles ciblées sur les sous-tâches en échec et distribuent des récompenses locales, même quand les succès complets restent rares ; les humains se limitent à repérer ces points de blocage et à effectuer les réinitialisations physiques. Le taux de succès complet grimpe de 32% à 61% sur des tâches bimanuelles avec la plateforme YAM, et de 50% à 95% sur des tâches à bras unique avec un robot Franka (Franka Emika, Allemagne), pour quelques dizaines de minutes de rollouts réels par tâche en moyenne.

Ce résultat répond à un problème connu du secteur : les politiques de type VLA impressionnent souvent en démonstration mais s'effondrent sur quelques étapes critiques au déploiement, et le fine-tuning par RL à récompense éparse peine à résoudre des tâches longues. En montrant qu'une correction ciblée sur les seules sous-tâches en échec comble l'essentiel de l'écart avec quelques dizaines de minutes de collecte réelle et une supervision humaine minimale, PARTS réduit le coût du dernier kilomètre de fiabilité, souvent le facteur limitant en usine ou en entrepôt. Comparé aux méthodes RL existantes de fine-tuning en conditions réelles, il améliore le succès complet de plus de 25 points à budget de rollouts identique, avec moins d'intervention humaine.

PARTS s'inscrit dans la course aux politiques de fondation robotique préentraînées sur de larges jeux de démonstrations, que le secteur cherche à fiabiliser sans re-collecte complète. Les auteurs le comparent aux méthodes RL existantes de fine-tuning en conditions réelles, qu'il surpasse nettement à budget de rollouts égal, et au fine-tuning supervisé classique qu'il rend en partie superflu. Publié sans partenariat industriel ni calendrier annoncé, ce résultat de laboratoire, validé sur les seules plateformes YAM et Franka Emika, reste à étendre à davantage de tâches, de robots et de politiques commerciales.

Impact France/UE

Le framework est validé sur un bras Franka Emika (fabricant allemand), mais sans institution ou entreprise européenne pilotant la recherche, l'impact direct sur la France/UE reste limité.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique
1arXiv cs.RO 

Apprentissage par renforcement en conditions réelles avec échafaudage MPC pour la manipulation dextérique

Une nouvelle méthode d'apprentissage par renforcement (RL) entraînée directement sur un robot physique, sans simulation préalable ni démonstrations humaines, a été détaillée dans un article publié sur arXiv (2609.14878v1). Le système associe un contrôleur prédictif par échantillonnage (MPC) à un apprenant Soft Actor-Critic hors politique pour piloter une main robotique Allegro à 16 degrés de liberté. Concrètement, 20 trajectoires générées par le MPC sur le matériel réel, collectées en 12 minutes, servent d'abord à préremplir un buffer de rejeu et à pré-entraîner l'acteur et le critique. Pendant la phase en ligne, le MPC continue de guider la collecte de données par intermittence, tandis que le contrôle bascule progressivement vers la politique apprise. Sur une tâche de rotation continue d'objet en main, la politique atteint 100% de réussite en évaluation autonome (5 essais sur 5) après seulement 7 minutes d'apprentissage en ligne, moyennant environ trois chutes d'objet durant l'entraînement. Après 20 minutes, elle tourne plus de cinq fois plus vite que le contrôleur MPC initial et enchaîne 1000 rotations consécutives sur plus de 110 minutes sans lâcher l'objet. Ce résultat s'attaque à l'un des obstacles les plus concrets du RL en robotique: l'exploration initiale aléatoire, lente et destructrice pour le matériel réel. En ancrant l'apprentissage dans l'expérience d'un contrôleur classique plutôt que dans des démonstrations humaines téléopérées, coûteuses à produire en volume, la méthode réduit fortement le temps d'intervention et le nombre d'échecs physiques nécessaires avant d'obtenir une politique fiable. Pour les équipes travaillant sur la manipulation dextre, c'est un indice que l'apprentissage sur robot réel, longtemps jugé trop lent et risqué face au sim-to-real, peut converger en quelques dizaines de minutes sur une tâche à haute dimensionnalité, à condition de structurer l'exploration plutôt que de la laisser libre. Le résultat nuance aussi l'hypothèse selon laquelle des démonstrations humaines seraient indispensables pour amorcer ce type de politique. La démonstration reste toutefois limitée à une tâche de référence en conditions de laboratoire, sans institution ni calendrier de publication du code précisés. Les ablations montrent que le pré-entraînement MPC, la conservation de cette expérience dans le buffer et le guidage MPC en ligne apportent chacun un gain distinct et complémentaire, ce qui distingue l'approche des pipelines purement sim-to-real ou de l'apprentissage par imitation à partir de téléopération, aujourd'hui dominant dans la manipulation dextre humanoïde. Les auteurs rapportent en complément une adaptation rapide à d'autres géométries d'objets et une réorientation conditionnée par objectif, sans annoncer de partenariat industriel ni de déploiement au-delà du résultat de recherche.

RecherchePaper
1 source
RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM
2arXiv cs.RO 

RMTL : apprentissage par renforcement sur micro-tâches pour la manipulation à long terme avec récompenses VLM

Une équipe de chercheurs a publié en juin 2026, via arXiv (identifiant 2606.26175), une méthode baptisée RMTL (Reinforced Micro-Task Learning) visant à résoudre un problème central de l'apprentissage par renforcement appliqué à la manipulation robotique : la conception du signal de récompense. Plutôt que de s'appuyer sur une fonction de récompense dense codée manuellement (coûteuse à calibrer et souvent fragile) ou sur des démonstrations humaines, RMTL exploite des modèles vision-langage (VLM) préentraînés comme signaux de récompense zero-shot. La nouveauté réside dans la décomposition de la tâche globale en un petit ensemble de micro-tâches décrites en langage naturel, chacune associée à un prompt dédié. À chaque étape, l'agent reçoit une récompense calculée par le VLM selon la micro-tâche active, moyennée sur plusieurs angles de caméra pour atténuer les effets d'occlusion. Un curriculum inverse expose progressivement l'agent à des conditions initiales plus difficiles, tandis qu'un gestionnaire hiérarchique appris remplace une règle de sélection de phase basée sur la distance. Les expériences ont été menées sur l'environnement Fetch, benchmark standard de la manipulation en simulation, avec seulement trois prompts courts sans ajustement supplémentaire. L'apport principal est l'amélioration significative du signal d'apprentissage par rapport à une approche VLM à prompt unique. Un prompt global produit un signal de récompense quasi-plat en début de trajectoire : l'agent ne détecte pas ses progrès précoces, ce qui ralentit drastiquement la convergence sur des tâches à long horizon. RMTL répond à ce problème structurel en rendant chaque micro-tâche localement observable. Pour les équipes cherchant à réduire leur dépendance aux démonstrations humaines ou à l'ingénierie manuelle des récompenses, cela représente une piste sérieuse pour rendre le RL guidé par le langage plus scalable sans coût d'annotation supplémentaire. Ce travail s'inscrit dans une vague active de recherches utilisant les VLMs comme substituts de fonctions de récompense, dont EUREKA de NVIDIA ou les approches SayCan de Google DeepMind. Contrairement à certaines de ces méthodes qui nécessitent un fine-tuning ou des démonstrations vidéo, RMTL mise sur une décomposition minimale en trois phases sans recalibrage des prompts. L'évaluation reste cependant confinée à la simulation sur robot Fetch, et aucun résultat sur plateforme physique n'est rapporté. La prochaine étape critique sera de valider si cette approche tient face au gap sim-to-real, notamment sur des manipulateurs physiques avec variabilité sensorielle réelle.

RechercheActu
1 source
Apprentissage par renforcement avec supervision humaine calibré sur les préférences pour la manipulation robotique
3arXiv cs.RO 

Apprentissage par renforcement avec supervision humaine calibré sur les préférences pour la manipulation robotique

Une équipe de chercheurs publie dans un préprint arXiv daté du 3 juin 2026 PACT (Preference-calibrated Actor-Critic Training), un cadre d'apprentissage par renforcement avec supervision humaine (HIL-RL) pour la manipulation robotique. Le problème ciblé est connu : quand un opérateur reprend la main pour corriger le robot, les trajectoires collectées contiennent des segments suboptimaux que les méthodes actuelles propagent indistinctement dans le calcul des récompenses, surestimant les Q-valeurs et biaisant la politique vers des comportements sous-performants. PACT introduit un modèle de progression entraîné sur des démonstrations humaines pour identifier ces segments défaillants, puis construit des paires de préférence entre l'action correctrice humaine et l'action rééchantillonnée de la politique au même état d'intervention. Cette comparaison génère un avantage contrefactuel qui pénalise les cibles de Bellman sur les segments suboptimaux, complété par un alignement direct de la politique sur les actions correctives dans l'espace des moyennes bornées. Sur cinq tâches de manipulation réelle-robot, PACT affiche une amélioration moyenne du taux de succès de 24,5 % et une convergence 1,3 fois plus rapide que les méthodes HIL-RL de référence. Le code est disponible en open source sur dépôt GitHub anonymisé. Ces résultats s'attaquent à un goulot d'étranglement pratique du HIL-RL : la supervision humaine améliore l'efficacité en échantillons, mais introduit du bruit quand les corrections arrivent après plusieurs actions déjà incorrectes. En extrayant les signaux de préférence implicitement des interventions, sans annotation post-hoc coûteuse, PACT permet à un opérateur non-expert d'intervenir naturellement pendant l'entraînement sans dégrader la qualité des données. La convergence accélérée réduit directement le temps d'adaptation sur de nouvelles tâches, un facteur critique pour le déploiement en environnements industriels variables. Le HIL-RL s'appuie sur des travaux fondateurs comme DAgger (Ross et al., 2011) et IWR (Mandlekar et al., 2020), complétés par des variantes comme HG-DAgger, qui pondèrent les transitions différemment sans toutefois distinguer explicitement les segments suboptimaux. PACT se positionne comme une extension ciblée de cette famille. La manipulation robotique est par ailleurs traversée par les approches VLA (Vision-Language-Action), comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation zero-shot, une stratégie complémentaire plutôt qu'opposée au fine-tuning supervisé par intervention humaine. Le préprint, non encore peer-reviewed, ne mentionne ni partenaires industriels ni calendrier de déploiement ; la distance entre banc de test robotique de laboratoire et production industrielle reste entière.

UEImpact indirect : ce cadre HIL-RL open-source pourrait accélérer les travaux des équipes européennes de robotique industrielle cherchant à réduire le coût d'adaptation de robots à de nouvelles tâches en production.

RecherchePaper
1 source
Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles
4arXiv cs.RO 

Apprentissage par renforcement résiduel incrémental pour la navigation sociale en conditions réelles

Des chercheurs ont publié sur arXiv (réf. 2604.07945, version 2) une méthode baptisée IRRL, Incremental Residual Reinforcement Learning, conçue pour permettre aux robots mobiles d'apprendre à naviguer parmi les piétons directement dans des environnements physiques réels, sans passer par une étape de simulation exhaustive. L'approche combine deux mécanismes distincts : l'apprentissage incrémental, un processus léger qui ne nécessite ni replay buffer ni mise à jour par batch, et le RL résiduel, qui restreint l'apprentissage aux corrections à apporter par rapport à une politique de base préexistante. Les expériences couvrent à la fois des environnements simulés et des déploiements réels sur robot physique, avec pour cible explicite les dispositifs edge à ressources computationnelles contraintes. L'enjeu industriel est concret : la navigation sociale, faire circuler un robot autonome parmi des piétons en respectant les conventions implicites de déplacement, est un verrou majeur pour les AMR déployés dans des espaces publics, des entrepôts partagés ou des établissements de santé. Le problème du sim-to-real gap est ici particulièrement prononcé, car les dynamiques piétonnes varient fortement selon les régions, les cultures et les configurations d'espace, rendant toute couverture exhaustive par simulation illusoire. IRRL propose une réponse directe : laisser le robot continuer à apprendre une fois déployé, en se limitant aux résidus par rapport à une politique de base, ce qui réduit drastiquement la charge computationnelle. Les résultats publiés montrent des performances comparables aux méthodes classiques avec replay buffer en simulation, et une supériorité sur les approches d'apprentissage incrémental existantes. Les expériences en environnement réel confirment une adaptation effective à des situations inédites. Ces résultats restent toutefois à interpréter avec prudence : il s'agit d'un preprint académique, sans benchmark standardisé ni déploiement à l'échelle annoncé. Le domaine de la navigation sociale par deep RL est actif depuis plusieurs années, porté par des travaux comme CrowdNav (ICRA 2019) ou des méthodes basées sur ORCA et ses extensions apprenantes. L'approche résiduelle n'est pas nouvelle en soi, elle est notamment utilisée dans le contrôle de robots manipulateurs pour corriger une politique classique, mais son application à la navigation sociale en conditions réelles avec contrainte edge reste peu explorée. Aucune institution ni entreprise n'est identifiée dans l'abstract disponible, et aucun partenariat industriel ni pilote terrain n'est mentionné. Les prochaines étapes naturelles seraient une validation sur des plateformes AMR commerciales (type Clearpath ou unitree) et une confrontation aux benchmarks publics de navigation sociale tels que BARN ou SocNavBench.

RecherchePaper
1 source