Aller au contenu principal
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
RecherchearXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence.

Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte.

CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

À lire aussi

Feat2Go : estimation de valeur par ancrage visuel pour l'apprentissage par renforcement incarné
1arXiv cs.RO 

Feat2Go : estimation de valeur par ancrage visuel pour l'apprentissage par renforcement incarné

Feat2Go est un framework de recherche présenté sur arXiv (2605.30795, mai 2026) qui s'attaque à un verrou persistant dans l'entraînement des modèles vision-langage-action (VLA) : générer automatiquement des signaux de récompense denses pour l'apprentissage par renforcement (RL) sur des tâches de manipulation longue portée. Le système décompose automatiquement un épisode robotique en étapes sémantiques via un clustering orienté tendances, puis mesure la progression par similarité au niveau patch entre l'état courant et des sous-objectifs visuels extraits d'un world model visuel pré-entraîné. Un modèle de valeur incarné prédit ensuite ce progrès à partir de l'observation et de l'instruction textuelle, et le signal est utilisé pour reformuler les récompenses terminales lors de l'optimisation de politique, sans ingénierie manuelle des récompenses. Les résultats sur deux benchmarks de référence sont nets : sur ManiSkill3, OpenVLA-OFT passe d'un taux de succès hors distribution de 17,5 % à 82,9 % tout en maintenant 96,9 % en distribution ; sur RoboTwin 2.0, Feat2Go atteint 88,8 % de succès moyen en domain randomization, dépassant les méthodes RL antérieures. Le framework est compatible avec PPO et GRPO, et couvre manipulation bras unique et bras bimanuels. L'intérêt de cette contribution est qu'elle attaque un problème structurel du RL robotique : soit on conçoit à la main des fonctions de récompense tâche par tâche, soit on reste captif de lourds datasets d'imitation. Feat2Go contourne ces deux contraintes en extrayant automatiquement un signal de progrès granulaire depuis un world model, ce qui le rend théoriquement compatible avec des architectures VLA existantes sans modification majeure du pipeline. Un saut de 17,5 % à 82,9 % hors distribution représente un écart brut significatif, mais il faut souligner que ces chiffres restent obtenus en simulation : la chaîne sim-to-real n'est pas validée sur hardware réel, une limite habituelle mais non négligeable. Cette approche s'inscrit dans une tendance large où le RL sert de couche de fine-tuning au-dessus de fondations VLA pré-entraînées, après des travaux récents comme π0 de Physical Intelligence, GROOT N2 de NVIDIA, ou les architectures de 1X et Figure AI. La question du signal de récompense était le chaînon manquant dans ce paradigme ; Feat2Go propose une réponse agnostique au modèle. Aucun partenariat industriel ni déploiement terrain n'est annoncé, la contribution restant académique à ce stade.

RechercheOpinion
1 source
VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts
2arXiv cs.RO 

VE2VF : distillation vision vers sans vision par apprentissage par renforcement pour la manipulation robuste avec contacts

Des chercheurs ont présenté VE2VF (Vision-Enabled to Vision-Free), un cadre d'apprentissage par renforcement (RL) pour la manipulation robotique en contact riche, publié en préprint sur arXiv (2605.29564). La méthode repose sur une distillation enseignant-élève conduite intégralement sur robot réel, sans simulation ni randomisation de domaine. Un module "enseignant" équipé de vision apprend d'abord la tâche, puis transfère sa politique à un "élève" n'utilisant que la pose, le twist et le wrench (position/orientation, vitesse et couple de force), sans aucun flux caméra. Sur le benchmark NIST d'assemblage, référence standardisée pour les tâches d'insertion de précision, le système atteint 95 % de taux de succès global après environ 50 minutes d'entraînement sur 3 tâches représentatives, et généralise à 8 variantes non vues lors de l'entraînement. Un fine-tuning par distillation permet d'atteindre 100 % de succès sur la variante la plus difficile. Ce résultat adresse un problème structurel en robotique industrielle: les politiques basées sur la vision surapprennent les conditions d'éclairage et de fond vues à l'entraînement, ce qui fragilise leur déploiement en environnement de production variable. En éliminant la vision à l'inférence tout en l'exploitant pendant l'apprentissage, VE2VF produit des politiques robustes aux perturbations visuelles sans coût supplémentaire en données. Plus significatif encore: atteindre cette généralisation en moins d'une heure d'entraînement réel suggère qu'on peut contourner le sim-to-real gap sans simulateur haute-fidélité ni dataset synthétique massif. Pour les intégrateurs déployant des cellules d'assemblage de précision, la combinaison rapidité d'adaptation et robustesse proprioceptive est directement actionnable. Le benchmark NIST Assembly Task Board est utilisé depuis plusieurs années comme terrain de comparaison inter-équipes en manipulation de précision, ce qui confère à ces résultats une lisibilité relative face aux travaux antérieurs. Les approches concurrentes combinent généralement simulation, randomisation de domaine et larges volumes de données synthétiques avant transfert sur robot réel. VE2VF se positionne comme une alternative ancrée dans le réel, avec une boucle human-in-the-loop permettant de superviser l'apprentissage en cours de session. Il s'agit à ce stade d'un préprint de recherche, non d'un système en production ni d'un produit commercialisé. Les suites naturelles incluent des tests sur d'autres plateformes matérielles et des tâches industrielles plus complexes, ainsi qu'une confrontation directe avec les approches de type VLA (Vision-Language-Action) qui ciblent elles aussi la généralisation en manipulation contact-riche à grande échelle.

RecherchePaper
1 source
PRICE des segments d'actions : attribution de crédit physique et relationnelle pour l'apprentissage par renforcement incarné
3arXiv cs.RO 

PRICE des segments d'actions : attribution de crédit physique et relationnelle pour l'apprentissage par renforcement incarné

Des chercheurs proposent PRICE (Physical Relations for Inferring Credit from Episodes), une méthode d'apprentissage par renforcement (RL) pour post-entraîner des politiques vision-langage-action (VLA) à partir du seul signal de succès ou d'échec en fin d'épisode. Le problème visé est connu : le RL basé sur le résultat attribue le même avantage à tous les « action chunks » (blocs d'actions) d'une trajectoire. Un épisode raté pénalise donc des gestes initiaux pourtant utiles, comme s'ils avaient causé l'échec. PRICE s'appuie sur deux composants : un graphe relationnel physique, qui regroupe les résultats d'épisodes courants et passés aux frontières de chunks correspondantes pour estimer des « potentiels de succès », et une attribution de crédit filtrée par un seuil de confiance, qui utilise les variations de ces potentiels pour affiner la supervision au niveau de la trajectoire. Les tests couvrent les benchmarks LIBERO et RoboTwin 2.0, ainsi que des robots réels. Les auteurs annoncent un taux de réussite supérieur aux références basées sur le résultat et un apprentissage plus rapide. L'article ne fournit pas, dans son résumé, de chiffres précis ni de détail sur les robots ou les tâches réels. L'enjeu est pratique : le RL de post-entraînement des VLA se heurte à la rareté du signal. Les approches existantes de granularité fine passent par des évaluateurs appris (modèles de récompense, critiques), qui exigent une supervision propre à chaque tâche ou un entraînement supplémentaire. PRICE vise à s'en passer, en exploitant l'idée que des rollouts atteignant des situations physiques comparables peuvent se servir mutuellement de référence. Si ce principe tient hors des benchmarks, il réduirait le coût d'adaptation d'une politique à un nouveau poste de travail, un point sensible pour les intégrateurs qui doivent affiner un VLA sur site avec peu d'ingénierie de récompense. Les auteurs ajoutent une analyse reliant les changements de potentiel « oracle » à l'objectif de succès terminal, avec une borne directionnelle à échantillon fini, et des tests de continuation indépendants montrant que les crédits retenus correspondent bien à une progression locale. Reste une réserve : LIBERO et RoboTwin 2.0 sont des environnements simulés, et la validation réelle, dont l'ampleur n'est pas précisée ici, est le vrai test de la robustesse du graphe de correspondance face au bruit physique. Ce travail s'inscrit dans la course au post-entraînement des VLA par RL, après les premières familles de modèles généralistes (Pi-0, GR00T, Helix), où le fine-tuning supervisé atteint ses limites et où le RL devient le levier de fiabilité. Les auteurs revendiquent une première, à leur connaissance, pour l'attribution de crédit au niveau des chunks sans évaluateur auxiliaire, une affirmation non vérifiée indépendamment à ce stade. Il s'agit d'une prépublication arXiv, sans produit ni déploiement industriel annoncé. Les prochaines étapes à surveiller sont la réplication par d'autres laboratoires, l'application à de plus grands modèles VLA et la démonstration sur des tâches longues, où le problème d'attribution de crédit est le plus aigu.

RecherchePaper
1 source
Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond
4arXiv cs.RO 

Vers des stratégies d'interaction adaptatives pour robots compagnons via l'apprentissage par renforcement profond

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.25031) une nouvelle méthode de suivi humain-robot fondée sur l'apprentissage par renforcement profond (DRL), qui rompt avec les approches classiques imposant une position fixe au robot par rapport à la personne accompagnée, derrière, devant ou à ses côtés. Le système modélise un "espace d'interaction" liant humain, robot et environnement, utilisé comme espace d'état pour l'agent DRL, et s'appuie sur un contrôleur combinant Model Predictive Path Integral (MPPI) et Control Barrier Functions (CBF) pour suivre précisément la position et l'orientation de la cible tout en évitant les obstacles. Testé en conditions réelles, en intérieur comme en extérieur, et comparé à des méthodes existantes, le robot accompagne une personne marchant jusqu'à 1,7 m/s en ajustant dynamiquement sa stratégie de positionnement, avec un taux de réussite amélioré d'au moins 24% et une précision de suivi améliorée d'au moins 47%, tout en respectant l'espace intime de la personne pour garantir sécurité et confort. L'intérêt dépasse la démonstration technique: la plupart des robots d'accompagnement actuels, en logistique, en assistance ou en robotique de service, reposent sur des règles de positionnement figées, peu robustes face aux changements de vitesse, aux couloirs étroits ou à la densité de foule. Un positionnement adaptatif piloté par apprentissage, capable de basculer entre suivi latéral, frontal ou arrière selon le contexte, répond à une limite connue de la navigation sociale robotique, le compromis entre sécurité, fluidité de déplacement et acceptabilité sociale. Pour les intégrateurs travaillant sur des robots mobiles autonomes (AMR) destinés à l'accompagnement de personnes en environnement industriel ou de santé, cette approche laisse entrevoir des systèmes moins rigides et potentiellement plus sûrs en cohabitation avec des humains. Le travail s'inscrit dans un courant de recherche en interaction humain-robot (HRI) qui cherche à dépasser les schémas de suivi rigides documentés dans la littérature existante, et les auteurs comparent directement leurs résultats à ceux d'études antérieures. Comme souvent pour ce type de publication académique, les métriques de réussite et de confort restent définies et mesurées par les auteurs eux-mêmes sur un nombre limité de scénarios, ce qui appelle une validation indépendante avant toute généralisation. Aucune affiliation industrielle ni calendrier de transfert commercial n'est mentionné: il s'agit à ce stade d'une contribution de recherche, sans pilote ni déploiement annoncé, dont la suite logique serait une extension à des scénarios multi-personnes et une validation sur d'autres plateformes robotiques.

RecherchePaper
1 source