Aller au contenu principal
RecherchearXiv cs.RO 

BlenDAgger : contrôle partagé par mélange pour l'apprentissage par imitation interactif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent Blended DAgger (BlenDAgger), une méthode de collecte de données pour l'apprentissage par imitation, décrite dans un preprint arXiv. Lors des interventions humaines, le système ne laisse pas l'opérateur prendre le contrôle total du robot. Il mélange en continu les actions de la politique et celles du démonstrateur, selon un principe de contrôle partagé. La méthode a été testée sur cinq tâches de manipulation, deux en conditions réelles et trois en simulation. Sur les deux tâches réelles, la politique finale atteint une performance autonome supérieure d'au moins 30 points de pourcentage à celle obtenue avec HG-DAgger, la référence où l'humain reprend la main de façon binaire. Les transitions entre politique et intervention humaine sont 57 % plus fluides, et les trajectoires corrigées sont 14 % plus proches des données d'entraînement. Une étude utilisateur (n=14) sur les deux tâches réelles montre une collecte plus rapide (facteur de Bayes de 13,32), sans différence perçue subjectivement par les opérateurs.

L'enjeu est le coût de la donnée corrective, principal goulot d'étranglement des politiques de manipulation entraînées par imitation. La téléopération complète pour corriger un robot est fatigante, et les démonstrations humaines sont rarement optimales. Un opérateur qui ne fait que guider la politique produit des données plus cohérentes avec sa distribution. Cela réduit le décalage entre ce que le robot sait faire et ce qu'on lui enseigne, et pourrait diminuer le temps opérateur nécessaire pour affiner une politique, un poste de coût réel pour les intégrateurs. Les résultats restent toutefois ceux d'un laboratoire. Le résumé ne précise ni les tâches, ni le robot, ni les taux de réussite absolus, ni le nombre de démonstrations. Un écart de 30 points peut donc partir d'une base basse. L'échantillon de 14 participants reste modeste.

Cette approche s'inscrit dans la lignée de DAgger (2011) et de HG-DAgger (2019), qui ont popularisé l'apprentissage par imitation interactif. Elle rejoint la vague actuelle du fine-tuning de politiques généralistes à partir de corrections humaines, comme les VLA de type Pi-0 ou GR00T. Le preprint n'annonce ni code, ni déploiement industriel, ni calendrier. Aucun acteur français ou européen n'est cité dans le résumé. La suite dépendra d'une validation sur d'autres robots, d'autres tâches et de plus gros modèles.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain
1arXiv cs.RO 

BEACON : contrôle adaptatif basé sur la croyance pour l'apprentissage par imitation en contexte incertain

Une équipe de recherche présente BEACON (Belief-Enabled Adaptive CONtrol), une méthode d'apprentissage par imitation pour la manipulation robotique en environnement partiellement observable, décrite dans un article publié sur arXiv le 22 septembre 2026 (arXiv:2609.22730v1). Le problème ciblé : quand une tâche de manipulation dépend d'un état caché qui ne peut être observé directement mais doit être inféré via des interactions physiques successives, conditionner une politique uniquement sur l'historique brut d'observations récentes produit de mauvaises performances, un phénomène appelé aliasing d'état, où des observations identiques correspondent à des états cachés différents et génèrent des étiquettes d'action contradictoires pour une même entrée. BEACON conditionne à la place une politique de diffusion sur une représentation structurée de croyance bayésienne, qui expose à la fois l'estimation la plus probable de l'état courant et l'incertitude résiduelle. La méthode est testée sur deux tâches aux représentations de croyance qualitativement différentes : une croyance continue pour l'alignement d'une pince sur une tige de maïs via détection tactile, et une distribution catégorielle discrète pour l'ouverture d'une porte verrouillée. Sur les deux tâches, la politique conditionnée par la croyance surpasse nettement la référence fondée uniquement sur l'observation et s'approche de la performance obtenue avec un accès privilégié à la vérité terrain sur l'état caché. Des ablations montrent que la politique module implicitement son comportement entre exploration et exploitation selon le niveau d'incertitude au moment de l'inférence, sans bascule de mode explicite ni ingénierie de récompense. Ce résultat cible une limite connue des politiques d'apprentissage par imitation conditionnées sur historique brut, y compris dans des architectures type vision-langage-action : leur difficulté à distinguer des états physiquement différents mais similaires en apparence ou au toucher, un problème fréquent en manipulation fine où le contact porte l'essentiel de l'information utile. Pour des intégrateurs travaillant sur la préhension délicate ou la manipulation d'objets à contrainte mécanique cachée (loquets, verrous, alignement d'outils agricoles), l'approche esquisse une voie pour réduire l'écart entre démonstrations contrôlées et robustesse en conditions réelles, sans dépendre uniquement de volumes massifs de données. BEACON s'inscrit dans la lignée des politiques de diffusion pour l'apprentissage par imitation, devenues une approche de référence en manipulation robotique ces dernières années, et s'attaque spécifiquement à leur angle mort en environnement partiellement observable. L'article ne mentionne ni déploiement industriel ni partenariat commercial : il s'agit d'un travail de recherche évalué en laboratoire sur des tâches ciblées, sans mise à l'échelle annoncée ni calendrier de transfert vers des plateformes commerciales.

RecherchePaper
1 source
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
2arXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence. Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte. CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

RecherchePaper
1 source
Raffinement de démonstrations accélérées par contrôle itératif incrémental pour l'apprentissage par imitation à contact riche
3arXiv cs.RO 

Raffinement de démonstrations accélérées par contrôle itératif incrémental pour l'apprentissage par imitation à contact riche

Une équipe de chercheurs a publié en avril 2026 sur arXiv (arXiv:2604.16850) une méthode baptisée I2RLC (Incremental Iterative Reference Learning Control) pour générer automatiquement des démonstrations robotiques rapides et précises, sans intervention humaine à haute vitesse. Le constat de départ est simple : en apprentissage par imitation (IL), les humains ne peuvent pas démontrer physiquement une tâche à 5x ou 10x leur vitesse naturelle, et accélérer naïvement un enregistrement dégrade la dynamique de contact et crée des erreurs de suivi qui corrompent les données d'entraînement. L'I2RLC résout ce problème en augmentant progressivement la vitesse d'exécution tout en corrigeant itérativement la trajectoire de référence à partir des erreurs observées. La méthode a été validée sur robot réel, sur deux tâches à contact riche : effacement de tableau blanc et insertion cheville-trou (peg-in-hole), en utilisant un système de téleopération composé d'un bras suiveur à contrôle de compliance et d'un leader haptic imprimé en 3D. Les résultats atteignent des démonstrations 10x plus rapides avec réduction des erreurs de suivi, et I2RLC améliore la similarité spatiale aux trajectoires originales de 22,5 % en moyenne par rapport à la version non-incrémentale (IRLC), sur trois tâches et plusieurs vitesses (3x à 10x). Les politiques entraînées sur ces données atteignent 100 % de taux de réussite sur la tâche peg-in-hole, y compris pour des positions non vues à l'entraînement, avec des forces de contact inférieures. Ce résultat adresse un angle mort fréquent dans le développement des politiques d'imitation : la qualité des démonstrations elle-même. La grande majorité des approches IL (Diffusion Policy, ACT, Pi-0) suppose des démos propres et représentatives, sans se préoccuper du fossé entre la vitesse humaine et la vitesse de déploiement réelle. Ici, la généralisation à des positions non vues avec 100 % de succès constitue un signal concret de robustesse, pas simplement une performance en conditions contrôlées. Pour les intégrateurs industriels, l'enjeu est direct : si l'on peut automatiser la génération de trajectoires rapides à partir de démos lentes, le coût de collecte de données pour des tâches d'assemblage ou de manutention chute significativement. L'apprentissage par imitation pour la manipulation à contact riche est un axe de recherche très actif depuis 2022-2023, porté par des travaux comme ACT (Stanford), Diffusion Policy (MIT/Columbia) et les architectures VLA type Pi-0 (Physical Intelligence). Le problème de la "vitesse des démos" reste cependant peu traité dans la littérature. L'I2RLC s'inscrit dans une lignée de méthodes de contrôle itératif (ILC) adaptées à la robotique apprenante. Aucune entreprise commerciale n'est citée dans cette publication académique, mais les applications industrielles naturelles touchent l'assemblage électronique, le câblage, et toute manipulation nécessitant précision et cadence. Les prochaines étapes probables incluent une extension aux politiques diffusives modernes et une validation sur des tâches multi-étapes en environnement non structuré.

RecherchePaper
1 source
Un robot peut-il lire le braille ? Apprentissage par imitation pour adapter le contact tactile
4arXiv cs.RO 

Un robot peut-il lire le braille ? Apprentissage par imitation pour adapter le contact tactile

Un article de recherche publié en prépublication sur arXiv (référence 2609.30676v1) présente un système robotique capable de corriger physiquement son propre contact avant de lire du braille en relief. Les lecteurs braille robotiques existants se concentrent presque exclusivement sur la reconnaissance tactile après que le contact a été établi, en supposant que ce contact est déjà de bonne qualité. Les auteurs proposent à l'inverse un cadre d'adaptation active du contact : un système de "Multi-Head Policy Learning" apprend, à partir de démonstrations guidées par un expert humain, à la fois à évaluer si un contact est exploitable et à corriger la pose du capteur tactile en conséquence. En déploiement, le robot évalue et réajuste itérativement son contact, ne conservant que les observations tactiles fiables pour la reconstruction finale des caractères braille. Testé sur 20 plaques braille physiques, dont 10 réservées à l'évaluation en ligne, le système atteint 94,0% de qualité de contact tactile et 88,6% de précision de reconstruction des caractères. L'intérêt de ces résultats dépasse le seul cas du braille : ils démontrent que, pour des tâches de manipulation tactile fine, corriger activement la pose de contact avant la reconnaissance donne de meilleurs résultats que de compenser après coup des observations tactiles imparfaites par de la reconnaissance plus robuste. C'est un signal utile pour les équipes travaillant sur la manipulation en boucle fermée guidée par le toucher, un domaine encore largement dominé par des approches vision-centrées ou par des pipelines de reconnaissance passive. Pour les acteurs de l'assistance aux personnes malvoyantes ou de la robotique de service, cela suggère une voie concrète vers des lecteurs braille robotisés plus fiables, potentiellement utiles pour la numérisation de documents en braille ou l'assistance à la lecture, même si le système reste à ce stade un prototype de laboratoire évalué sur un nombre limité de plaques. Ce travail s'inscrit dans la lignée des recherches en apprentissage par imitation appliqué à la manipulation tactile fine, où l'essentiel des efforts publiés jusqu'ici portait sur l'interprétation de motifs tactiles plutôt que sur la qualité du contact physique lui-même. L'abstract ne précise ni l'institution ni les auteurs, ni de calendrier de suite ou de partenariat industriel : il s'agit à ce stade d'une contribution académique nouvellement annoncée sur arXiv, sans indication de transfert vers un produit ou un déploiement réel.

RecherchePaper
1 source