Aller au contenu principal
FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques
RecherchearXiv cs.RO 

FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de ce papier arXiv (référence 2607.01111v1) présentent FAR (Failure-Aware Retry), un framework qui permet à un robot manipulateur d'apprendre de ses propres échecs directement au moment du test, sans intervention humaine, pour finir par accomplir la tâche de façon autonome. Le système combine deux mécanismes: la Failure-Contrastive Preference Adaptation, qui transforme chaque échec en donnée de préférence pour écarter la politique des comportements déjà ratés, et des perturbations d'action légères appliquées lors des tentatives suivantes pour favoriser une exploration locale ciblée autour du point d'échec. Les trajectoires de récupération qui réussissent sont ensuite réinjectées dans une boucle d'entraînement, ce qui permet une amélioration continue de la politique. Testé en simulation et sur des tâches de manipulation réelles, FAR améliore le taux de réussite de 17,6% en moyenne par rapport à une politique de diffusion standard en simulation, et de 11,7% en conditions réelles.

Ce travail s'attaque à un problème concret pour l'industrie: la plupart des politiques de manipulation actuelles, notamment celles basées sur la diffusion, échouent silencieusement en réel et se contentent de répéter la même erreur lors d'un nouvel essai, faute de mécanisme pour comprendre pourquoi elles ont échoué. Les méthodes de récupération existantes s'appuient généralement sur un opérateur humain pour réinitialiser ou corriger le robot, ce qui limite le déploiement autonome à grande échelle et alourdit le coût des essais réels. En démontrant qu'un robot peut exploiter ses propres échecs comme signal d'apprentissage plutôt que comme simple bruit à ignorer, FAR va dans le sens d'une meilleure robustesse des politiques VLA et de diffusion en environnement non contrôlé, un enjeu central pour les intégrateurs qui cherchent à réduire la supervision humaine sur des lignes de manipulation.

FAR s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et l'apprentissage par imitation appliqués à la manipulation robotique, où la question du "reset" et du "budget de pas de temps" pendant l'entraînement continu reste un goulot d'étranglement pratique. Les auteurs montrent justement que leur méthode améliore l'efficacité des données sous ces deux contraintes de budget, en exploitant préférentiellement les cas d'échec les plus informatifs. Le papier, classé comme nouvelle soumission sur arXiv, ouvre la voie à des extensions vers d'autres familles de politiques et vers des déploiements réels prolongés, sans que des pilotes industriels concrets ne soient encore annoncés à ce stade.

À lire aussi

Politiques de récupération sensibles aux différences pour l'apprentissage par imitation
1arXiv cs.RO 

Politiques de récupération sensibles aux différences pour l'apprentissage par imitation

Une équipe du Weird Lab de l'Université de Washington publie sur arXiv (arXiv:2606.09758, juin 2026) une méthode appelée DARP (Difference-Aware Retrieval Policies for Imitation Learning), une approche semi-paramétrique d'apprentissage par imitation. Le principe central : plutôt que d'apprendre un mapping global état-action via un réseau de neurones pur (behavior cloning standard), DARP entraîne un modèle à prédire des actions en s'appuyant sur les k plus proches voisins (k-NN) extraits des démonstrations expertes, leurs actions associées, et les vecteurs de distance relative entre les états voisins et l'état requête courant. En reformulant le problème d'imitation en termes de structure de voisinage local plutôt que de mappings directs, la méthode revendique des gains de performance de 15 à 46 % sur behavior cloning standard, mesurés sur des benchmarks de contrôle continu et de manipulation robotique, y compris avec des représentations visuelles haute dimension. L'amplitude de cette fourchette suggère des variations importantes selon les tâches et les domaines évalués. L'intérêt concret de DARP réside dans sa capacité à atténuer le problème de "compounding errors" : lors du déploiement, un agent entraîné par behavior cloning accumule des erreurs en rencontrant des états hors distribution, dégradant rapidement les performances. En réutilisant les données d'entraînement au moment de l'inférence, DARP introduit une forme de mémoire épisodique sans nécessiter de collecte de données supplémentaires, de feedback expert en ligne, ni de connaissance spécifique à la tâche. C'est là la distinction clé vis-à-vis de méthodes comme DAgger (Ross et Bagnell, 2011), qui résolvent la distribution shift mais exigent des requêtes à l'expert pendant l'entraînement, une contrainte souvent rédhibitoire en robotique industrielle réelle. Le behavior cloning reste une méthode de référence pour son absence de contraintes opérationnelles, mais sa fragilité face à la distribution shift en limite la portée pour des déploiements à grande échelle. DARP s'inscrit dans un courant de méthodes semi-paramétriques qui connaît un regain d'intérêt avec la montée des politiques génératives : l'idée de conserver explicitement une mémoire des démonstrations plutôt que de tout comprimer dans des poids de réseau est cohérente avec les architectures hybrides actuelles, comme les VLA Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). Les résultats sur représentations visuelles haute dimension ouvrent la voie à des applications sur des manipulateurs avec vision RGB, domaine où les approches purement paramétriques montrent encore des limites significatives. Le code et les démonstrations sont disponibles publiquement via le site des auteurs.

RecherchePaper
1 source
FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage
2arXiv cs.RO 

FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage

Des chercheurs proposent FLARE (Failure-Aware framework for Autonomous Correction and Recovery), publié sur arXiv sous la référence 2608.26645v1, une méthode destinée aux modèles vision-langage-action (VLA) utilisés pour la manipulation robotique. Le système repose sur deux mécanismes complémentaires baptisés « Retry » et « Reset ». Le mécanisme Retry injecte des perturbations et des segments de transition dans les démonstrations d'entraînement, en dissociant la pose du robot de l'état de l'environnement, afin que la politique apprenne à gérer seule les écarts d'exécution mineurs comme une prise ratée ou un objet qui glisse. Le pipeline Reset s'attaque aux échecs plus graves, dits hors distribution (OOD), qui rompent l'état de la tâche : un grand modèle multimodal (MLLM) analyse hors ligne des vidéos d'exécution pour repérer automatiquement ces états OOD, ce qui permet de constituer une petite bibliothèque ciblée de compétences de récupération centrées sur les objets. En inférence, un moniteur MLLM en ligne arbitre en temps réel entre poursuite de la tâche et déclenchement d'une compétence Reset. Les auteurs annoncent des gains de taux de réussite et de robustesse sur des tâches de manipulation complexes et riches en contacts, sans toutefois détailler dans le résumé les chiffres précis ni la plateforme robotique testée. L'enjeu touche un point faible connu des VLA : entraînés sur des démonstrations « parfaites », sans échec, ils peinent souvent à se rattraper en conditions réelles, un écart classique entre démonstration et déploiement. Pour les intégrateurs et les équipes robotique industrielles, la capacité à détecter et corriger automatiquement une erreur d'exécution, sans intervention humaine ni réinitialisation manuelle du poste de travail, conditionne directement la viabilité de cellules de manipulation autonomes en production. FLARE s'inscrit dans une tendance de recherche qui cherche à combler l'écart entre les démonstrations vidéo souvent présentées par les laboratoires et la réalité d'une ligne de production où objets glissent, collisions surviennent et préhenseurs ratent leur prise. Le travail s'inscrit dans la lignée des modèles VLA génériques récemment mis en avant dans le secteur, comme Pi-0, GR00T N2 ou Helix, qui visent à généraliser la manipulation à partir d'un apprentissage à grande échelle mais partagent la même limite de données d'entraînement sans échec. FLARE reste à ce stade une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel ni de partenariat commercial associé ; sa validation repose sur des expériences en laboratoire, et son adoption dépendra de tests indépendants et d'une éventuelle intégration dans des piles logicielles de manipulation existantes.

RechercheActu
1 source
Primitives de mouvement dynamiques conscientes de la tâche pour la détection d'échecs et la récupération en manipulation à contact riche
3arXiv cs.RO 

Primitives de mouvement dynamiques conscientes de la tâche pour la détection d'échecs et la récupération en manipulation à contact riche

Un papier de recherche publié sur arXiv (2609.23151v1, catégorie cross-listing) présente un système de détection d'échec et de récupération pour l'assemblage robotique en manipulation à contact riche, appliqué à une tâche d'insertion peg-in-hole (tige dans trou). La méthode combine des Dynamic Movement Primitives (DMP), technique d'apprentissage par démonstration capable d'encoder une trajectoire à partir d'une seule démonstration, avec une classification en temps réel de l'étape d'exécution (approche, alignement, insertion) réalisée par analyse discriminante quadratique (QDA) entraînée sur des données de capteurs multimodales. Un détecteur d'anomalie fondé sur la distance de Mahalanobis, calculée sur les signaux de force, isole les échecs liés au contact des trajectoires nominales. En cas de défaillance détectée, une politique de recherche en spirale réaligne activement la pièce sous contact avant de reprendre l'insertion apprise par DMP. Sur le banc d'essai expérimental, le système atteint 95% de précision de classification des étapes et récupère de manière fiable des désalignements latéraux allant jusqu'à 3 mm, à partir d'une unique démonstration initiale. L'intérêt pratique tient à la fragilité connue des méthodes d'apprentissage par démonstration face aux variations de prise initiale et aux forces de contact imprévues, un point faible qui provoque la majorité des échecs dans les phases d'assemblage à tolérances serrées en usine. En rendant la classification des étapes robuste aux positions cibles non vues sans réentraînement, l'approche réduit un frein pratique majeur à l'adoption du LfD en intégration industrielle: la nécessité de redémontrer la tâche pour chaque nouvelle configuration de pièce. Pour les intégrateurs travaillant sur l'assemblage fin avec bras robotiques ou plateformes humanoïdes, ce type de couche de détection et récupération d'échec constitue une brique nécessaire pour passer de démonstrations en laboratoire à une exécution fiable en production, là où le contact non maîtrisé reste un goulot d'étranglement connu. Le travail s'inscrit dans la lignée des DMP, formalisme ancien en apprentissage par démonstration, et des techniques établies de détection d'anomalie par distance de Mahalanobis et de recherche en spirale pour l'insertion sous contact, que les auteurs combinent en un pipeline unique de classification et récupération adaptatif. L'abstract ne précise ni affiliation académique, ni industriel partenaire, ni calendrier de déploiement au-delà de la validation expérimentale décrite, ce travail relevant à ce stade de la recherche méthodologique plutôt que d'un produit ou pilote industriel annoncé.

RecherchePaper
1 source
F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots
4arXiv cs.RO 

F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots

Des chercheurs proposent F4R (Failure for Rising), un cadre d'apprentissage en boucle fermée « real-to-sim-to-real » qui transforme les échecs observés en conditions réelles en améliorations ciblées d'une politique de type vision-langage-action (VLA). Le système enchaîne quatre étapes : un agent identifie et diagnostique automatiquement les échecs à partir des rollouts, chaque échec est reconstruit sous forme d'environnement de table interactif centré sur les objets, la politique est affinée par un co-entraînement simulation/réel conditionné par l'échec puis par de l'apprentissage par renforcement ciblé dans ces environnements reconstruits, et la politique améliorée est redéployée. Les nouveaux échecs alimentent le cycle suivant. Sur quatre tâches de manipulation testées en conditions réelles, F4R atteint 93,75 % de réussite en distribution et 90,0 % hors distribution (OOD). Il devance de 18,75 points de pourcentage, en OOD, une base de comparaison à budget égal, le Targeted BC (clonage comportemental ciblé), et ce sans collecte de nouvelles démonstrations correctives dans le monde réel. L'enjeu est très concret pour les intégrateurs et les équipes qui déploient des VLA. La réponse habituelle à un échec en production consiste à collecter de nouvelles démonstrations d'experts, ce qui coûte cher, demande du temps opérateur, peut être risqué pour le matériel et se met mal à l'échelle. Déplacer la correction vers la simulation, à partir de scènes reconstruites à partir de l'échec réel, viserait à réduire ce goulot d'étranglement. Si ces résultats se confirment, ils indiqueraient qu'un écart de robustesse hors distribution peut se combler sans téléopération supplémentaire, et que la reconstruction ciblée permet de contourner en partie le problème du sim-to-real, généralement traité avec des simulateurs génériques. Des réserves s'imposent : l'évaluation ne porte que sur quatre tâches de table, avec des objets manipulés simples, et l'article ne détaille pas ici le nombre d'essais ni les modèles de base. Les gains sont mesurés face à une seule base à budget égal, et la transposition à des scènes encombrées, à des objets déformables ou à des cellules industrielles reste à démontrer. Ce travail s'inscrit dans la course à la fiabilité des politiques généralistes de type Pi-0, Helix ou GR00T, dont les performances réelles restent limitées par la couverture des démonstrations et par une compréhension encore partielle des interactions physiques. Il prolonge les approches de real-to-sim et de réglage par renforcement de VLA, ainsi que les boucles de « data flywheel » que les acteurs industriels revendiquent pour leurs flottes. La différence tient ici à l'automatisation du diagnostic et à la reconstruction de chaque échec comme environnement d'entraînement. Il s'agit d'une publication de recherche sur arXiv (version 2 remplaçant la précédente), sans produit ni déploiement commercial annoncé. La suite logique serait de valider la méthode sur des robots plus variés, des tâches plus longues et des cadences industrielles, avant d'envisager une intégration dans des chaînes de déploiement continu.

RecherchePaper
1 source