Aller au contenu principal
F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots
RecherchearXiv cs.RO 

F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent F4R (Failure for Rising), un cadre d'apprentissage en boucle fermée « real-to-sim-to-real » qui transforme les échecs observés en conditions réelles en améliorations ciblées d'une politique de type vision-langage-action (VLA). Le système enchaîne quatre étapes : un agent identifie et diagnostique automatiquement les échecs à partir des rollouts, chaque échec est reconstruit sous forme d'environnement de table interactif centré sur les objets, la politique est affinée par un co-entraînement simulation/réel conditionné par l'échec puis par de l'apprentissage par renforcement ciblé dans ces environnements reconstruits, et la politique améliorée est redéployée. Les nouveaux échecs alimentent le cycle suivant. Sur quatre tâches de manipulation testées en conditions réelles, F4R atteint 93,75 % de réussite en distribution et 90,0 % hors distribution (OOD). Il devance de 18,75 points de pourcentage, en OOD, une base de comparaison à budget égal, le Targeted BC (clonage comportemental ciblé), et ce sans collecte de nouvelles démonstrations correctives dans le monde réel.

L'enjeu est très concret pour les intégrateurs et les équipes qui déploient des VLA. La réponse habituelle à un échec en production consiste à collecter de nouvelles démonstrations d'experts, ce qui coûte cher, demande du temps opérateur, peut être risqué pour le matériel et se met mal à l'échelle. Déplacer la correction vers la simulation, à partir de scènes reconstruites à partir de l'échec réel, viserait à réduire ce goulot d'étranglement. Si ces résultats se confirment, ils indiqueraient qu'un écart de robustesse hors distribution peut se combler sans téléopération supplémentaire, et que la reconstruction ciblée permet de contourner en partie le problème du sim-to-real, généralement traité avec des simulateurs génériques. Des réserves s'imposent : l'évaluation ne porte que sur quatre tâches de table, avec des objets manipulés simples, et l'article ne détaille pas ici le nombre d'essais ni les modèles de base. Les gains sont mesurés face à une seule base à budget égal, et la transposition à des scènes encombrées, à des objets déformables ou à des cellules industrielles reste à démontrer.

Ce travail s'inscrit dans la course à la fiabilité des politiques généralistes de type Pi-0, Helix ou GR00T, dont les performances réelles restent limitées par la couverture des démonstrations et par une compréhension encore partielle des interactions physiques. Il prolonge les approches de real-to-sim et de réglage par renforcement de VLA, ainsi que les boucles de « data flywheel » que les acteurs industriels revendiquent pour leurs flottes. La différence tient ici à l'automatisation du diagnostic et à la reconstruction de chaque échec comme environnement d'entraînement. Il s'agit d'une publication de recherche sur arXiv (version 2 remplaçant la précédente), sans produit ni déploiement commercial annoncé. La suite logique serait de valider la méthode sur des robots plus variés, des tâches plus longues et des cadences industrielles, avant d'envisager une intégration dans des chaînes de déploiement continu.

À lire aussi

iTeach : enseignement interactif en conditions réelles pour l'adaptation de la perception des robots guidée par les échecs
1arXiv cs.RO 

iTeach : enseignement interactif en conditions réelles pour l'adaptation de la perception des robots guidée par les échecs

iTeach est un système déployable qui permet à un opérateur présent près du robot, sans expertise ni station de travail, de corriger sur place les erreurs de perception d'un robot mobile. L'opérateur porte un casque de réalité mixte et voit les prédictions de segmentation du robot superposées à la scène réelle. Il corrige ensuite les erreurs sans les mains. Il peut réarranger les objets (mode « HumanPlay »), annoter au regard et à la voix, ou déclencher la propagation arrière de masques de SAM2. Chaque interaction dure environ 20 secondes et produit 150 à 300 images densément annotées. Le modèle est affiné à bord, comparé à la version précédente, puis redéployé si l'affinage l'améliore. La boucle demande seulement une caméra RGB-D, un GPU embarqué et un casque. Sur des scènes encombrées réelles, la segmentation passe de 26,1 à 80,7 après 45 interactions (13 000 images), sans oubli catastrophique. Le résumé ne précise pas la métrique utilisée. Le modèle progresse aussi sur trois benchmarks standard qu'il n'a jamais vus en entraînement. En pick-and-place sur SceneReplica, le système atteint 72 réussites sur 100, devant un pipeline à base de modèles qui exige des CAD. Une étude de 12 participants indique que les non-experts égalent les experts en précision d'annotation (environ 95 % d'IoU des boîtes), en vitesse et en charge cognitive (NASA-TLX de 21/100). Pour un intégrateur, l'intérêt tient à la fermeture de la boucle sur site, sans envoi de données ni réentraînement hors ligne par une équipe ML. Cela s'attaque directement à l'écart entre démonstration et réalité, car la perception échoue le plus souvent sur des objets et des environnements propres au client. Le gain face à un pipeline avec CAD suggère qu'une perception apprise et adaptée localement peut battre des approches qui demandent une préparation lourde des modèles d'objets. Le cadre est indépendant de l'architecture, ce qui limite le risque de dépendance à un modèle. Il s'agit d'une publication de recherche (arXiv 2410.09072, cinquième version) et non d'un produit livré. Aucun déploiement industriel n'est annoncé. Les résultats reposent sur des scènes et un protocole choisis par les auteurs, et la robustesse à long terme comme la charge en environnement de production restent à démontrer. Le travail s'inscrit dans l'apprentissage interactif et l'apprentissage par correction humaine, et il exploite la propagation vidéo de SAM2 pour réduire le coût d'annotation. Les suites logiques sont des tests sur des flottes de robots, des tâches plus variées et des comparaisons avec d'autres méthodes d'adaptation continue.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques
2arXiv cs.RO 

FAR : retentative sensible aux échecs pour la récupération en cours de test et l'amélioration continue des politiques

Les chercheurs à l'origine de ce papier arXiv (référence 2607.01111v1) présentent FAR (Failure-Aware Retry), un framework qui permet à un robot manipulateur d'apprendre de ses propres échecs directement au moment du test, sans intervention humaine, pour finir par accomplir la tâche de façon autonome. Le système combine deux mécanismes: la Failure-Contrastive Preference Adaptation, qui transforme chaque échec en donnée de préférence pour écarter la politique des comportements déjà ratés, et des perturbations d'action légères appliquées lors des tentatives suivantes pour favoriser une exploration locale ciblée autour du point d'échec. Les trajectoires de récupération qui réussissent sont ensuite réinjectées dans une boucle d'entraînement, ce qui permet une amélioration continue de la politique. Testé en simulation et sur des tâches de manipulation réelles, FAR améliore le taux de réussite de 17,6% en moyenne par rapport à une politique de diffusion standard en simulation, et de 11,7% en conditions réelles. Ce travail s'attaque à un problème concret pour l'industrie: la plupart des politiques de manipulation actuelles, notamment celles basées sur la diffusion, échouent silencieusement en réel et se contentent de répéter la même erreur lors d'un nouvel essai, faute de mécanisme pour comprendre pourquoi elles ont échoué. Les méthodes de récupération existantes s'appuient généralement sur un opérateur humain pour réinitialiser ou corriger le robot, ce qui limite le déploiement autonome à grande échelle et alourdit le coût des essais réels. En démontrant qu'un robot peut exploiter ses propres échecs comme signal d'apprentissage plutôt que comme simple bruit à ignorer, FAR va dans le sens d'une meilleure robustesse des politiques VLA et de diffusion en environnement non contrôlé, un enjeu central pour les intégrateurs qui cherchent à réduire la supervision humaine sur des lignes de manipulation. FAR s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et l'apprentissage par imitation appliqués à la manipulation robotique, où la question du "reset" et du "budget de pas de temps" pendant l'entraînement continu reste un goulot d'étranglement pratique. Les auteurs montrent justement que leur méthode améliore l'efficacité des données sous ces deux contraintes de budget, en exploitant préférentiellement les cas d'échec les plus informatifs. Le papier, classé comme nouvelle soumission sur arXiv, ouvre la voie à des extensions vers d'autres familles de politiques et vers des déploiements réels prolongés, sans que des pilotes industriels concrets ne soient encore annoncés à ce stade.

RecherchePaper
1 source
Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot
3arXiv cs.RO 

Raisonnement robuste sur l'état d'assemblage par reconnaissance d'actions pour la collaboration homme-robot

Une étude publiée sur arXiv (identifiant 2606.20150) en juin 2026 évalue de manière systématique cinq méthodes de suivi d'état d'assemblage à partir de la reconnaissance d'actions humaines (HAR), dans le cadre de la collaboration homme-robot (HRC). Les chercheurs ont testé des approches à base de règles logiques, de modèles de Markov cachés (HMM) et de réseaux de neurones (NN) sur deux jeux de données aux caractéristiques différentes. Les tests combinent des entrées simulées avec différents niveaux de bruit et des entrées réalistes issues d'un modèle HAR opérationnel. L'objectif est de déterminer quelle méthode permet de suivre fidèlement l'état d'une tâche d'assemblage coopérative, étape par étape, à partir de la seule reconnaissance des gestes humains. Les résultats contredisent l'hypothèse dominante selon laquelle les approches par réseaux de neurones surpassent systématiquement les méthodes classiques. Les NN et HMM affichent de bonnes performances sur des tâches à faible variabilité, mais se révèlent fragiles face à des séquences atypiques ou bruitées. Les méthodes logiques, bien que moins sophistiquées, se montrent plus robustes dans les scénarios à haute variabilité. Par ailleurs, la modélisation de la durée attendue des actions s'avère critique pour les tâches comportant des actions répétées, notamment lorsqu'aucun capteur complémentaire ne fournit de signal de confirmation. Ce constat a des implications directes pour les intégrateurs industriels qui déploient des cellules HRC sur des lignes d'assemblage réelles : choisir un modèle d'inférence d'état inadapté au profil de la tâche peut entraîner des erreurs de synchronisation robot-opérateur difficiles à diagnostiquer. Ce travail s'inscrit dans un domaine de recherche en pleine effervescence, porté par l'essor des robots collaboratifs (cobots) dans les environnements manufacturiers. Des acteurs comme Universal Robots, FANUC ou encore des laboratoires européens tels que ceux du LAAS-CNRS et de Fraunhofer travaillent sur des pipelines HAR similaires pour des applications d'assistance à l'assemblage. La difficulté centrale, le "demo-to-reality gap" entre conditions de laboratoire et déploiement en usine, reste entière. Cette étude ne propose pas de solution universelle mais établit une carte comparative utile, à condition que les praticiens caractérisent d'abord la variabilité réelle de leur tâche avant de sélectionner une architecture de suivi d'état.

UELe LAAS-CNRS et Fraunhofer sont explicitement cités comme acteurs travaillant sur des pipelines HAR similaires, et les conclusions comparatives offrent une grille de décision directement utilisable par les intégrateurs européens qui déploient des cellules cobot sur des lignes d'assemblage réelles.

RecherchePaper
1 source
Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques
4arXiv cs.RO 

Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques

Une équipe de chercheurs publie sur arXiv (v1, septembre 2026) une méthode baptisée « skill-space shooting », conçue pour permettre à un robot déployé de corriger seul les échecs de sa politique de contrôle, sans que l'humain ait à démontrer chaque correction. Le principe repose sur un modèle de fondation, qui guide l'exploration de corrections à travers des compétences courtes et réutilisables (les « skills »). Ces comportements récurrents d'une tâche à l'autre, comme saisir, pousser ou repositionner un objet, sont choisis par le modèle à partir de la scène observée. Les essais réussis sont ensuite convertis en supervision corrective pour réentraîner la politique. Les auteurs affirment que des expériences en conditions réelles montrent une amélioration répétée de politiques agissant de manière autonome, et que les skills peuvent être partagés entre tâches pour réduire l'effort d'enseignement sur de nouvelles tâches. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni plateforme robotique, ni gain chiffré. Ces éléments devront être vérifiés dans le papier complet et sur la page de résultats vidéo associée. L'enjeu est un goulot d'étranglement bien connu du déploiement de robots : l'amélioration après mise en service dépend encore largement de téléopérateurs qui produisent des démonstrations correctives. Les systèmes dits agentiques, où un modèle de fondation compose des comportements appris pour finir une tâche, contournent l'humain, mais ne rendent pas la politique elle-même meilleure. Elle échouera de nouveau au même endroit. Le travail cherche à combler cet écart en transformant les succès obtenus par composition de skills en données d'apprentissage. Si le résultat tient à l'échelle, il réduirait le coût marginal de chaque correction, un poste critique pour les intégrateurs qui exploitent des flottes de robots. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, et les vidéos publiées par les auteurs sont généralement sélectionnées. La généralisation entre tâches reste à démontrer sur des cas plus variés que ceux d'un laboratoire. Ce travail s'inscrit dans la course aux politiques vision-langage-action (VLA), comme Pi-0 ou GR00T, qui sont pré-entraînées sur de grands volumes de démonstrations, puis affinées, souvent avec de la téléopération humaine. Il rejoint aussi les recherches sur l'apprentissage par renforcement et l'auto-amélioration en conditions réelles, qui butent sur le coût des essais physiques et sur la conception des récompenses. L'usage de skills comme espace de recherche restreint l'exploration et la rend plus sûre et plus efficace que des actions brutes. La suite dépendra de la publication du code, des comparaisons avec les approches d'amélioration existantes et d'éventuels tests sur des robots industriels. Aucun pilote commercial n'est annoncé à ce stade.

RecherchePaper
1 source