Aller au contenu principal
RecherchearXiv cs.RO 

EmbodiRSI : l'auto-amélioration récursive pour une adaptation des robots économe en données

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv EmbodiRSI, un système « agentique » d'auto-amélioration récursive (RSI) pour adapter des politiques de manipulation robotique à de nouvelles tâches et environnements. Le principe repose sur une boucle « real-to-sim-to-real » : une simulation spécifique à la tâche est construite à partir du scénario de déploiement cible, puis sert d'environnement peu coûteux pour améliorer la politique par itérations avant son retour sur le robot physique. Deux mécanismes ferment la boucle. La Collaborative Error Correction génère, avec l'aide d'un agent, des trajectoires correctives à partir des états que la politique a réellement atteints. L'Adaptive Data Collection oriente la génération de démonstrations expertes vers les faiblesses actuelles de la politique. Sur trois environnements de table et 14 sous-tâches, le taux de réussite autonome en simulation, équilibré par scène, passe de 50,4 % à 83,5 % en deux mises à jour RSI. Avec 400 trajectoires simulées adaptatives et seulement dix trajectoires réelles de raffinement par sous-tâche, le système atteint 83,1 % de réussite réelle, contre 75,0 % pour une adaptation à partir de 200 démonstrations réelles par sous-tâche.

L'enjeu est le coût de la donnée, principal goulot d'étranglement du déploiement de politiques de type VLA ou d'imitation chez les intégrateurs. Ici, le volume de données réelles est divisé par vingt (10 contre 200 démonstrations par sous-tâche) pour un résultat supérieur de plus de huit points. Si ce résultat se confirme, la simulation spécifique au site cesse d'être un simple banc d'essai et devient un espace de travail réutilisable pour le préchauffage, l'évaluation répétable, le diagnostic des échecs et la génération ciblée de données. Cela réduit la dépendance à la téléopération, coûteuse en main-d'œuvre. Le résultat nuance aussi l'idée que le sim-to-real exige une simulation généraliste : une simulation étroite, construite pour un seul déploiement, peut suffire. Des réserves s'imposent toutefois. Les tâches sont de la manipulation sur table, le nombre de sous-tâches est limité, la fidélité de la reconstruction de scène n'est pas détaillée dans le résumé, et aucun temps de cycle, taux de panne ni coût de construction de la simulation n'est donné. Le travail reste une prépublication, sans pilote industriel annoncé.

Ce travail s'inscrit dans la poussée actuelle vers l'adaptation efficace en données des politiques généralistes, alors que le fine-tuning post-entraînement par démonstrations réelles reste la pratique dominante. Il rejoint les approches de reconstruction de scènes pour la simulation (real-to-sim), de génération de données synthétiques et de boucles d'amélioration pilotées par des agents, explorées par les grands laboratoires et les équipes derrière des modèles comme Pi-0 ou GR00T. L'originalité tient au pilotage de la collecte par les échecs observés de la politique, plutôt qu'à une génération de données uniforme. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues et sur des objets déformables ou en contact riche, la réplication par des tiers, la publication du code et des benchmarks, et surtout un test en conditions industrielles, où la variabilité des scènes dépasse largement celle d'un plateau de laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques
1arXiv cs.RO 

Tir dans l'espace des compétences pour l'amélioration autonome des politiques robotiques

Une équipe de chercheurs publie sur arXiv (v1, septembre 2026) une méthode baptisée « skill-space shooting », conçue pour permettre à un robot déployé de corriger seul les échecs de sa politique de contrôle, sans que l'humain ait à démontrer chaque correction. Le principe repose sur un modèle de fondation, qui guide l'exploration de corrections à travers des compétences courtes et réutilisables (les « skills »). Ces comportements récurrents d'une tâche à l'autre, comme saisir, pousser ou repositionner un objet, sont choisis par le modèle à partir de la scène observée. Les essais réussis sont ensuite convertis en supervision corrective pour réentraîner la politique. Les auteurs affirment que des expériences en conditions réelles montrent une amélioration répétée de politiques agissant de manière autonome, et que les skills peuvent être partagés entre tâches pour réduire l'effort d'enseignement sur de nouvelles tâches. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni plateforme robotique, ni gain chiffré. Ces éléments devront être vérifiés dans le papier complet et sur la page de résultats vidéo associée. L'enjeu est un goulot d'étranglement bien connu du déploiement de robots : l'amélioration après mise en service dépend encore largement de téléopérateurs qui produisent des démonstrations correctives. Les systèmes dits agentiques, où un modèle de fondation compose des comportements appris pour finir une tâche, contournent l'humain, mais ne rendent pas la politique elle-même meilleure. Elle échouera de nouveau au même endroit. Le travail cherche à combler cet écart en transformant les succès obtenus par composition de skills en données d'apprentissage. Si le résultat tient à l'échelle, il réduirait le coût marginal de chaque correction, un poste critique pour les intégrateurs qui exploitent des flottes de robots. Il faut toutefois rester prudent : il s'agit d'un préprint non évalué par des pairs, et les vidéos publiées par les auteurs sont généralement sélectionnées. La généralisation entre tâches reste à démontrer sur des cas plus variés que ceux d'un laboratoire. Ce travail s'inscrit dans la course aux politiques vision-langage-action (VLA), comme Pi-0 ou GR00T, qui sont pré-entraînées sur de grands volumes de démonstrations, puis affinées, souvent avec de la téléopération humaine. Il rejoint aussi les recherches sur l'apprentissage par renforcement et l'auto-amélioration en conditions réelles, qui butent sur le coût des essais physiques et sur la conception des récompenses. L'usage de skills comme espace de recherche restreint l'exploration et la rend plus sûre et plus efficace que des actions brutes. La suite dépendra de la publication du code, des comparaisons avec les approches d'amélioration existantes et d'éventuels tests sur des robots industriels. Aucun pilote commercial n'est annoncé à ce stade.

RecherchePaper
1 source
F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots
2arXiv cs.RO 

F4R : reconnaissance, reconstruction, raffinement et redéploiement guidés par les échecs pour l'auto-amélioration continue des robots

Des chercheurs proposent F4R (Failure for Rising), un cadre d'apprentissage en boucle fermée « real-to-sim-to-real » qui transforme les échecs observés en conditions réelles en améliorations ciblées d'une politique de type vision-langage-action (VLA). Le système enchaîne quatre étapes : un agent identifie et diagnostique automatiquement les échecs à partir des rollouts, chaque échec est reconstruit sous forme d'environnement de table interactif centré sur les objets, la politique est affinée par un co-entraînement simulation/réel conditionné par l'échec puis par de l'apprentissage par renforcement ciblé dans ces environnements reconstruits, et la politique améliorée est redéployée. Les nouveaux échecs alimentent le cycle suivant. Sur quatre tâches de manipulation testées en conditions réelles, F4R atteint 93,75 % de réussite en distribution et 90,0 % hors distribution (OOD). Il devance de 18,75 points de pourcentage, en OOD, une base de comparaison à budget égal, le Targeted BC (clonage comportemental ciblé), et ce sans collecte de nouvelles démonstrations correctives dans le monde réel. L'enjeu est très concret pour les intégrateurs et les équipes qui déploient des VLA. La réponse habituelle à un échec en production consiste à collecter de nouvelles démonstrations d'experts, ce qui coûte cher, demande du temps opérateur, peut être risqué pour le matériel et se met mal à l'échelle. Déplacer la correction vers la simulation, à partir de scènes reconstruites à partir de l'échec réel, viserait à réduire ce goulot d'étranglement. Si ces résultats se confirment, ils indiqueraient qu'un écart de robustesse hors distribution peut se combler sans téléopération supplémentaire, et que la reconstruction ciblée permet de contourner en partie le problème du sim-to-real, généralement traité avec des simulateurs génériques. Des réserves s'imposent : l'évaluation ne porte que sur quatre tâches de table, avec des objets manipulés simples, et l'article ne détaille pas ici le nombre d'essais ni les modèles de base. Les gains sont mesurés face à une seule base à budget égal, et la transposition à des scènes encombrées, à des objets déformables ou à des cellules industrielles reste à démontrer. Ce travail s'inscrit dans la course à la fiabilité des politiques généralistes de type Pi-0, Helix ou GR00T, dont les performances réelles restent limitées par la couverture des démonstrations et par une compréhension encore partielle des interactions physiques. Il prolonge les approches de real-to-sim et de réglage par renforcement de VLA, ainsi que les boucles de « data flywheel » que les acteurs industriels revendiquent pour leurs flottes. La différence tient ici à l'automatisation du diagnostic et à la reconstruction de chaque échec comme environnement d'entraînement. Il s'agit d'une publication de recherche sur arXiv (version 2 remplaçant la précédente), sans produit ni déploiement commercial annoncé. La suite logique serait de valider la méthode sur des robots plus variés, des tâches plus longues et des cadences industrielles, avant d'envisager une intégration dans des chaînes de déploiement continu.

RecherchePaper
1 source
BIDETA : une adaptation tactile inspirée du cerveau, économe en données, pour capteurs inconnus
3arXiv cs.RO 

BIDETA : une adaptation tactile inspirée du cerveau, économe en données, pour capteurs inconnus

Une équipe de recherche propose BIDETA (Brain-Inspired Data-Efficient Tactile Adaptation), un cadre logiciel destiné à adapter les modèles de perception tactile à des capteurs inconnus, décrit dans une version mise à jour d'un article déposé sur arXiv (arXiv:2609.08673v2, replace). Le système fonctionne sans rétropropagation de gradient: il conserve un encodeur tactile figé et ne nécessite qu'un petit nombre de contacts labellisés sur le capteur cible pour prédire les étiquettes d'un lot de requêtes non labellisées. Testé sur trois jeux de données de référence en perception tactile, SITR, TacVerse Shape et TacQuad, BIDETA affiche des gains chiffrés nets: sur SITR, avec seulement 10% de données cibles labellisées, la précision moyenne du classifieur Sparsh passe de 6,86% (avec l'encodeur source figé, sans adaptation) à 87,09%, soit 47,22 points de pourcentage de plus que la meilleure méthode concurrente testée par les auteurs. Sur le benchmark de rapidité SITR combiné à TVL, l'adaptation au nouveau capteur se ferait environ 20 fois plus vite que la meilleure référence. Ce travail cible un verrou concret pour l'industrie de la manipulation robotique: les capteurs tactiles à base de vision, utilisés pour la préhension et les tâches à contact riche, reposent sur des mécanismes de détection propres à chaque fabricant, si bien qu'un modèle de fondation tactile entraîné sur un capteur perd fortement en performance dès qu'il est déployé sur un autre matériel. Les méthodes existantes de transfert inter-capteurs exigeaient jusqu'ici des données de calibration, des observations appariées entre capteurs ou un réentraînement itératif coûteux, des contraintes difficilement compatibles avec un déploiement industriel à grande échelle sur des flottes hétérogènes de robots équipés de capteurs différents. Une adaptation rapide et peu gourmande en données labellisées réduirait donc un frein réel à la généralisation des modèles tactiles au-delà du matériel sur lequel ils ont été entraînés. Sur le plan méthodologique, BIDETA s'inspire de l'adaptation sensorielle rapide observée chez le cerveau humain et combine trois mécanismes: une mémoire de support à activation rapide, des graphes spectraux conditionnés par ce support, et une récurrence pondérée par la fiabilité des évidences, afin de préserver les représentations préentraînées tout en corrigeant les voisinages de caractéristiques propres à chaque capteur. Les comparaisons s'appuient notamment sur les modèles Sparsh et TVL comme références. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, sans acteur industriel ni déploiement commercial associé dans les éléments fournis.

RecherchePaper
1 source
Récompense intrinsèque des robots : représentations VLA réutilisées pour évaluation autonome et politiques améliorées
4arXiv cs.RO 

Récompense intrinsèque des robots : représentations VLA réutilisées pour évaluation autonome et politiques améliorées

Une équipe de recherche publie sur arXiv (préprint 2609.17115v1) une proposition baptisée Intrinsic Robot Rewarding (IRR), une méthode de récompense pour l'apprentissage robotique qui réutilise les représentations visuelles déjà produites par un système vision-langage-action (VLA) plutôt que d'en créer de nouvelles. Le principe : les points finaux de démonstrations réussies servent de références propres à chaque tâche, et l'encodeur visuel gelé de la politique VLA fournit l'espace de caractéristiques dans lequel les nouveaux résultats du robot sont comparés à ces références. Le mécanisme central se limite à l'ajout d'une banque de références et d'une opération de scoring au pipeline existant, sans évaluateur appris séparé ni backbone de perception additionnel. Les auteurs disposent d'un démonstrateur opérationnel sur un bras industriel COMAU Racer 3, évalué au niveau de maturité technologique TRL 4, c'est-à-dire une validation en environnement de laboratoire, et non un produit commercialisé ni un déploiement en usine. L'enjeu concret pour les intégrateurs et les équipes de R&D robotique porte sur le coût récurrent de l'évaluation humaine des résultats, un goulot d'étranglement classique pour améliorer une politique après déploiement. En s'appuyant sur des composants déjà présents dans les systèmes robotiques industriels (encodeur visuel, banque de démonstrations), IRR promet de réduire l'effort d'intégration et le calcul de récompense sans backbone dédié. Ceci s'inscrit dans le débat plus large sur le passage à l'échelle des politiques VLA de type Pi-0, GR00T N2 ou Helix : la capacité à générer un retour fiable et peu coûteux, sans supervision humaine constante, conditionne l'amélioration continue en production. Il s'agit cependant d'un article de position qui formule des questions de recherche et une méthodologie d'évaluation, pas de résultats démontrés à grande échelle ; le lien entre fiabilité de la récompense et taux de réussite des tâches reste à établir. Le travail s'appuie sur des recherches antérieures en récompenses visuelles et en apprentissage par l'expérience, et vise comme prochaine étape à relier cette évaluation interne des résultats à une amélioration effective de la politique physique du robot, ce qui n'est pas encore réalisé. Le choix d'un bras industriel classique, le COMAU Racer 3 du constructeur italien COMAU, plutôt qu'un humanoïde, signale un positionnement vers la modernisation de cellules d'automatisation industrielle existantes plutôt que vers la course aux robots bipèdes générativistes. Aucun calendrier de pilote industriel n'est annoncé à ce stade ; les auteurs présentent leur démonstrateur comme une base de laboratoire destinée à soutenir de futurs travaux de recherche sur le lien entre récompense intrinsèque et apprentissage de politique.

UELe démonstrateur repose sur un bras industriel COMAU, fabricant italien, ce qui illustre l'intérêt potentiel de cette recherche pour le parc de robots industriels européens, sans pilote industriel annoncé à ce stade.

RecherchePaper
1 source