Aller au contenu principal
RecherchearXiv cs.RO 

L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un benchmark publié sur arXiv (2610.00542v1) s'attaque à une question que les évaluations classiques d'apprentissage par imitation continu laissent de côté : un robot qui conserve ses anciennes compétences reste-t-il réellement guidé par le langage ? Les auteurs construisent un protocole fondé sur LIBERO, avec des variantes d'instructions qui préservent le sens (paraphrases) et d'autres qui le modifient, pour les quatre suites Goal, Spatial, Object et Long. Les expériences de politiques portent surtout sur LIBERO-Goal. Les politiques y sont évaluées après chaque étape d'apprentissage séquentiel, avec les instructions originales puis paraphrasées. Plusieurs méthodes représentatives d'imitation continue sont comparées dans leurs hypothèses d'origine. Trois diagnostics complètent les métriques habituelles d'apprentissage et d'oubli : la robustesse sémantique, l'adaptation à l'objectif et la sensibilité au langage. Le matériel complémentaire est publié sur une page projet intitulée « stillgrounded ».

Le résultat principal tient en une phrase : de bonnes performances en apprentissage continu ne garantissent pas un ancrage langagier fiable. Une politique peut afficher un taux de réussite élevé sans avoir conservé le lien entre l'instruction et l'action. Elle peut s'appuyer sur des indices de scène, des associations d'objets ou une structure de tâche mémorisée. Pour les intégrateurs et les responsables techniques qui envisagent des robots pilotés par VLA (vision-language-action) et mis à jour en continu, le point est concret. Un robot qui exécute correctement « ses » tâches en conditions de test peut échouer ou agir de façon incohérente si la consigne est reformulée ou modifiée. Cela relativise aussi les scores de benchmark en rétention de tâches, qui peuvent surestimer la fiabilité réelle d'une compétence retenue. Ces diagnostics permettent de distinguer une compétence conservée et correctement guidée d'une compétence conservée par simple mémorisation du contexte. Il s'agit d'un travail académique en simulation : aucun chiffre de performance n'est donné dans le résumé, et la portée des conclusions reste à vérifier dans le détail des expériences, qui se concentrent sur une seule suite.

Ce travail s'inscrit dans le prolongement de LIBERO, benchmark de référence pour l'apprentissage tout au long de la vie en manipulation robotique, devenu terrain d'essai courant pour les politiques conditionnées par le langage. La question de l'ancrage rejoint des critiques déjà formulées sur les modèles VLA, soupçonnés d'ignorer partiellement le texte au profit de régularités visuelles. Aucun acteur industriel n'est directement concerné : il s'agit d'un outil d'évaluation, pas d'un produit. Sa valeur dépendra de son adoption par les équipes qui développent des politiques généralistes et des méthodes d'apprentissage continu. La suite logique serait son extension aux autres suites de LIBERO, puis à des politiques de grande taille et à des données réelles, seules capables de montrer si l'écart entre rétention et ancrage se retrouve hors simulation.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation
1arXiv cs.RO 

Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation

Une équipe de recherche a déposé sur arXiv, sous la référence 2609.08209 (version 2, remplaçant une publication antérieure), un article présentant RoboReel, un benchmark unifié destiné à évaluer les modèles qui apprennent des politiques de manipulation robotique par observation de vidéos humaines. Le jeu de données regroupe des vidéos de démonstrations humaines réelles, des trajectoires robotiques simulées et des environnements d'évaluation couvrant dix tâches de manipulation. Les auteurs ont conçu quatre suites de tests distinctes, mesurant notamment la robustesse des modèles face aux distracteurs visuels et leur capacité à mener à bien des tâches longues comportant plusieurs étapes. Le benchmark compare plus de sept algorithmes de l'état de l'art en apprentissage par observation (Learning from Observation, LfO), dont des variantes fondées sur des modèles vision-langage-action (VLA) développées par les auteurs eux-mêmes, ainsi que plusieurs choix de représentation des données d'entrée. Le code, les vidéos et la documentation du projet sont mis à disposition sur roboreel.github.io. Cette initiative répond à un problème concret pour le secteur robotique: l'apprentissage à partir de vidéos humaines est présenté depuis plusieurs années comme un moyen de contourner la pénurie de données d'entraînement, la collecte de démonstrations téléopérées restant lente et coûteuse à grande échelle. Or les auteurs constatent que les méthodes publiées jusqu'ici reposent sur des hypothèses, du matériel et des protocoles d'évaluation si divergents qu'il devient impossible de comparer réellement les progrès revendiqués d'un papier à l'autre, un problème classique de fragmentation méthodologique dans un champ en expansion rapide. Plus significatif pour les intégrateurs et décideurs du secteur, l'analyse comparative montre que les tâches à long horizon et celles exigeant une faible tolérance d'erreur restent difficiles pour l'ensemble des modèles testés, quelle que soit leur architecture. Ce constat tempère l'idée selon laquelle l'apprentissage par vidéo suffirait à produire des compétences de manipulation robustes à l'échelle industrielle, et invite à la prudence face aux démonstrations isolées mises en avant par certains laboratoires. RoboReel s'inscrit dans la continuité de travaux récents ayant montré des résultats prometteurs pour l'apprentissage de compétences de manipulation à partir de vidéos humaines, sans télé-opération ni collecte de données directement sur le robot cible, une piste explorée par de nombreux laboratoires académiques et industriels de la robotique manipulatrice. Faute de cadre d'évaluation commun, ces travaux restaient difficiles à situer les uns par rapport aux autres, chaque équipe validant ses résultats sur son propre environnement et son propre matériel. En proposant un socle partagé de dix tâches, de vidéos et de trajectoires simulées librement réutilisables, les auteurs visent à doter le champ du LfO d'un outil de comparaison équivalent à ceux qui existent déjà pour d'autres sous-domaines de l'apprentissage robotique. La publication met le code et les données à disposition de la communauté via la page du projet, sans annoncer à ce stade de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
Apprentissage par imitation ancré vision-langage et conscient du contexte pour le désassemblage robotique
2arXiv cs.RO 

Apprentissage par imitation ancré vision-langage et conscient du contexte pour le désassemblage robotique

Le 17 septembre 2026, une équipe de recherche a publié sur arXiv (référence 2609.17714) une nouvelle méthode d'apprentissage par imitation destinée au désassemblage robotique de pièces mécaniques et de connecteurs. Le problème visé est celui de l'exécution à long horizon : un bras robotique doit enchaîner plusieurs tâches de manipulation ordonnées sur une même scène contenant de multiples pièces, sans que les politiques d'imitation classiques parviennent à déduire, à partir des seules images brutes, quel geste effectuer quand plusieurs objectifs sont valides simultanément. La solution proposée combine une sélection hiérarchique des tâches avec un mécanisme dit "task-context-aware", qui ancre des instructions en langage naturel dans la représentation visuelle spatiale de la scène pour associer chaque consigne à sa cible de manipulation. Le système généralise à des géométries de connecteurs et des configurations d'assemblage variées sans nécessiter d'annotations explicites des objets. Les auteurs rapportent un gain de 35 points de pourcentage de taux de réussite de bout en bout par rapport à une politique de diffusion (diffusion policy) de référence, et de 75 points par rapport à la précédente méthode "task-context-aware" existante. Pour l'industrie du désassemblage, du recyclage et du reconditionnement (électronique, batteries, électroménager), ce travail s'attaque à un vrai verrou : la diversité combinatoire des configurations réelles rend impossible l'entraînement exhaustif d'un robot sur chaque variante de pièce. En s'appuyant sur le langage plutôt que sur des étiquettes d'objets prédéfinies, la méthode illustre une tendance plus large du secteur consistant à faire porter la généralisation par le contexte linguistique, une logique proche de celle des modèles vision-langage-action (VLA) déjà déployés par ailleurs. Un tel gain de robustesse, si confirmé hors laboratoire, intéresserait directement les intégrateurs qui cherchent à réduire le travail d'annotation et de reprogrammation entre lignes de désassemblage différentes. Ce travail s'inscrit dans la vague plus large des modèles vision-langage-action qui cherchent à dépasser les démonstrations à tâche unique, à l'image d'approches comme Pi-0, GR00T ou Helix dans le domaine plus large de la manipulation robotique généraliste. Il reste toutefois à ce stade une publication de recherche non validée par des pairs, sans partenaire industriel ni site de déploiement annoncé : la prochaine étape attendue serait une validation sur robot réel à plus grande échelle plutôt qu'en environnement contrôlé.

UEAucune entreprise ou institution européenne n'est impliquée, mais la méthode intéressé potentiellement les filières européennes de recyclage et reconditionnement (électronique, batteries) soumises a des exigences croissantes de désassemblage.

RecherchePaper
1 source
Cadre d'apprentissage par renforcement résiduel sensible à la stabilité pour la compensation des perturbations d'un bras robotique
3arXiv cs.RO 

Cadre d'apprentissage par renforcement résiduel sensible à la stabilité pour la compensation des perturbations d'un bras robotique

Un cadre de compensation des perturbations pour bras manipulateurs, publié le 21 septembre 2026 sur arXiv sous la référence 2609.21307, combine un observateur de perturbation (DOB) analytique classique avec une politique d'apprentissage par renforcement (RL) résiduelle: le contrôleur déterministe gère la zone où le modèle est fiable, tandis que la politique RL corrige spécifiquement les résidus non capturés, comme les frottements non linéaires ou les perturbations composées. Un réseau estimateur associe l'historique des observations à un contexte de perturbation privilégié, structurant l'espace latent par régime pour accélérer l'adaptation lors des transitions. Une borne d'action dépendante de l'état, dérivée d'une analyse de stabilité entrée-état (ISS), confine mathématiquement l'erreur de suivi dans une enveloppe certifiée quelle que soit la sortie du réseau. Sur un bras à 6 degrés de liberté (DOF), l'erreur de suivi chute de 27,8% sur matériel réel en transfert sim-to-real zero-shot, et de 38,0% sous une vibration de la base absente de l'entraînement. Pour la robotique industrielle de précision, l'apport dépasse la performance brute: le principal frein à l'adoption du RL dans des boucles de commande certifiées est l'absence de garanties de stabilité, un réseau pouvant produire des actions imprévisibles hors distribution. En dérivant une borne prouvable plutôt qu'en s'appuyant sur l'apprentissage pur, les auteurs répondent directement à cette objection, ce qui pourrait faciliter l'intégration de correcteurs appris dans des applications d'assemblage ou d'usinage où la sécurité doit être certifiée. Le transfert sim-to-real zero-shot, sans calibration fine sur le robot réel, va aussi à l'encontre de l'hypothèse répandue selon laquelle les politiques RL exigent un réglage matériel extensif pour être exploitables, un frein classique à la commercialisation de la robotique apprise. Les observateurs de perturbation analytiques équipent les manipulateurs industriels depuis des décennies mais peinent face aux frottements non linéaires et aux incertitudes de paramètres, ce qui a nourri une vague de recherche en RL résiduel, apprenant une correction par-dessus un contrôleur classique plutôt qu'une politique de bout en bout, à l'image de travaux comparables en locomotion et en préhension robotique. Il s'agit toutefois d'un article de recherche déposé sur arXiv, non encore validé par relecture par les pairs et testé sur un seul bras à 6 DOF en laboratoire: aucun partenariat industriel, pilote ou calendrier de déploiement n'est mentionné, et la généralisation à d'autres manipulateurs ou perturbations reste à démontrer.

RecherchePaper
1 source
Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique
4arXiv cs.RO 

Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique

Des chercheurs ont publié sur arXiv (référence 2604.15215v2) un travail portant sur HiST-AT, un tokeniseur d'actions hiérarchique et spatiotemporel conçu pour l'apprentissage par imitation en contexte. Le principe central repose sur deux niveaux successifs de quantification vectorielle : le premier niveau affecte chaque action à des sous-clusters fins, tandis que le second regroupe ces sous-clusters en clusters plus larges. L'extension spatiotemporelle va plus loin en récupérant simultanément les actions et leurs horodatages associés, permettant au modèle d'exploiter à la fois la géométrie des mouvements et leur séquençage temporel. Les évaluations ont été conduites sur plusieurs benchmarks de manipulation robotique en simulation et en conditions réelles, et les auteurs revendiquent un nouveau niveau de performance de référence sur les tâches d'apprentissage par imitation en contexte. Ce résultat intéresse directement les équipes qui travaillent sur le déploiement rapide de robots dans de nouvelles tâches industrielles sans collecter des milliers de démonstrations. L'apprentissage par imitation en contexte, calqué sur le few-shot prompting des grands modèles de langage, vise à permettre à un robot d'exécuter une nouvelle tâche à partir de quelques exemples fournis dynamiquement, sans réentraînement. La qualité du tokeniseur d'actions est ici le maillon critique : une discrétisation trop grossière des trajectoires efface l'information fine de manipulation ; trop granulaire, elle rend l'espace de tokens ingérable. Le fait que l'approche hiérarchique améliore les résultats par rapport à une quantification à un seul niveau, et que l'ajout de l'information temporelle amplifie encore ce gain, suggère que la structure latente des tâches de manipulation est intrinsèquement multiscale. L'apprentissage par imitation en contexte pour la robotique s'est fortement développé depuis 2023, porté par des modèles comme ACT, Diffusion Policy, et plus récemment les architectures de type VLA (Vision-Language-Action) telles que OpenVLA, pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA. La tokenisation des actions est un point de friction commun à toutes ces approches : comment convertir des trajectoires continues en séquences discrètes manipulables par un transformer. HiST-AT apporte une réponse structurée à ce problème, mais il s'agit à ce stade d'un résultat de recherche publié en preprint, sans validation industrielle ni déploiement annoncé. Les prochaines étapes naturelles seront d'évaluer la robustesse en dehors des benchmarks académiques, notamment sur des tâches de manipulation à haute fréquence ou en environnement non contrôlé.

RechercheOpinion
1 source