Aller au contenu principal
RecherchearXiv cs.RO 

Imitation générative antagoniste à partir d'observations, fondée sur l'expérience et la faisabilité, malgré des morphologies différentes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent EF-GAIfO (Experience-Based Feasibility-Aware Generative Adversarial Imitation from Observation), une méthode d'apprentissage par imitation à partir d'observations, publiée sur arXiv sous la référence 2610.01171. Elle apprend à un robot à partir de trajectoires d'états sans étiquettes d'actions, comme celles que fournissent les interfaces de démonstration sans robot. Son principe est d'estimer la faisabilité de chaque démonstration humaine à partir de l'expérience propre du robot. Elle ne s'appuie ni sur un modèle dynamique explicite, ni sur un grand jeu de données d'exploration préalable. La zone jugée faisable n'est pas figée: elle s'élargit à mesure que la politique progresse et que le robot rencontre des transitions d'état plus variées, ce qui permet d'intégrer peu à peu des démonstrations d'abord écartées. La validation porte sur une tâche de locomotion en simulation et sur un robot quadrupède réel, qui doit atteindre et saisir un objet. Le résumé ne donne ni taux de réussite, ni nombre d'essais, ni modèle de robot, ni comparaison chiffrée avec d'autres méthodes.

L'enjeu est un problème que connaissent bien les équipes qui collectent des démonstrations humaines pour entraîner des robots: l'écart d'incarnation. Un humain et un robot n'ont ni la même morphologie ni la même dynamique. Une partie des mouvements démontrés est donc physiquement irréalisable pour la machine, et les imiter à l'aveugle peut dégrader la politique apprise. Les critères de faisabilité employés jusqu'ici sont souvent conçus à la main, ou exigent un modèle de dynamique ou de vastes données d'exploration, ce qui pèse sur le coût de déploiement. Un critère qui évolue avec l'apprentissage pourrait réduire cette ingénierie. Il serait aussi utile pour les approches qui exploitent des vidéos ou des gants de capture, où les actions ne sont pas annotées. Il faut toutefois rester prudent: il s'agit d'un préprint à la première version, non évalué par des pairs. La preuve sur matériel se limite apparemment à une seule tâche sur un quadrupède, loin de la manipulation dextre d'un humanoïde. Rien n'indique que la méthode passe à l'échelle de tâches longues ou de plateformes à nombreux degrés de liberté.

Le travail s'inscrit dans la lignée de l'apprentissage antagoniste génératif par imitation (GAIL), décliné en version sans actions (GAIfO), qui entraîne un discriminateur à distinguer les transitions d'états de l'expert de celles de la politique. Sa limite connue est de supposer que toutes les démonstrations sont atteignables. La tendance actuelle, portée par les modèles vision-langage-action (VLA) et par les données de téléopération, laisse ouverte la question de l'exploitation de vidéos humaines pour des robots d'autre forme. Les suites naturelles sont des tests sur davantage de tâches, sur des humanoïdes et face à des méthodes de référence, avec des chiffres publiés. Aucun pilote industriel ni calendrier n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

1arXiv cs.RO 

Apprentissage continu pour la synthèse de saisies à 6 DOF à partir de l'expérience et de démonstrations

Des chercheurs publient sur arXiv (identifiant 2610.01301) un cadre d'apprentissage continu pour la synthèse de prises 6-DoF avec une pince parallèle, à partir d'une seule vue, dans des scènes encombrées. Leur méthode n'ajuste pas un grand modèle paramétrique. Elle adapte le système par une mémoire située dans un espace d'embedding appris. Les résultats de chaque tentative de saisie modifient les scores des prises futures. Des démonstrations fournies par l'utilisateur, facultatives, sont rappelées puis transférées vers de nouvelles scènes, où elles deviennent des prises candidates supplémentaires. L'évaluation combine simulation et expériences réelles, avec plus de 1500 essais de saisie. Selon les auteurs, le système égale les références 6-DoF existantes avant toute adaptation. Il progresse en ligne sur des objets inconnus, issus de catégories absentes ou sous-représentées à l'entraînement. Il tient un apprentissage continu sur le long terme avec peu d'oubli. Sur plusieurs catégories d'objets difficiles, il dépasse 90 % de réussite après seulement 50 tentatives en ligne. La vidéo et le code sont publiés sur la page du projet. Ce résultat s'attaque à un point faible de la manutention robotisée. La plupart des systèmes de saisie sont entraînés hors ligne puis figés au déploiement. Leurs performances baissent dès que les conditions s'écartent des données d'entraînement, par exemple avec une référence jamais vue dans un bac de e-commerce ou de logistique. Passer par une mémoire plutôt que par un réglage fin évite de réentraîner un gros modèle sur site. Cela limite le coût de calcul, le risque de régression et l'oubli catastrophique. Pour un intégrateur, 50 essais représentent quelques heures de fonctionnement. Un robot pourrait donc s'améliorer seul sur son assortiment réel, sans cycle de collecte et de réentraînement. Le canal de démonstrations donne aussi à un opérateur non spécialiste un moyen simple de corriger un échec. Il faut toutefois rester prudent. Il s'agit d'un preprint, pas encore évalué par les pairs. Les chiffres ne couvrent que quelques catégories choisies, sans information dans le résumé sur la diversité des objets, les temps de cycle ou le matériel. Le travail concerne uniquement la saisie par pince parallèle, pas la manipulation dextre ni les humanoïdes. Il s'inscrit dans la lignée des méthodes de saisie 6-DoF apprises, comme Contact-GraspNet et ses successeurs, et des modèles vision-langage-action généralistes. Ceux-ci restent en grande partie figés après l'entraînement. Cette approche à mémoire y ajoute une voie d'adaptation légère. La suite logique serait des essais en conditions industrielles, avec des cadences réelles et des assortiments variés.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Optimisation directe du modèle du monde par l'expérience : apprendre le monde au-delà de l'imitation des actions
2arXiv cs.RO 

Optimisation directe du modèle du monde par l'expérience : apprendre le monde au-delà de l'imitation des actions

Des chercheurs proposent DEWO (Direct Experience World-Model Optimization), une méthode d'apprentissage post-déploiement pour les World-Action Models (WAM), ces politiques robotiques qui génèrent des actions tout en prédisant l'évolution visuelle des interactions physiques. Le principe consiste à ne plus seulement imiter les actions, mais à raffiner aussi les représentations du monde à partir de l'expérience visuelle du robot. DEWO repère les points de bascule d'une interaction, apprend des futurs réussis comme des futurs échoués pour alimenter un guidage sans classifieur (classifier-free guidance), et ajoute une tête de valeur qui estime l'avancement de la tâche à partir des représentations vidéo. Ce guidage ne s'active en inférence que lorsque la progression stagne. Sur cinq tâches du benchmark DexJoCo, la méthode améliore le taux de succès moyen pour les trois formulations de WAM testées. Sur quatre tâches réelles avec les mains Wuji et Sharpa, une évaluation en grille 3 x 3 montre que deux cycles d'apprentissage en déploiement font passer le succès de 51,0 % à 71,7 % dans les cellules comptant au moins un succès initial, soit un gain de 20,7 points. L'intérêt tient au diagnostic. Les boucles d'amélioration actuelles, souvent fondées sur l'imitation de démonstrations ou de trajectoires réussies, corrigent le comportement sans rendre les prédictions du modèle plus justes. Or en manipulation dextre, de petites erreurs d'exécution s'accumulent dans un espace d'actions de grande dimension et écartent le robot de la distribution d'entraînement du modèle, ce qui dégrade aussi ses prédictions. Les ablations indiquent que la supervision visuelle des suites réussies et échouées améliore à la fois la prédiction et le contrôle, au-delà de la seule supervision par les actions. Pour les intégrateurs, le message est que les données d'échec, généralement jetées, deviennent utiles. Il faut toutefois nuancer : le gain réel de 20,7 points est mesuré uniquement dans les cellules avec au moins un succès initial, donc sur un sous-ensemble favorable, et les résultats viennent d'un preprint sans validation par les pairs ni détail sur les volumes de données ou le temps de cycle. Ce travail s'inscrit dans la montée des modèles du monde appliqués à la robotique, où la prédiction vidéo est couplée à la politique d'action, en complément des VLA (vision-langage-action) classiques. Le déploiement continu reste l'un des verrous du secteur : les politiques progressent surtout par rejeu de démonstrations ou par apprentissage par renforcement, coûteux sur du matériel réel. Le choix des mains Wuji et Sharpa, deux plateformes dextres à nombreux degrés de liberté, cible précisément le segment où les écarts entre démonstration et réalité sont les plus marqués. L'article ne cite ni pilote industriel ni calendrier de commercialisation, et il s'agit d'une preuve de concept de recherche. La suite logique serait de tester la méthode sur davantage de tâches et de plateformes, avec des cycles de déploiement plus nombreux et des mesures de robustesse à plus long terme.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
La fonction avant la forme : correspondance fonctionnelle pour la génération de prises dextériques inter-morphologies
3arXiv cs.RO 

La fonction avant la forme : correspondance fonctionnelle pour la génération de prises dextériques inter-morphologies

Des chercheurs proposent FunCo-Grasp, un cadre de génération de préhensions dextres « cross-embodiment », c'est-à-dire transférable d'une main robotique à l'autre. Il est décrit dans un préprint arXiv (v1, non évalué par les pairs). Le principe est d'établir des « correspondances fonctionnelles » entre des mains aux géométries, topologies et cinématiques très différentes. Deux alignements y contribuent. Le Functional Part Alignment associe chaque lien physique de la main à une partie fonctionnelle commune, selon son rôle dans la saisie. Le Canonical Frame Alignment exprime ensuite ces parties dans des repères locaux canoniques. Un modèle de diffusion, conditionné par cette représentation et par la géométrie de l'objet, génère l'agencement spatial cible des parties fonctionnelles. Cet agencement est ensuite converti en configuration articulaire exécutable. Pour une main inédite, il suffit de fournir ses modèles géométrique et cinématique, plus une annotation fonctionnelle légère faite une seule fois. Aucune donnée de préhension sur la main cible, aucun fine-tuning et aucun retargeting appris ne sont nécessaires. En simulation, sur des objets exclus de l'entraînement dans le CMapDataset filtré, le taux de succès moyen atteint 92,40 % sur trois mains vues à l'entraînement et 74,02 % sur quatre mains inédites. En conditions réelles, le même modèle réussit 76,00 % des essais sur deux mains inédites, sans entraînement supplémentaire. L'intérêt tient à l'obstacle que ces travaux visent. Aujourd'hui, chaque nouvelle main dextre oblige souvent à recollecter des données ou à réentraîner, ce qui freine les intégrateurs qui comparent ou changent d'effecteur. Ici, le coût d'adaptation se réduit à une annotation unique. Cela rend plausible un modèle de préhension réutilisable d'une main à l'autre. L'écart de 18 points entre mains vues et inédites en simulation montre cependant que le transfert est loin d'être résolu. Le chiffre réel de 76 % repose sur seulement deux mains, et l'article ne donne ici ni le nombre d'objets, ni le nombre d'essais, ni les conditions de test. Il décrit de plus des préhensions statiques, pas de la manipulation en main, ce qui reste loin des exigences d'une ligne de production. Le résultat va néanmoins dans le sens d'une hypothèse du secteur : une représentation structurée par la fonction généralise mieux que l'apprentissage de motifs propres à chaque main. Le travail s'inscrit dans une série de méthodes cross-embodiment pour la dextérité. Les approches précédentes s'appuient souvent sur des représentations spécifiques à chaque main ou sur du retargeting appris, ce qui limite la généralisation. Les mains multi-doigts se multiplient pourtant, des modèles à quatre doigts jusqu'aux mains humanoïdes à plus de vingt degrés de liberté. Le préprint n'annonce ni code, ni pilote industriel, ni calendrier. Les prochaines étapes logiques seraient un test sur un éventail plus large de mains, la prise en compte de la manipulation dynamique et une évaluation sur des objets non rigides ou en environnement encombré.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SynIL : exploiter la synergie pour l'apprentissage par imitation hors ligne à partir de jeux de démonstrations imparfaites
4arXiv cs.RO 

SynIL : exploiter la synergie pour l'apprentissage par imitation hors ligne à partir de jeux de démonstrations imparfaites

Des chercheurs proposent SynIL (Synergy-based Imitation Learning), un cadre d'apprentissage par imitation hors ligne conçu pour exploiter des jeux de démonstrations imparfaits sans intervention humaine. Le problème visé est connu : les performances de l'imitation se dégradent fortement quand les données contiennent des démonstrations sous-optimales ou bruitées. Les méthodes existantes filtrent ou repondèrent les données, mais elles exigent en général une présélection manuelle de démonstrations expertes de référence, ou des heuristiques propres à chaque tâche. SynIL s'en passe : il évalue automatiquement la qualité de chaque transition, sans étiquette. Il quantifie la « synergie motrice », c'est-à-dire la structure coordonnée et de faible dimension du mouvement, que les neurosciences associent au niveau de maîtrise motrice. À partir de cette mesure, il produit des signaux de récompense denses, au niveau de chaque transition, par régression auto-supervisée. Les tests portent sur les benchmarks de locomotion D4RL et sur des jeux Robomimic de manipulation issus de plusieurs opérateurs humains. Les auteurs rapportent que ces récompenses corrèlent fortement avec les récompenses réelles de l'environnement. SynIL dépasse nettement le clonage comportemental (BC). Il atteint des résultats comparables à ceux de l'apprentissage par renforcement hors ligne entraîné sur les vraies récompenses, et meilleurs en téléopération humaine à récompense éparse. L'enjeu est pratique pour quiconque collecte des données de téléopération à grande échelle. Les jeux de démonstrations réels mélangent opérateurs aguerris et novices, essais hésitants et gestes parasites. Le tri manuel ne passe pas à l'échelle, alors que les politiques généralistes de type VLA dépendent de volumes toujours plus grands. Un score de qualité calculé sans référence experte pourrait réduire le coût de curation et rendre exploitables des données jusque-là écartées. Le résultat sur récompenses éparses est le plus intéressant, puisque c'est le cas habituel de la manipulation réelle, où la récompense se limite souvent à un succès ou un échec en fin d'épisode. Des réserves s'imposent : il s'agit d'un préprint (arXiv, v1) non évalué par des pairs. Les validations se limitent à des benchmarks simulés ou à des jeux de données standard, sans robot physique ni humanoïde. L'hypothèse selon laquelle la synergie reflète la compétence reste à vérifier sur des morphologies et des tâches plus variées. Ces travaux s'inscrivent dans un courant plus large de pondération et de filtrage des données pour l'apprentissage hors ligne, face à la montée des corpus de téléopération agrégés par les laboratoires et les fabricants d'humanoïdes. Le lien avec la biomécanique et les neurosciences motrices est relativement peu exploité dans ce champ. L'article ne mentionne ni code publié, ni calendrier de déploiement, ni partenaire industriel. L'étape suivante logique serait une validation sur robots réels et sur des modèles fondation de grande taille.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source