Aller au contenu principal
RecherchearXiv cs.RO 

DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

DROM, un cadre génératif décrit dans un préprint arXiv (v1), vise un problème classique de la manipulation robotique : apprendre à partir de peu de démonstrations des politiques robustes, capables d'enchaîner plusieurs compétences sur des tâches longues. Les auteurs utilisent des Dynamic Movement Primitives (DMP) pour multiplier un petit nombre de démonstrations expertes en jeux de données multi-compétences. Ils affirment que cela réduit la collecte de données et étend la généralisation spatiale au-delà de la zone démontrée. Le modèle prolonge Motion Planning Diffusion (MPD) avec une attention croisée conditionnée par le langage. Un seul réseau génère alors des trajectoires cohérentes pour plusieurs primitives, y compris des comportements sensibles à l'orientation, difficiles à programmer avec un planificateur classique ou un contrôleur codé en dur. Pour les tâches longues, un grand modèle de langage (LLM) découpe la demande d'un opérateur en séquence de compétences exécutables. La validation a eu lieu sur un Franka Emika Panda, un FANUC CRX25ia et en simulation MuJoCo. Selon les auteurs, DROM dépasse les références MPD et Behavior Cloning. Le résumé ne donne aucun chiffre : ni taux de réussite, ni nombre de démonstrations, ni nombre de compétences, ni temps de cycle. Les jeux de données, les environnements de simulation et le code sont publiés sur GitHub.

L'intérêt tient d'abord à la combinaison de trois briques déjà connues, DMP, diffusion et LLM, dans une architecture unique et exploitable en atelier. Pour un intégrateur, la promesse est de réduire le coût de programmation et de téléopération à chaque nouvelle variante de tâche. Un opérateur pourrait piloter une cellule en langage naturel, sans écrire de trajectoires. La présence d'un FANUC CRX25ia, cobot industriel de 25 kg de charge, est un signal plus pertinent que le seul Panda, plateforme de laboratoire. Elle indique une volonté de transfert vers du matériel de production. Il faut toutefois rester prudent. Sans métriques publiées, sans précision sur le sim-to-real, sur la robustesse face aux perturbations ni sur la latence d'inférence de la diffusion, le gain sur les références reste invérifiable à ce stade. L'écart entre une démonstration de laboratoire et une cadence industrielle n'est pas comblé.

Ce travail s'inscrit dans une course où dominent les modèles vision-langage-action (VLA) entraînés sur de grands volumes de données, comme Pi-0, GR00T ou Helix. DROM prend le parti inverse : un pipeline modulaire et frugal en données, où le LLM planifie et la diffusion exécute, avec des trajectoires plus interprétables. Ce compromis intéressera les cellules à faible volume et à forte variété. La suite dépendra de la reproduction par des tiers, grâce au dépôt ouvert, et d'essais sur des tâches réelles plus contraintes que celles d'un banc de test académique. Aucun pilote industriel ni calendrier n'est annoncé.

À lire aussi

SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle
1arXiv cs.RO 

SkillMemo : un cadre de mémoire de compétences guidé par des experts pour la manipulation robotique compositionnelle

Un article déposé sur arXiv début août 2026 présente SkillMemo, un framework de mémoire de compétences pour la manipulation robotique compositionnelle. Il vise une limite connue des politiques de diffusion (Diffusion Policy) et des modèles vision-langage-action (VLA): leur difficulté à généraliser hors distribution faute de jeux de données de trajectoires suffisamment vastes. Un module de segmentation guidé par experts, bâti sur une architecture Mixture-of-Experts, découpe les démonstrations longues en compétences atomiques via des coefficients de gating appris, puis les stocke dans une mémoire épisodique sous forme de paires clé-valeur compactes. À l'inférence, le modèle récupère les compétences pertinentes et les fusionne avec sa distribution de gating courante pour affiner ses prédictions d'action. Sur des benchmarks de simulation et des tâches réelles de manipulation, SkillMemo améliore les backbones DP et VLA et dépasse le modèle de référence π0.5. La rareté des trajectoires embarquées à grande échelle limite structurellement la capacité des VLA et des DP à recombiner des compétences apprises séparément pour des tâches nouvelles, un écart souvent pointé entre démonstrations de laboratoire et robustesse réelle. En misant sur une mémoire de compétences réutilisables plutôt que sur un réentraînement systématique, SkillMemo réduit cette dépendance aux données sans changer d'architecture de base, un enjeu direct pour les intégrateurs qui ont besoin de politiques capables de composer des compétences déjà apprises face à des tâches variables. Battre π0.5, référence largement citée dans la littérature récente, renforce la crédibilité de l'approche mémoire pour la généralisation compositionnelle, un problème que le simple passage à l'échelle des modèles n'a pas suffi à résoudre. SkillMemo s'inscrit dans la lignée des travaux récents sur les politiques de diffusion et les modèles VLA, devenus les deux paradigmes dominants pour piloter bras et robots humanoïdes à partir de démonstrations, et répond à un constat partagé: ces modèles peinent à sortir du cadre de leurs données d'entraînement dès qu'une tâche combine des sous-compétences dans un ordre inédit. À ce stade, SkillMemo reste un travail de recherche en preprint, validé sur des benchmarks de simulation et des tâches réelles en laboratoire, sans indication de code public, de partenariat industriel ni de calendrier de déploiement. Son positionnement face à π0.5 en fait néanmoins une référence probable pour les prochains travaux sur la mémoire de compétences en robotique.

RecherchePaper
1 source
Acquisition autonome de compétences de manipulation robotique par diversité-qualité guidée par le langage
2arXiv cs.RO 

Acquisition autonome de compétences de manipulation robotique par diversité-qualité guidée par le langage

Des chercheurs publient le 30 aout 2026 sur arXiv (2608.30983) une méthode d'apprentissage de manipulation robotique combinant algorithmes de quality-diversity (QD) et grands modèles de langage, a partir d'une simple description de la tache en langage naturel. Le système n'exige plus qu'un expert écrive a la main les fonctions de fitness et de diversité : un LLM explore un espace réduit de fonctionnels pour générer lui-même ces métriques, sans prompt spécifique ni fine-tuning. Les chercheurs adaptent pour cela une variante multi-descripteurs de l'algorithme MAP-Elites, nommée MES. Teste dans le simulateur Genesis sur quatre taches de manipulation, le système produit des archives de primitives de mouvement plus diversifiées que les méthodes QD classiques a paramétrage manuel ou infère. Pour les intégrateurs et les laboratoires de robotique, l'enjeu est le goulot d'étranglement des bibliothèques de primitives de mouvement, dont la construction exige aujourd'hui qu'un ingénieur code a la main un critère de succès différent pour chaque nouvelle tache. Contrairement aux techniques de reward-shaping par LLM, qui n'apprennent qu'une seule politique performante, cette méthode produit un répertoire entier de comportements varies, ce qui permettrait a un robot de s'adapter zero-shot a des contraintes rencontrées au déploiement, comme un obstacle ou une contrainte d'espace inédite, sans reentrainement. C'est un argument de plus en faveur de l'usage des LLM pour automatiser l'ingénierie de récompense en robotique par apprentissage, au-delà de la simple génération d'une politique rigide et unique. Les algorithmes de quality-diversity, popularises par MAP-Elites, sont utilises depuis plusieurs années en robotique pour construire des répertoires de comportements plutôt qu'une seule solution optimale, notamment pour la marche adaptative ou la manipulation robuste aux pannes. Leur limite restait la dépendance a des métriques de fitness et de diversité écrites par des experts, un frein a l'autonomie complète du robot, que les approches de reward-shaping par LLM contournaient au prix d'une sortie unique et peu adaptable. Le travail, publie en preprint sur arXiv le 30 aout 2026, n'a été valide qu'en simulation, sur quatre taches de manipulation dans Genesis, sans transfert démontre sur robot physique ni calendrier de déploiement industriel annonce.

RecherchePaper
1 source
LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique
3arXiv cs.RO 

LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique

Des chercheurs présentent LaGEA (Language Guided Embodied Agents), une architecture combinant un modèle vision-langage (VLM) et l'apprentissage par renforcement (RL) pour la manipulation robotique, décrite dans une version mise a jour (v3) d'un article arXiv (2509.23155). Apres chaque tentative, le système résume l'épisode en langage naturel, localise les instants décisifs de la trajectoire, aligne ce retour avec l'état visuel dans une représentation partagée, puis transforme la progression vers l'objectif en récompenses bornées appliquées pas a pas. Un coefficient adaptatif, sensible aux échecs, rend ce signal dense en début d'exploration puis l'atténué avec la montée en compétence de l'agent. Sur les bancs d'essai simules Meta-World MT10 (dix taches de manipulation) et Robotic Fetch, LaGEA améliore le taux de réussite moyen de 9,0% sur des objectifs aléatoires, 5,3% sur des objectifs fixes et 17% sur les taches Fetch par rapport aux méthodes de référence, avec une convergence plus rapide. Le travail s'attaque a un problème classique du RL, la conception manuelle des fonctions de récompense, souvent couteuse et peu généralisable a de nouvelles taches. En montrant qu'un retour en langage naturel, structure et ancre temporellement, peut remplacer une partie de cette ingénierie, LaGEA nuance le narratif dominant autour des modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix, conçus pour piloter directement une politique de bout en bout : ici, le langage sert de superviseur d'apprentissage plutôt que de commande directe. Les gains rapportes restent obtenus en simulation, non sur du matériel réel, et demandent une confirmation sur des taches de manipulation physique. LaGEA prolonge les travaux exploitant les grands modèles vision-langage comme source de récompense ou de critique pour le RL, un axe de recherche actif depuis l'essor des modèles de fondation capables de décrire des objectifs et d'évaluer des trajectoires. Meta-World MT10 et Robotic Fetch sont des bancs d'essai standards de la communauté robotique, ce qui permet une comparaison directe avec l'état de l'art. S'agissant d'une version corrigée d'un article déjà publie, la contribution reste académique : aucun partenaire industriel, date de déploiement ou intégration produit n'est annonce a ce stade, la prochaine étape logique étant une validation sim-to-real sur robot physique.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
4arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source