DROM : un cadre de diffusion guidé par le langage pour la manipulation robotique multi-compétences
DROM, un cadre génératif décrit dans un préprint arXiv (v1), vise un problème classique de la manipulation robotique : apprendre à partir de peu de démonstrations des politiques robustes, capables d'enchaîner plusieurs compétences sur des tâches longues. Les auteurs utilisent des Dynamic Movement Primitives (DMP) pour multiplier un petit nombre de démonstrations expertes en jeux de données multi-compétences. Ils affirment que cela réduit la collecte de données et étend la généralisation spatiale au-delà de la zone démontrée. Le modèle prolonge Motion Planning Diffusion (MPD) avec une attention croisée conditionnée par le langage. Un seul réseau génère alors des trajectoires cohérentes pour plusieurs primitives, y compris des comportements sensibles à l'orientation, difficiles à programmer avec un planificateur classique ou un contrôleur codé en dur. Pour les tâches longues, un grand modèle de langage (LLM) découpe la demande d'un opérateur en séquence de compétences exécutables. La validation a eu lieu sur un Franka Emika Panda, un FANUC CRX25ia et en simulation MuJoCo. Selon les auteurs, DROM dépasse les références MPD et Behavior Cloning. Le résumé ne donne aucun chiffre : ni taux de réussite, ni nombre de démonstrations, ni nombre de compétences, ni temps de cycle. Les jeux de données, les environnements de simulation et le code sont publiés sur GitHub.
L'intérêt tient d'abord à la combinaison de trois briques déjà connues, DMP, diffusion et LLM, dans une architecture unique et exploitable en atelier. Pour un intégrateur, la promesse est de réduire le coût de programmation et de téléopération à chaque nouvelle variante de tâche. Un opérateur pourrait piloter une cellule en langage naturel, sans écrire de trajectoires. La présence d'un FANUC CRX25ia, cobot industriel de 25 kg de charge, est un signal plus pertinent que le seul Panda, plateforme de laboratoire. Elle indique une volonté de transfert vers du matériel de production. Il faut toutefois rester prudent. Sans métriques publiées, sans précision sur le sim-to-real, sur la robustesse face aux perturbations ni sur la latence d'inférence de la diffusion, le gain sur les références reste invérifiable à ce stade. L'écart entre une démonstration de laboratoire et une cadence industrielle n'est pas comblé.
Ce travail s'inscrit dans une course où dominent les modèles vision-langage-action (VLA) entraînés sur de grands volumes de données, comme Pi-0, GR00T ou Helix. DROM prend le parti inverse : un pipeline modulaire et frugal en données, où le LLM planifie et la diffusion exécute, avec des trajectoires plus interprétables. Ce compromis intéressera les cellules à faible volume et à forte variété. La suite dépendra de la reproduction par des tiers, grâce au dépôt ouvert, et d'essais sur des tâches réelles plus contraintes que celles d'un banc de test académique. Aucun pilote industriel ni calendrier n'est annoncé.




