MimicAgent : compétences quadrupèdes via génération de trajectoire à partir d'instructions
MimicAgent est un framework présenté dans un article de recherche publié sur arXiv (2609.24145v1) qui automatise l'apprentissage de compétences dynamiques chez les robots quadrupèdes. Plutôt que de régler manuellement les fonctions de récompense du reinforcement learning, un exercice fastidieux que les auteurs surnomment "graduate student descent", le système s'appuie sur un agent logiciel qui génère, à partir d'un simple prompt textuel, des trajectoires de référence codées. Ces trajectoires, bien que grossières, servent ensuite à entraîner des politiques de RL guidées par l'exemple, validées en simulation et sur robot réel. En utilisant Claude Fable 5.1 comme moteur de leur système agentique, les chercheurs rapportent que 87% des prompts testés génèrent des trajectoires sémantiquement alignées avec la compétence demandée.
Le problème ciblé est structurel : contrairement aux humanoïdes, qui exploitent de vastes bases de capture de mouvement humain pour l'apprentissage guidé par l'exemple, les quadrupèdes ne disposent d'aucune référence équivalente et imposent en général une ingénierie de récompense spécifique à chaque compétence. Si la méthode se confirme au-delà des cas démontrés dans l'article, elle promettrait de réduire le temps d'ingénierie nécessaire pour doter un robot quadrupède de nouvelles compétences dynamiques, un enjeu concret pour les intégrateurs cherchant à accélérer leurs cycles de développement. Elle illustre aussi un glissement d'usage des LLM en robotique : générer des données de démonstration plutôt qu'écrire directement des fonctions de récompense.
MimicAgent se positionne comme une réponse aux limites d'Eureka, le système antérieur qui tentait d'automatiser le reward shaping via des LLM mais peinait, selon les auteurs, à généraliser à des compétences et morphologies variées. L'approche s'inspire des succès obtenus par le RL guidé par l'exemple chez les humanoïdes, appuyés sur des jeux de données de motion capture à grande échelle. Publié comme simple article arXiv, sans affiliation industrielle mise en avant ni partenariat commercial annoncé, il s'agit à ce stade d'une contribution académique, dont les suites attendues porteraient sur l'extension à davantage de compétences et à des morphologies de robots plus diverses.
Dans nos dossiers




