Aller au contenu principal
RecherchearXiv cs.RO 

MimicAgent : compétences quadrupèdes via génération de trajectoire à partir d'instructions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

MimicAgent est un framework présenté dans un article de recherche publié sur arXiv (2609.24145v1) qui automatise l'apprentissage de compétences dynamiques chez les robots quadrupèdes. Plutôt que de régler manuellement les fonctions de récompense du reinforcement learning, un exercice fastidieux que les auteurs surnomment "graduate student descent", le système s'appuie sur un agent logiciel qui génère, à partir d'un simple prompt textuel, des trajectoires de référence codées. Ces trajectoires, bien que grossières, servent ensuite à entraîner des politiques de RL guidées par l'exemple, validées en simulation et sur robot réel. En utilisant Claude Fable 5.1 comme moteur de leur système agentique, les chercheurs rapportent que 87% des prompts testés génèrent des trajectoires sémantiquement alignées avec la compétence demandée.

Le problème ciblé est structurel : contrairement aux humanoïdes, qui exploitent de vastes bases de capture de mouvement humain pour l'apprentissage guidé par l'exemple, les quadrupèdes ne disposent d'aucune référence équivalente et imposent en général une ingénierie de récompense spécifique à chaque compétence. Si la méthode se confirme au-delà des cas démontrés dans l'article, elle promettrait de réduire le temps d'ingénierie nécessaire pour doter un robot quadrupède de nouvelles compétences dynamiques, un enjeu concret pour les intégrateurs cherchant à accélérer leurs cycles de développement. Elle illustre aussi un glissement d'usage des LLM en robotique : générer des données de démonstration plutôt qu'écrire directement des fonctions de récompense.

MimicAgent se positionne comme une réponse aux limites d'Eureka, le système antérieur qui tentait d'automatiser le reward shaping via des LLM mais peinait, selon les auteurs, à généraliser à des compétences et morphologies variées. L'approche s'inspire des succès obtenus par le RL guidé par l'exemple chez les humanoïdes, appuyés sur des jeux de données de motion capture à grande échelle. Publié comme simple article arXiv, sans affiliation industrielle mise en avant ni partenariat commercial annoncé, il s'agit à ce stade d'une contribution académique, dont les suites attendues porteraient sur l'extension à davantage de compétences et à des morphologies de robots plus diverses.

Dans nos dossiers

À lire aussi

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents
1arXiv cs.RO 

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents

Une équipe de chercheurs a présenté AGILE (arXiv:2602.04672v3), un framework de reconstruction d'interactions dynamiques main-objet à partir de vidéos monoculaires, ciblant deux applications majeures : la collecte de données pour la manipulation dextère en robotique et la création de jumeaux numériques pour la simulation et la réalité virtuelle. La méthode s'attaque à deux verrous techniques qui paralysent les approches existantes : d'une part, le rendu neuronal classique produit sous forte occultation des géométries fragmentées, inutilisables directement en simulation physique ; d'autre part, l'initialisation par Structure-from-Motion (SfM) est notoriellement fragile sur des vidéos captées en conditions réelles. AGILE bascule du paradigme de reconstruction vers ce que les auteurs appellent une "génération agentique" : un Vision-Language Model (VLM) pilote un modèle génératif pour synthétiser un mesh objet complet, fermé (watertight) et texturé haute fidélité, sans dépendre du contenu vidéo occulté. Une stratégie dite "anchor-and-track" initialise la pose de l'objet sur une unique frame d'interaction via un modèle fondation, puis propage cette pose temporellement en exploitant la similarité visuelle entre l'asset généré et les frames vidéo. Une optimisation finale dite contact-aware intègre des contraintes sémantiques, géométriques et de stabilité d'interaction pour garantir la plausibilité physique. Sur les benchmarks HO3D, DexYCB et ARCTIC, AGILE surpasse les baselines en précision géométrique globale. L'intérêt industriel de cette approche réside dans la production d'assets directement exploitables en simulation, une propriété validée par les auteurs via du retargeting real-to-sim pour des applications robotiques. C'est précisément le point de friction qui freinait l'adoption des pipelines de reconstruction vidéo dans les boucles d'entraînement de politiques de manipulation : les meshes obtenus par NeRF ou reconstruction multi-vues classique nécessitaient un travail de remaillage manuel avant d'être injectables dans un moteur physique comme MuJoCo ou Isaac Sim. En contournant le SfM, AGILE devient également utilisable sur des données de terrain non contrôlées, ce qui ouvre la voie à la collecte passive de démos humaines à grande échelle, un prérequis pour les approches VLA (Vision-Language-Action) qui peinent encore à obtenir suffisamment de trajectoires dextères annotées. Le problème de la reconstruction main-objet est étudié depuis plusieurs années, avec des datasets de référence comme HO-3D (2020) et DexYCB (2021), et des méthodes basées sur les modèles paramétriques MANO pour la main. L'originalité d'AGILE est de déporter la reconstruction de l'objet vers une génération guidée, plutôt que de l'estimer directement depuis le signal vidéo dégradé. Les concurrents directs sont les méthodes NeRF-based adaptées aux scènes dynamiques (D-NeRF, HO-NeRF) et les pipelines SfM+MVS classiques, tous sensibles aux occultations. Du côté des acteurs industriels, cette direction intéresse directement les équipes travaillant sur la télé-opération et l'imitation learning pour bras robotiques dextères, notamment chez Dexterous Robotics, Physical Intelligence (Pi) ou les labos académiques proches de Figure et Apptronik. Le projet dispose d'une page dédiée (agile-hoi.github.io) ; aucun code ni dataset supplémentaire n'est annoncé à ce stade.

RecherchePaper
1 source
HIGenNTO : génération évolutive d'interactions humanoïdes par optimisation de trajectoire dans l'espace de bruit
2arXiv cs.RO 

HIGenNTO : génération évolutive d'interactions humanoïdes par optimisation de trajectoire dans l'espace de bruit

Des chercheurs présentent HIGenNTO (Humanoid Interaction Generation via Noise-space Trajectory Optimization), décrit dans un article publié sur arXiv le 22 septembre 2026 (arXiv:2609.22611v1). Le framework s'attaque à un problème concret de l'apprentissage par imitation chez les robots humanoïdes : les références de mouvement issues de capture de mouvement (motion capture) se dégradent en cas d'occlusion ou de contact physique rapproché, et le retargeting vers un squelette robotique introduit des incohérences géométriques et de contact. La méthode optimise le bruit initial d'un modèle de mouvement pré-entraîné et conditionné par texte, sous des contraintes spatio-temporelles et de scène éparses, afin de générer des trajectoires d'interaction humanoïde-scène qui respectent les contacts souhaités, évitent les collisions et conservent un appui stable, tout en préservant le réalisme du modèle de base. Ces mouvements, générés depuis zéro ou composés en séquences longues par étapes, sont ensuite exécutés par des politiques de suivi en simulation, puis utilisés pour entraîner des politiques visuomotrices conditionnées par la profondeur, fonctionnant uniquement avec les capteurs embarqués. L'équipe a déployé ces politiques sur un robot Unitree G1 pour quatre tâches riches en contacts, parmi huit tâches évaluées au total, dont trois ont été proposées et compilées (prompts, contraintes, scènes) par un agent de codage autonome. L'intérêt principal tient au contournement d'un goulot d'étranglement connu du secteur : la difficulté d'obtenir des données de démonstration fiables pour des interactions physiques complexes (s'asseoir, pousser, manipuler un objet), sans dépendre de capture de mouvement humaine coûteuse et imparfaite. Le recours à un agent de codage pour générer automatiquement des spécifications de tâches ouvre une piste de mise à l'échelle des pipelines de données, un enjeu central pour les laboratoires qui développent des modèles VLA comme Pi-0, GR00T N2 ou Helix. Il faut toutefois noter l'échelle limitée de la démonstration, huit tâches seulement, dont quatre validées sur robot réel, ce qui en fait une preuve de concept académique plutôt qu'un système prêt pour un déploiement industriel. Le choix du Unitree G1, plateforme largement utilisée en recherche académique pour son coût accessible, situe ce travail dans la lignée des efforts combinant modèles génératifs de mouvement et politiques d'exécution par simulation, sans acteur commercial ni implication d'un intégrateur français ou européen. Aucun calendrier de pilote industriel n'est annoncé, le travail restant à ce stade cantonné à la validation en laboratoire et à l'extension future du nombre de tâches couvertes.

RecherchePaper
1 source
Apprentissage par renforcement à entropie de trajectoire pour un apprentissage robuste des compétences motrices des robots
3arXiv cs.RO 

Apprentissage par renforcement à entropie de trajectoire pour un apprentissage robuste des compétences motrices des robots

Des chercheurs publient une nouvelle méthode d'apprentissage par renforcement pour le contrôle robotique, baptisée Trajectory Entropy Reinforcement Learning, décrite dans un article déposé sur arXiv (référence 2505.04193, version 2). Le principe consiste à minimiser l'entropie de la trajectoire complète des actions produites par l'agent, c'est-à-dire le nombre de bits nécessaires pour décrire ces actions une fois les états observés, au lieu de s'appuyer uniquement sur la maximisation de récompense classique. Cette entropie est estimée via un modèle de prédiction d'actions à paramétrage variationnel, utilisé pour construire une fonction de récompense régularisée par l'information ; un algorithme permet ensuite d'optimiser conjointement la politique et ce modèle de prédiction. Testée sur plusieurs tâches de locomotion à haute dimension, la méthode produit des trajectoires d'actions plus cycliques et cohérentes, avec de meilleures performances et une robustesse supérieure au bruit et aux changements dynamiques que les approches de référence. Le résultat cible un point faible connu du RL profond appliqué au contrôle : les politiques neuronales capturent souvent des corrélations complexes et fallacieuses entre observations et actions, ce qui les rend fragiles dès qu'une perturbation légère affecte l'environnement, un frein direct au transfert simulation-vers-réel. En imposant un biais de simplicité mesuré par une quantité d'information plutôt qu'une régularisation ad hoc, ce travail propose un levier générique de robustesse, potentiellement transposable au-delà de la locomotion vers la manipulation ou les tâches de robots mobiles autonomes en environnement non contrôlé, un enjeu central pour tout intégrateur cherchant à sortir de la démonstration en labo. Cette contribution s'inscrit dans une lignée de recherches sur les biais inductifs de simplicité en apprentissage par renforcement, une direction distincte des approches dominantes misant sur l'échelle des données, à l'image des politiques vision-langage-action généralistes type Pi-0 ou GR00T N2. Publié sous forme de révision croisée entre catégories arXiv, l'article reste une contribution académique validée en simulation, sans mention de déploiement matériel, de partenariat industriel ni de calendrier de transfert vers une pile robotique commerciale.

RecherchePaper
1 source
Générer des mains robotiques à partir de démonstrations humaines
4arXiv cs.RO 

Générer des mains robotiques à partir de démonstrations humaines

Des chercheurs ont publié un framework de co-conception de mains robotiques guidé par les données (arXiv:2506.20549, juin 2025). Le problème visé est le co-design corps/contrôleur: optimiser simultanément la morphologie d'un effecteur et son contrôleur crée un espace combinatoire difficilement tractable. La solution exploite plus de 4 millions de frames de mouvements de bouts de doigts humains issus de manipulations quotidiennes pour optimiser des mains à structure arborescente, en utilisant une politique de contrôle minimale commune à la phase de recherche et à la phase opérationnelle: le suivi de position des fingertips par cinématique inverse (IK). Deux catégories de designs ont été produites: une main à 6 degrés de liberté (DoF) à usage général, et des mains spécialisées à 3 DoF équipées de joints "mimic" à quadrilatère articulé (four-bar spatial). Un acteur entraîné par apprentissage par renforcement (RL) accélère la recherche morphologique, réduisant le temps de calcul de plusieurs heures à quelques minutes; les structures finales sont fabriquées en impression 3D print-in-place, en une seule pièce articulée sans assemblage. En expériences réelles, la main 6-DoF dépasse des mains robotiques commerciales non identifiées sur la précision de suivi télé-opéré, tandis que les mains 3-DoF reproduisent des trajectoires structurées avec une complexité mécanique réduite. L'apport principal est la résolution d'un verrou de fond en co-design: en imposant la même politique IK simple pendant l'optimisation et après fabrication, les auteurs découplent la recherche morphologique de l'apprentissage d'un contrôleur complexe, rendant l'exploration de l'espace de design tractable à grande échelle. Ce résultat soutient une hypothèse émergente: des données massives de mouvement humain non conçues pour la robotique peuvent informer l'optimisation de l'embodiment physique d'un robot, et pas seulement son contrôleur. La comparaison avec des mains commerciales reste difficile à évaluer, le preprint ne précisant ni les références comparées ni les conditions d'évaluation; prudence sur ce point en l'absence de benchmark standardisé. Ce travail prolonge une tendance croissante qui vise à utiliser des données humaines non seulement pour entraîner des politiques robotiques (VLA, imitation learning), mais pour co-générer le hardware lui-même. Les approches concurrentes en evolutionary robotics et en simulation différentiable existent depuis des années mais restent coûteuses en calcul ou peu généralisables; l'originalité de cette contribution réside dans la décorrélation design/contrôle et dans l'usage du RL comme heuristique de recherche morphologique efficace. À ce stade, il s'agit d'un preprint non encore peer-reviewed, sans déploiement industriel ni partenaire commercial annoncé; les suites naturelles seraient une validation sur un spectre plus large de tâches de manipulation et une comparaison rigoureuse avec des benchmarks établis. Aucun acteur européen n'est impliqué dans ces travaux.

RecherchePaper
1 source