Aller au contenu principal
RecherchearXiv cs.RO 

Co-design Gym : un benchmark unifié pour la co-optimisation de la morphologie et de la politique de contrôle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (identifiant 2610.02366) Co-Design Gym, une suite de benchmarks dédiée à l'optimisation conjointe de la morphologie d'un agent et de sa politique de contrôle. L'ensemble couvre 20 familles d'environnements, avec plus de 85 configurations de co-conception prédéfinies. Les domaines vont de la manipulation robotique et de la locomotion à la coopération multi-robots, en passant par les dynamiques déformables et molles, les jeux vidéo, les réseaux électriques, les réseaux sans fil, la course de F1, les entrepôts multi-agents et le contrôle optimal. Les auteurs y ajoutent une évaluation systématique d'algorithmes de co-conception représentatifs, pour dresser l'état de l'art actuel. Il s'agit d'un travail de recherche académique : aucun produit, déploiement industriel ni donnée de performance matérielle n'est annoncé, et le résumé ne chiffre pas les résultats de cette comparaison.

L'intérêt tient à une hypothèse implicite de la plupart des benchmarks d'apprentissage par renforcement et de robotique : l'agent est figé, seule la politique s'apprend. Or la morphologie conditionne les politiques que l'on peut découvrir, et la meilleure morphologie dépend elle-même des politiques qu'elle autorise. Optimiser les deux séparément donne donc des résultats sous-optimaux. Pour les roboticiens et les intégrateurs, la question est concrète : choix du nombre de degrés de liberté, de la géométrie des membres, de l'emplacement des actionneurs ou de la préhension. Ces décisions se prennent aujourd'hui surtout par ingénierie et itération manuelle, et la co-conception reste peu comparable d'une étude à l'autre. Un banc d'essai commun permettrait de mesurer sur une base homogène ce que ces méthodes apportent réellement, et de vérifier si les gains observés sur des cas isolés se généralisent. L'élargissement à des domaines hors robotique (réseaux, énergie) suggère aussi que la méthode vise un usage plus large que les seuls humanoïdes.

Ce travail s'inscrit dans une littérature sur la co-optimisation forme-contrôle qui existe depuis des années, mais dont les résultats sont dispersés entre des environnements ad hoc, ce qui freine les comparaisons. Co-Design Gym adopte le format des suites de type Gym, devenues le standard pour l'apprentissage de politiques, afin de favoriser un progrès cumulatif. Le résumé ne précise ni les algorithmes testés, ni les scores, ni la disponibilité du code, des points à vérifier dans le texte complet. Il reste aussi à voir si ces environnements, simulés, transféreront vers du matériel réel, où l'écart simulation-réalité pèse encore sur la fabrication de morphologies optimisées.

À lire aussi

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel
1arXiv cs.RO 

OGPO : optimisation de politique générative en une étape pour le contrôle de robots en temps réel

Des chercheurs publient OGPO (One-Step Generative Policy Optimization), un cadre d'apprentissage pour le contrôle robotique en temps réel, dont la version 2 vient d'être diffusée sur arXiv (2601.20701). Il vise un problème précis : les politiques de contrôle fondées sur la diffusion ou le flow matching génèrent les actions en plusieurs étapes d'échantillonnage, ce qui limite leur usage dès que la latence compte. Réduire ce nombre d'étapes à un seul dégrade d'ordinaire la qualité de représentation et la performance sur la tâche. Les auteurs décrivent un compromis à trois pôles entre vitesse, fidélité et performance. OGPO associe une architecture légère au principe d'« interval velocity » pour une inférence en une étape sans distillation, tandis qu'une technique de « représentation spreading » évite la dégradation des représentations. Une phase d'apprentissage par renforcement (RL) on-policy affine ensuite cette politique rapide et stable. Sur les benchmarks RoboMimic et OpenAI Gym, la méthode égale ou dépasse des références multi-étapes, avec une inférence 5 à 20 fois plus rapide et une fréquence de contrôle supérieure à 120 Hz. Un déploiement physique sur un bras Franka Emika Panda est présenté comme validation. L'intérêt tient à la place des politiques génératives dans la robotique actuelle. Diffusion et flow matching sont devenus des choix courants pour représenter des comportements multimodaux, y compris dans plusieurs architectures VLA (vision-langage-action). Leur coût d'inférence impose pourtant des compromis : fréquences de contrôle basses, découpage des actions en blocs (chunking), ou matériel de calcul embarqué plus lourd. Une politique à plus de 120 Hz sans distillation, si les résultats tiennent, rapprocherait ces méthodes des boucles de contrôle réactives, utiles pour la manipulation fine ou le contact. L'ajout du RL on-policy répond à une limite connue de l'apprentissage par imitation, dont la performance reste bornée par la qualité des démonstrations. Les réserves sont claires : RoboMimic et Gym sont des benchmarks académiques, la validation réelle se limite à un seul bras et le résumé ne détaille ni les tâches physiques, ni le taux de réussite, ni le matériel de calcul. Le gain de 5 à 20 fois dépend des références choisies. Ce travail s'inscrit dans une course à l'accélération des politiques génératives. Diffusion Policy a imposé le paradigme, les approches de flow matching comme Pi-0 l'ont repris à plus grande échelle, et plusieurs équipes explorent la distillation en peu d'étapes ou le fine-tuning par RL de ces politiques. OGPO prend une voie sans distillation, en combinant vitesse et amélioration par renforcement. Il s'agit ici d'une publication de recherche, sans produit ni déploiement industriel annoncé. La suite dépendra des preuves sur des tâches plus variées, sur des robots différents et, surtout, de son intégration dans de grands modèles VLA. Une page de projet accompagne l'article.

RecherchePaper
1 source
ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation
2arXiv cs.RO 

ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation

Une équipe de chercheurs a publié ATOM-Bench, un benchmark de terrain conçu pour évaluer les politiques de manipulation robotique sur deux dimensions distinctes : l'acquisition de compétences atomiques et la généralisation compositionnelle. Le dispositif décompose la manipulation sur table en "atomes moteurs" (précision de préhension, trajectoire du poignet, force de contact) et en "atomes d'instruction" (comptage, filtrage logique, ancrage sémantique). Il comprend 30 tâches atomiques et 24 tâches compositionnelles inédites, testées sur des configurations bras unique et bras double. Les auteurs ont collecté 3 000 démonstrations humaines pour le fine-tuning et effectué 2 700 rollouts physiques sur cinq politiques de manipulation représentatives. Les métriques introduites, l'Atomic Score (AS) et le Compositional Failure Share (CFS), permettent d'isoler la source d'un échec : exécution moteur défaillante, mauvais ancrage instruction, ou incapacité à recombiner des compétences acquises. Les résultats remettent en cause un postulat courant dans le secteur : que des politiques performantes sur des tâches atomiques généralisent naturellement à des tâches compositionnelles. Ce n'est pas le cas. Malgré des scores atomiques corrects sur l'ancrage d'instructions simples, les modèles testés échouent systématiquement sur le comptage, le filtrage logique et les atomes moteurs fins. Plus significatif encore, une bonne performance atomique ne prédit pas fiablement la réussite sur les tâches compositionnelles hors distribution. Pour un intégrateur ou un décideur industriel, cela signifie que les benchmarks classiques sur tâches démontrées surestiment largement la robustesse opérationnelle des politiques dites "généralistes". ATOM-Bench s'inscrit dans un contexte où les politiques VLA (Vision-Language-Action) comme pi0 (Physical Intelligence), Octo, ou OpenVLA sont présentées comme des fondations universelles pour le contrôle robotique. Ce cadre d'évaluation comble l'absence de protocole standardisé pour tester la composabilité des compétences, un angle mort identifié depuis les travaux sur l'abstraction hiérarchique en RL. Les données de démonstration et les rollouts d'évaluation sont publiés en open access pour permettre une comparaison reproductible entre équipes. La prochaine étape logique serait d'intégrer ATOM-Bench comme protocole de validation dans les pipelines de fine-tuning des acteurs du secteur, notamment pour qualifier des déploiements réels en environnement industriel non contrôlé.

UELes laboratoires et intégrateurs européens travaillant sur des politiques de manipulation robotique peuvent adopter ATOM-Bench comme protocole de validation open-access pour qualifier la robustesse réelle de leurs systèmes avant déploiement industriel.

RecherchePaper
1 source
Modèles du monde à opérateurs de graphe pour la généralisation morphologie-paramètres en contrôle continu
3arXiv cs.RO 

Modèles du monde à opérateurs de graphe pour la généralisation morphologie-paramètres en contrôle continu

Une équipe de recherche publie sur arXiv (référence 2608.20936v1, soumission en cross-list) une nouvelle architecture baptisée Graph-Operator World Models, ou GraphOp-WM, destinée au contrôle continu de robots articulés. Le principe consiste à représenter le corps du robot et ses relations cinématiques sous forme de graphe attribué, puis à factoriser chaque transition dynamique en deux parties : une base de dynamique locale indépendante de la morphologie, et un opérateur structuré conditionné par la morphologie. Cet opérateur combine trois mécanismes : une modulation locale au niveau de chaque nœud, un couplage le long de l'arbre cinématique, et une correction globale de rang faible. Le modèle s'appuie aussi sur une séparation architecturale de l'information, une normalisation de la base de dynamique, et une supervision par paires de morphologies différentes, pour forcer la dépendance à la morphologie à transiter uniquement par le canal de l'opérateur. Une lecture au niveau du graphe et des représentations d'action par arête fournissent une interface compatible avec le calcul de récompense, de valeur et la planification de type TD-MPC. Les auteurs définissent des scénarios de test contrôlés sous MuJoCo, couvrant interpolation, extrapolation et compositions inédites de paramètres de géométrie des liaisons, de masse, d'amortissement et d'actionnement, sur trois environnements classiques : Hopper, Walker2d et HalfCheetah. Le problème visé est concret pour l'industrie robotique : les modèles du monde entraînés pour un système physique fixe se dégradent dès que des paramètres de morphologie connus, comme la longueur des liaisons, la masse, l'amortissement ou l'actionnement, changent, même légèrement. Or ces variations sont la norme en production, entre unités d'une même gamme, après usure mécanique, ou lors du passage d'un prototype à une variante commerciale. En séparant explicitement ce qui reste réutilisable de ce qui doit s'adapter à la morphologie, GraphOp-WM propose une piste pour réduire le réentraînement spécifique à chaque robot et généraliser au sein d'une famille de robots articulés apparentés, plutôt que de traiter chaque configuration matérielle comme un cas isolé. C'est un signal utile pour les intégrateurs et les équipes de R&D en apprentissage par renforcement qui gèrent des flottes hétérogènes ou des lignes de produits évolutives, même si l'article ne fournit à ce stade aucune validation sur robot réel. Ce travail reste, à ce stade, une contribution de recherche fondamentale, publiée en preprint sur arXiv sans laboratoire ni entreprise identifié dans le résumé, et validée uniquement en simulation via le moteur physique MuJoCo, un standard académique pour le contrôle continu, et non sur du matériel déployé. Il s'inscrit dans la lignée des modèles du monde couplés à la planification, dans la famille TD-MPC, et dans le courant plus large de recherche sur la généralisation inter-morphologies et le contrôle multi-corps, qui cherche à dépasser l'entraînement d'un modèle par robot spécifique. Aucun pilote industriel, aucune date de déploiement ni aucun partenaire commercial n'est mentionné : les prochaines étapes attendues sont la revue par les pairs et, potentiellement, l'extension des tests au-delà des trois environnements simulés Hopper, Walker2d et HalfCheetah vers des familles de robots plus larges ou vers un transfert sur matériel réel.

RecherchePaper
1 source
BRIDGE : une plateforme humanoïde open source par co-conception morphologie-contrôle pour l'IA physique
4arXiv cs.RO 

BRIDGE : une plateforme humanoïde open source par co-conception morphologie-contrôle pour l'IA physique

Bridge rejoint une catégorie de plateformes humanoïdes compactes et open source aux cotes de Toddlerbot, K1 et Bumi, conçues comme des bancs d'essai de recherche a bas cout plutôt que des produits commerciaux, a l'oppose des humanoïdes adultes fermes vises pour l'usine ou l'entrepôt par les grands acteurs prives du secteur. Publiee sur arXiv sous la référence 2609.03497, l'étude présente Bridge, un humanoïde open source de 88 centimètres conçu via un cadre de co-design reliant morphologie et contrôle moteur complet du corps. Plutot que de dessiner d'abord le squelette puis d'y greffer une politique de contrôle, comme le fait l'approche classique, les chercheurs optimisent conjointement la structure physique et la capacité du robot a reproduire des mouvements humains. Ils introduisent aussi une métrique inédite combinant fidélité de retargeting cinématique et performance de suivi dynamique. Face a trois références, Bumi, K1 et Toddlerbot, Bridge obtient les meilleurs scores sur toutes les métriques, avec une locomotion stable, un équilibre robuste et des mouvements dynamiques avances. Le robot, sa politique de contrôle et les vidéos de démonstration sont publies en accès libre. Cette publication pointe un problème structurel de la robotique humanoïde actuelle : la séparation entre conception mécanique et développement du contrôle produit des machines dont les mouvements restent rigides face a ceux d'un humain. En dimensionnant le corps du robot a partir des données de mouvement humain a reproduire, Bridge vise a améliorer la qualité des données capturées par téléopération, un enjeu direct pour l'entrainement des modèles vision-langage-action (VLA) dont les performances dépendent de la fidélité geste-machine. Pour les laboratoires et intégrateurs travaillant sur l'apprentissage par imitation, ce travail suggère que le goulot d'étranglement se situe autant dans la conception matérielle que dans les algorithmes, un facteur souvent éclipse par la course aux annonces de modèles de fondation. En publiant intégralement design, politique de contrôle et outils associes, les auteurs misent sur une adoption académique plutôt que sur une mise sur le marche. Le papier ne mentionne aucun partenariat industriel ni calendrier de déploiement au-delà de cette mise a disposition en open source, laissant présager une diffusion progressive du cadre de co-design vers d'autres équipes de recherche cherchant a améliorer la fidélité de mouvement de leurs propres plateformes.

RecherchePaper
1 source