Aller au contenu principal
L'optimisation évolutive cerveau-corps échoue systématiquement à sélectionner le potentiel morphologique
RecherchearXiv cs.RO 

L'optimisation évolutive cerveau-corps échoue systématiquement à sélectionner le potentiel morphologique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv, sous la référence 2508.17464 (version 2, qui remplace une préprint antérieure), une étude qui cartographie de façon exhaustive un espace de conception de robots mous à base de voxels. Les chercheurs ont entraîné un contrôleur pour chacune des 1 305 840 morphologies possibles de cet espace, obtenant ainsi une carte quasi complète du paysage reliant forme du robot et performance. Cette connaissance exhaustive du paysage leur permet d'observer en détail comment se comportent réellement les algorithmes évolutionnaires chargés de faire évoluer conjointement le corps et le contrôleur d'un robot, plutôt que de déduire leur fonctionnement à partir de résultats finaux agrégés sur un échantillon partiel.

Le constat central est que les algorithmes de co-optimisation cerveau-corps testés ne parviennent pas, de manière fiable, à converger vers des solutions proches de l'optimum. La recherche reste parfois bloquée sur des morphologies situées à une seule mutation d'une solution meilleure : l'algorithme sous-évalue systématiquement les individus dont le corps vient d'être muté et élimine ainsi, prématurément, des morphologies prometteuses avant qu'elles aient pu exprimer leur potentiel via un contrôleur suffisamment entraîné. À l'inverse, l'étude montre que co-optimiser corps et contrôleur produit des couples morphologie-contrôleur capables d'atteindre des performances hors de portée d'une simple optimisation du contrôleur sur une morphologie fixe. Pour les équipes de recherche en robotique évolutionniste et en conception générative de robots, ce résultat nuance l'idée reçue selon laquelle des algorithmes évolutionnaires standards suffisent à explorer efficacement un espace de conception dès lors que le co-design est activé : le problème ne vient pas du principe du co-design lui-même, mais d'un biais de sélection précis qui pénalise les mutations morphologiques récentes.

Ce travail s'inscrit dans un champ ancien de la robotique évolutionniste, où la difficulté à faire évoluer simultanément forme et comportement est documentée depuis les premières créatures virtuelles évolutives des années 1990, et plus récemment via les plateformes de robots mous à base de voxels utilisées comme bancs d'essai standardisés pour ce type d'expérience à grande échelle. En cartographiant intégralement un espace de plus d'un million de morphologies plutôt qu'un échantillon, les auteurs fournissent une base empirique rare pour trancher des débats jusque-là fondés sur des observations partielles, et ouvrent la voie à des algorithmes de sélection corrigés pour tenir compte du biais identifié contre les corps récemment mutés.

Dans nos dossiers

À lire aussi

Les limites de l'évolution lamarckienne face à la pression de nouveauté morphologique
1arXiv cs.RO 

Les limites de l'évolution lamarckienne face à la pression de nouveauté morphologique

Une étude publiée sur arXiv (arXiv:2604.15854) en avril 2026 examine les limites de l'héritage lamarckien dans les systèmes de robots modulaires évolutifs. Le cadre expérimental repose sur une population de robots capables de co-évoluer leur morphologie et leurs contrôleurs, puis d'apprendre individuellement une tâche de locomotion. Dans un système lamarckien, les contrôleurs appris par les parents sont transmis directement aux descendants, contrairement à l'approche darwinienne classique où seule l'information génétique est héritée. Les chercheurs ont comparé les deux paradigmes en faisant varier la pression de sélection : d'une optimisation pure sur la performance de locomotion à une optimisation multi-objectif intégrant également une récompense pour la nouveauté morphologique. Résultat : l'héritage lamarckien surpasse le darwinisme en optimisation de tâche seule, mais accuse une chute de performance significativement plus importante dès que la diversité morphologique est encouragée. Ce résultat met en évidence un arbitrage fondamental dans la conception des systèmes d'évolution robotique : l'exploitation par héritage et l'exploration par diversité sont partiellement incompatibles. L'efficacité de l'héritage lamarckien repose sur une hypothèse implicite de continuité morphologique entre parent et descendant. Or, maximiser la diversité des formes casse précisément cette continuité, rendant les contrôleurs hérités peu ou pas transférables. Pour les chercheurs en robotique évolutive et les équipes travaillant sur la synthèse automatique de robots (notamment pour des applications d'adaptation en environnements non structurés), cela signifie que le choix du mécanisme d'héritage doit être conditionné au régime d'exploration morphologique visé. Ces travaux s'inscrivent dans un débat actif en robotique évolutive sur le sim-to-real gap et la capacité des algorithmes évolutifs à produire des morphologies réellement variées et fonctionnelles. Plusieurs équipes européennes, dont des laboratoires français travaillant sur la robotique adaptative, explorent des compromis similaires entre plasticité morphologique et transfert de politiques de contrôle. La piste ouverte par cette étude pointe vers des mécanismes d'héritage sélectif ou conditionnel, activés uniquement lorsque la similarité parent-descendant dépasse un seuil donné, une direction que les auteurs identifient comme prolongement naturel de ces résultats.

UELes équipes européennes et françaises travaillant sur la robotique évolutive et adaptative peuvent ajuster leur choix de mécanisme d'héritage selon le régime d'exploration morphologique visé, à la lumière de ces résultats expérimentaux.

RecherchePaper
1 source
Jacobien structuré pour l'optimisation du mouvement à dérivées temporelles d'ordre élevé dans les systèmes multi-corps
2arXiv cs.RO 

Jacobien structuré pour l'optimisation du mouvement à dérivées temporelles d'ordre élevé dans les systèmes multi-corps

Des chercheurs ont publié sur arXiv (réf. 2605.15845) un framework analytique pour le calcul de Jacobiens dans les problèmes d'optimisation du mouvement de systèmes multi-corps articulés, typiquement robots humanoïdes ou modèles cinématiques humains. La contribution porte sur la prise en compte explicite des dérivées temporelles d'ordre élevé dans les fonctions de coût : au-delà de la position, vitesse et accélération, le jerk (dérivée troisième) ou la variation temporelle des forces sont des grandeurs pertinentes pour modéliser la fluidité du mouvement ou des comportements expressifs. Le framework dérive analytiquement les Jacobiens des quantités cinématiques et dynamiques (quantité de mouvement, forces, couples articulaires) par rapport aux coordonnées généralisées et leurs dérivées successives, en s'appuyant sur un formalisme dit de "comprehensive motion computation" qui exploite explicitement la structure en chaîne de la cinématique multi-segments. L'apport concret face aux méthodes dominantes, différentiation numérique ou automatique via JAX, PyTorch ou CasADi, est double : gain en efficacité computationnelle et meilleure stabilité numérique, confirmés par les benchmarks présentés dans l'article. Ces outils génériques ignorent la topologie interne de la chaîne cinématique, ce qui génère du surcoût calculatoire à mesure que l'ordre des dérivées augmente. Par ailleurs, le framework est démontré en optimisation inverse : à partir de données de mouvement observé, il retrouve les poids de la fonction de coût d'origine, une capacité directement exploitable pour l'analyse de compétences motrices, l'imitation du geste humain ou la personnalisation de trajectoires robotiques. Ce travail s'inscrit dans la continuité des efforts pour rendre l'optimisation du mouvement praticable en temps réel sur des architectures articulées complexes. Des bibliothèques comme Pinocchio, développée par l'équipe Gepetto du LAAS-CNRS et de l'INRIA en France, ou Drake du Toyota Research Institute adressent des problématiques voisines mais restent généralement limitées aux dérivées du second ordre. L'extension à des ordres arbitraires ouvre des perspectives pour les contrôleurs de robots expressifs et les systèmes d'imitation gestuelle. Point de vigilance : aucune validation sur robot physique n'est présentée à ce stade, les résultats demeurant purement numériques, et le passage à des applications embarquées temps-réel reste entièrement à démontrer.

UECe framework de Jacobiens analytiques pour dérivées d'ordre élevé pourrait enrichir des bibliothèques comme Pinocchio (LAAS-CNRS/INRIA), renforçant l'écosystème européen de planification de mouvement pour robots humanoïdes.

RecherchePaper
1 source
Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne
3arXiv cs.RO 

Apprentissage par renforcement basé sur un modèle pour le contrôle robotique via optimisation en ligne

Des chercheurs ont publié sur arXiv (arXiv:2510.18518v2) un algorithme d'apprentissage par renforcement basé sur un modèle (MBRL) conçu pour contrôler des systèmes robotiques complexes directement dans le monde réel, sans passer par une phase de simulation intensive. L'approche construit un modèle de dynamique à partir des données d'interaction en temps réel, puis effectue des mises à jour de politique guidées par ce modèle appris. Les validations expérimentales ont été conduites sur deux plateformes distinctes : un bras d'excavatrice hydraulique et un bras robot souple. Dans les deux cas, l'algorithme atteint des performances comparables aux méthodes model-free en quelques heures d'entraînement, là où ces dernières réclament habituellement des millions d'interactions simulées. La robustesse de l'adaptation a également été évaluée sous conditions de charge utile (payload) aléatoire, avec des résultats stables malgré le changement de dynamique. L'enjeu principal est la réduction de ce que le secteur appelle le "sim-to-real gap" : l'écart entre les politiques apprises en simulation et leur comportement réel une fois déployées sur du matériel. Les pipelines dominants, adoptés aussi bien par des labos académiques que par des industriels comme Boston Dynamics ou Figure AI, reposent sur des millions de rollouts en simulation avant tout contact avec un robot physique, ce qui introduit un biais systématique difficile à corriger. Cet algorithme court-circuite cette étape en apprenant directement sur données réelles, avec une garantie formelle de progression : les auteurs démontrent des bornes de regret sous-linéaires (sublinear regret bounds) sous hypothèses d'optimisation stochastique en ligne, ce qui est rare dans la littérature MBRL appliquée à la robotique physique. Pour un intégrateur ou un industriel, cela se traduit par une réduction potentielle du temps de mise en service sur des tâches à dynamique variable (variation de charge, usure mécanique, changement de matériau). Ce travail s'inscrit dans un débat structurant du champ : model-based vs model-free RL pour la robotique physique. Les méthodes model-free comme PPO ou SAC dominent les benchmarks simulés mais peinent à s'adapter efficacement en production réelle. Des approches hybrides comme MBPO ou DreamerV3 ont tenté de combler cet écart, mais rarement validées sur des systèmes aussi hétérogènes qu'un bras hydraulique industriel et un manipulateur souple. La prochaine étape naturelle serait une validation sur des plateformes humanoïdes ou des AMR (autonomous mobile robots) à haute dimension, où les enjeux de sample efficiency sont directement liés aux coûts d'exploitation et à la durée de vie des actionneurs.

RecherchePaper
1 source
Performance des caractéristiques de transfert d'énergie sans fil sélectif en fréquence pour l'actionnement magnétique sans fil et évolutif
4arXiv cs.RO 

Performance des caractéristiques de transfert d'énergie sans fil sélectif en fréquence pour l'actionnement magnétique sans fil et évolutif

Des chercheurs ont caractérisé la scalabilité du transfert d'énergie sans fil sélectif en fréquence pour l'actionnement magnétique de robots non filaires évoluant dans un même espace de travail. L'équipe a formalisé la relation entre le facteur de qualité (Q) des résonateurs et le nombre de récupérateurs d'énergie inductance-capacité (LC) qui peuvent être adressés individuellement dans une bande de fréquence radio donnée, avant de convertir cette énergie captée sélectivement en mouvement mécanique. Des réseaux de résonateurs couvrant une plage de 100 kHz à 1 MHz ont été analysés pour quantifier l'effet du nombre de résonateurs sur l'adressabilité indépendante. La validation expérimentale s'appuie sur trois actionneurs magnétiques non filaires de taille centimétrique, déclenchant sélectivement le mouvement de poutres mécaniques à 734 kHz, 785 kHz et 855 kHz, avec caractérisation de la force mécanique générée et de la bande d'activation de chaque actionneur, confirmant l'absence de déclenchement croisé non désiré. Ce travail comble une lacune concrète pour tout système voulant piloter plusieurs microrobots ou actionneurs sans fil indépendamment dans un espace partagé, un besoin central en microrobotique médicale (capsules ingérables, cathéters magnétiques) et en essaims de robots miniatures où le câblage est impraticable. Jusqu'ici, la littérature manquait d'un cadre quantitatif reliant le facteur Q à la limite réelle du nombre d'actionneurs adressables sur une bande RF fixe. En fournissant des équations de conception explicites pour optimiser ce facteur Q, l'étude donne aux ingénieurs un outil de dimensionnement plutôt qu'une simple preuve de concept isolée, ce qui conditionne directement la densité de robots contrôlables simultanément sans interférence. Le transfert d'énergie sans fil par résonance LC est une piste explorée depuis plusieurs années pour affranchir les microrobots magnétiques de toute batterie ou câble embarqué, un axe de recherche actif en robotique médicale et en actionnement à distance. Cette publication, classée en tant que remplacement d'une soumission arXiv antérieure, reste une démonstration de principe à l'échelle du laboratoire, avec seulement trois actionneurs testés simultanément. Les auteurs présentent leurs équations de dimensionnement comme une base pour des déploiements à plus grande échelle, sans toutefois annoncer de calendrier de prototypes supplémentaires ni de partenariat industriel à ce stade.

RecherchePaper
1 source