Aller au contenu principal
RecherchearXiv cs.RO 

MOCHA : la co-conception multi-objectifs par architectures à hyperréseaux

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint mis en ligne sur arXiv (arXiv:2609.30570v1) décrit MOCHA, pour Multi-Objective Co-Design using Hypernetwork Architectures, une méthode d'apprentissage par renforcement qui calcule avec un seul réseau de neurones toute une famille de politiques de contrôle Pareto-optimales sur l'espace de conception d'un robot. Le système repose sur un hypernetwork, un réseau qui génère les poids d'un second réseau spécialisé pour un objectif et une configuration mécanique donnes, baptise "multi-objective design hypernetwork" (MDH). Les auteurs rapportent des tests sur deux morphologies robotiques distinctes, chacune définie par six dimensions de conception et évaluée sur deux a trois objectifs simultanés, puis une recherche évolutionnaire menée sur ce réseau qui produit un ensemble de Pareto associant, a chaque arbitrage d'objectifs, la meilleure combinaison design-politique, ainsi qu'une méthode pour identifier des conceptions généralistes performantes sur l'ensemble des objectifs cumules.

Le co-design robotique, c'est a dire optimiser ensemble la morphologie physique et la politique de contrôle, bute généralement sur un verrou couteux: chaque nouvelle variante de conception oblige a reentrainer une politique de renforcement depuis zero, ce qui limite le nombre de configurations qu'un laboratoire peut explorer. En générant a la volée une politique spécialisée pour n'importe quelle configuration testée, MOCHA vise a supprimer ce reentrainement systématique et a livrer directement un front de Pareto exploitable pour arbitrer entre objectifs concurrents comme la vitesse, la consommation d'énergie ou la charge utile, plutôt que de relancer une recherche séparée par priorité. L'approche reste néanmoins un résultat de recherche précoce, validée sur seulement deux morphologies simulées et un nombre restreint d'objectifs, loin d'une démonstration a l'échelle d'un robot industriel.

Ce travail s'inscrit dans le champ du co-design robotique assiste par apprentissage automatique, ou l'approche dominante combine recherche évolutionnaire des paramètres physiques et reentrainement RL candidat par candidat, une boucle couteuse que plusieurs équipes cherchent a contourner. Les hypernetworks, déjà utilises en méta-apprentissage et en RL multi-tache, sont ici appliques a la paramétrisation conjointe de la conception mécanique et de l'objectif vise pour produire un front de Pareto complet en un seul entrainement; les auteurs présentent cela comme une première a leur connaissance, une affirmation qui n'a pas encore été confirmée par une relecture par les pairs puisqu'il s'agit d'un preprint tout juste publie. Aucune entreprise, aucun robot commercial ni calendrier de déploiement n'est associe a ces travaux: il s'agit d'un jalon académique dont les suites attendues seraient l'extension a des morphologies plus complexes, a davantage d'objectifs, puis un éventuel transfert vers du matériel robotique réel.

Dans nos dossiers

À lire aussi

Conception de pinces souples par graphes : optimisation multi-objectifs qualité-diversité
1arXiv cs.RO 

Conception de pinces souples par graphes : optimisation multi-objectifs qualité-diversité

Une équipe de recherche en robotique propose une nouvelle méthode de conception pour les préhenseurs souples (soft grippers), détaillée dans un article publié sur arXiv le 18 septembre 2026 (arXiv:2609.20087v1). L'approche repose sur deux éléments combinés : un espace de conception représenté sous forme de graphe, capable de décrire des structures et mécanismes en mécanique des milieux continus, et un algorithme génétique multi-objectif dit de "quality-diversity", conçu pour maintenir une variété de solutions tout au long du processus d'optimisation plutôt que de converger vers un seul design optimal. Les chercheurs ont testé leur méthode en faisant varier le nombre et la nature des scénarios de préhension utilisés pendant l'optimisation, afin d'observer si l'exposition à des tâches diversifiées permet aux préhenseurs générés de généraliser à des objets et conditions de contact inédits. Résultat rapporté : les designs optimisés sur un ensemble suffisamment diversifié de cas de préhension font émerger une capacité de généralisation, avec une robustesse supérieure sur des scénarios nouveaux comparée à des préhenseurs conçus pour une tâche unique. Ce travail s'attaque à un problème central pour l'industrialisation de la robotique souple : la difficulté à produire des préhenseurs qui ne soient pas simplement performants sur le cas d'usage pour lequel ils ont été calibrés, mais réutilisables sur une gamme large d'objets, un enjeu direct pour l'automatisation agricole, la manipulation en laboratoire ou les applications domestiques. Si les résultats se confirment à plus grande échelle, cela suggère une voie méthodologique pour concevoir des organes terminaux plus polyvalents sans multiplier les designs sur mesure, un point clé pour les intégrateurs qui cherchent à réduire les coûts d'ingénierie liés au changement de tâche. Le papier s'inscrit dans la lignée des recherches sur la robotique souple, où la compliance mécanique intrinsèque des matériaux facilite la préhension d'objets variés mais complique la conception rationnelle, faute de modèles simples pour un espace de solutions en mécanique des milieux continus jugé très vaste. En structurant cet espace via des graphes et en pilotant l'optimisation par la diversité plutôt que par la seule performance, les auteurs positionnent leur méthode comme une alternative aux approches de conception spécifiques à une tâche, ouvrant la voie à des travaux futurs sur la validation physique de ces préhenseurs générés algorithmiquement.

RecherchePaper
1 source
IA incarnée : automatisation de la conception d'architectures d'agents
2arXiv cs.RO 

IA incarnée : automatisation de la conception d'architectures d'agents

Une équipe de chercheurs a publié fin juin 2026 (arXiv:2606.30111) une étude sur l'automatisation de la conception d'architectures d'agents incarnés. Ils introduisent AgentCanvas, un environnement d'exécution à graphe typé qui représente les pipelines de perception, mémoire, planification et action comme des programmes nœud-à-fil éditables, et KDLoop, une procédure de recherche par agent codeur alternant proposition, critique, expérimentation et distillation, avec des réflexions déclenchées en cas de stagnation. L'évaluation suit une matrice 3x4 : trois variantes d'Agent Architecture Search (AAS) testées sur quatre tâches incarnées couvrant la navigation vision-langage, la réponse à des questions situées (embodied QA) et la manipulation conditionnée par le langage. Les résultats montrent des gains directionnels de taux de succès, mais un candidat apparemment performant a été écarté après détection d'une fuite de données (leak-bearing). L'intérêt de ces travaux réside dans le transfert, pour la première fois de façon systématique, des méthodes AAS -- jusqu'ici cantonnées aux agents textuels -- vers des agents perceptifs en simulation. Pour les architectes de systèmes cognitifs, cela ouvre la possibilité d'automatiser partiellement le choix de stockage de l'information, du traitement des observations et de l'enchaînement des appels de modèles, tâche jusqu'ici confiée à l'intuition des chercheurs. Les auteurs identifient cependant trois contraintes propres à l'incarné, absentes dans les benchmarks textuels : le bruit de rollout masque les signaux d'optimisation, la recherche se piège dans des bassins d'édition locaux, et l'attribution de crédit épisodique reste partielle même avec des journaux détaillés. La détection d'un candidat corrompu par fuite de données illustre par ailleurs un risque d'évaluation spécifique aux environnements simulés, où l'agent peut exploiter des artefacts de la simulation plutôt que résoudre la tâche réelle. Ces travaux s'inscrivent dans la mouvance des méthodes de méta-design d'architectures cognitives, appliquées ici à la couche système plutôt qu'aux poids des modèles. Les benchmarks dominants en navigation vision-langage (R2R, ALFRED) restent maîtrisés par des architectures manuelles, et des frameworks comme LangGraph ou AutoGen couvrent l'espace des agents textuels sans gestion de rollout simulé. Aucun acteur européen ou français n'est impliqué dans cette publication. Les prochaines étapes identifiées par les auteurs incluent l'extension à des environnements physiques réels et le renforcement de KDLoop face au bruit de rollout, deux verrous explicites avant toute applicabilité industrielle.

RecherchePaper
1 source
Debate2Create : la co-conception de robots par débat multi-agents
3arXiv cs.RO 

Debate2Create : la co-conception de robots par débat multi-agents

Des chercheurs ont présenté sur arXiv (2510.25850, v3) Debate2Create (D2C), un cadre multi-agent LLM qui aborde la co-conception robotique comme un débat structuré et itératif entre agents spécialisés, ancré dans un évaluateur physique. Un agent de conception gère la morphologie du robot tandis qu'un agent de contrôle propose les fonctions de récompense ; les deux s'affrontent en boucle thèse-antithèse-synthèse, supervisés par des juges LLM dédiés à des critères distincts. Testé sur cinq benchmarks de locomotion MuJoCo (Ant, Swimmer, HalfCheetah, Hopper, Walker2d), D2C obtient le meilleur score normalisé parmi toutes les baselines LLM et boîte noire évaluées, avec des gains de 3,2x sur Ant et de près de 9x sur Swimmer. Le débat itératif génère 18 à 35 % de performance supplémentaire par rapport à une génération zero-shot à budget de calcul équivalent, et les récompenses produites transfèrent aux morphologies par défaut dans 4 tâches sur 5. La co-conception robotique, qui consiste à optimiser simultanément la morphologie et la politique de contrôle d'un robot, est un problème combinatoire difficile, traditionnellement confié à des algorithmes évolutionnaires ou à des méthodes d'optimisation bayésienne coûteuses en calcul. Le résultat clé de D2C n'est pas le score absolu mais le gain systématique du débat itératif sur le zero-shot à budget équivalent : cela signale un avantage architectural réel, pas un simple effet d'échelle. Le transfert des récompenses générées aux morphologies standards dans 4 cas sur 5 propose une séparation réutilisable entre exploration morphologique et politique de contrôle, directement pertinente pour les intégrateurs travaillant sur des plateformes matérielles fixes. Ce travail s'inscrit dans un courant actif qui mobilise les LLM pour automatiser la conception de robots, aux côtés de cadres comme EvoPrompting et des pipelines LLM-to-sim explorés par les équipes de Nvidia et DeepMind. La singularité de D2C est l'ancrage dans une évaluation physique en boucle fermée pendant le débat, plutôt que dans la seule génération de code. Les benchmarks restent contraints à des topologies fixes et le transfert sim-to-real n'est pas abordé, deux limites qui situent la contribution dans le registre de la recherche fondamentale ; les prochaines étapes naturelles sont l'extension à des morphologies à topologie variable et la validation sur matériel réel.

RecherchePaper
1 source
LEMCA : synthèse d'architectures de contrôle à commutation de modes efficaces guidée par LLM
4arXiv cs.RO 

LEMCA : synthèse d'architectures de contrôle à commutation de modes efficaces guidée par LLM

Les chercheurs a l'origine du preprint publie le 21 septembre 2026 sur arXiv (2609.21319) proposent LEMCA (LLM-Guided synthesis of Efficient Mode-Switching Control Architectures), une méthode pour concevoir automatiquement des contrôleurs robotiques capables de basculer entre plusieurs modes mobilisant des ressources de calcul et de perception différentes selon la difficulté de la tache. Chaque architecture est représentée comme un programme interprétable, améliore par une boucle évolutionnaire: a chaque itération, un grand modèle de langage édité le code du contrôleur, la liste de ses modes, l'allocation capteurs-calcul de chacun et les règles de transition, tandis que la qualité des variantes est évaluée via des extensions compatibles MSC de méthodes de synthèse automatique de contrôleurs, dont l'apprentissage par renforcement en simulation. Sur plusieurs bancs d'essai de contrôle, LEMCA dépasse systématiquement la frontière de Pareto performance/ressources des architectures monolithiques classiques, en récupérant les ressources gaspillées pendant les phases faciles d'une tache. Ces résultats restent valides en simulation, sur des benchmarks de recherche, sans déploiement rapporte sur robot physique. L'enjeu concerne directement l'industrie robotique: la plupart des architectures actuelles allouent en permanence le budget de calcul et de capteurs le plus élevé, celui de la phase la plus exigeante, même durant des sous-taches triviales, ce qui gaspille énergie et puissance embarquée et limite l'autonomie. Automatiser la conception de contrôleurs a commutation de mode via un LLM, plutôt que de la confier a des ingénieurs pendant des semaines, ouvre la voie a des systèmes embarques moins couteux en calcul, un enjeu concret pour les intégrateurs qui font tourner perception et planification sur du matériel contraint. Le travail illustre aussi une tendance plus large: l'usage des LLM non plus comme contrôleurs eux-mêmes, a la manière des modèles VLA tels que GR00T N2, Pi-0 ou Helix, mais comme outils de méta-conception générant et optimisant le code d'autres systèmes de contrôle. LEMCA s'inscrit dans la lignée des travaux sur la synthèse automatique de contrôleurs et la programmation évolutive guidée par LLM, qui visent a remplacer le réglage manuel d'architectures robotiques par des boucles d'optimisation combinant recherche de programmes et apprentissage par renforcement. Le choix historique entre concevoir des contrôleurs a commutation de mode au prix d'un lourd travail d'ingénierie tache par tache, ou se rabattre sur des architectures monolithiques uniformément couteuses, restait sans solution générique. Le preprint ne mentionne ni calendrier de suite ni partenaire industriel; les auteurs présentent LEMCA comme une première démonstration sur des benchmarks varies, dont la confirmation au-delà de la simulation, notamment sur des taches de manipulation ou de navigation, reste a établir.

RecherchePaper
1 source