Aller au contenu principal
ECo-MoE : mélange d'experts conditionné par l'incarnation pour accroître l'évolvabilité des robots
RecherchearXiv cs.RO 

ECo-MoE : mélange d'experts conditionné par l'incarnation pour accroître l'évolvabilité des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié fin mai 2026 sur arXiv (arXiv:2605.24225) un nouveau cadre d'apprentissage et d'évolution pour robots baptisé ECo-MoE (Embodiment-Conditioned Mixture of Experts). L'architecture co-optimise simultanément une distribution de vecteurs de conception latents, assimilables à des génotypes, et un ensemble de modules de contrôle spécialisés, ou "experts", dont l'activation est conditionnée par les coordonnées latentes du morphotype décodé. Concrètement, chaque plan corporel d'un robot active ou désactive dynamiquement des combinaisons distinctes de circuits sensorimoteurs appris, permettant un comportement orienté objectif adapté à la morphologie instanciée. Le projet est accompagné de vidéos et d'un code open source disponibles sur eco-moe.github.io.

L'intérêt principal de cette approche réside dans le compromis qu'elle propose entre deux extrêmes bien documentés du co-design robotique : entraîner une politique individuelle pour chaque morphologie (coûteux en calcul, non scalable) ou entraîner un contrôleur universel monolithique pour toutes les morphologies (résultat trop conservateur, comportements sous-optimaux). ECo-MoE préserve la connaissance accumulée au fil des générations dans un cadre unifié mais modulaire, où une partie du contrôleur peut être remaniée pour s'adapter à une nouvelle famille de designs sans perturber les modules experts déjà consolidés. Les auteurs introduisent également le concept d'"evo by demo" : des politiques pré-entraînées peuvent être directement injectées dans le mélange d'experts pour orienter l'évolution vers des régions de l'espace latent contenant des caractéristiques morphologiques souhaitées, ce qui constitue un levier de contrôle éditorial sur l'évolution libre.

Ce travail s'inscrit dans une ligne de recherche active autour de la neuro-évolution et du co-design morphologie/contrôle, dont les jalons récents incluent les travaux sur les politiques universelles (ex : pi0 de Physical Intelligence, GR00T N2 de NVIDIA) et les architectures transformer appliquées à l'évolution robotique. La différence revendiquée par rapport aux approches VLA généralistes est la modularité explicite : là où les grands modèles de politique tendent à absorber toute la diversité morphologique dans un seul réseau dense, ECo-MoE structure cette diversité via le routage conditionné. Il s'agit pour l'instant d'un preprint académique sans déploiement industriel annoncé, et les benchmarks présentés portent sur des robots simulés, ce qui laisse entier le classique gap simulation-réalité.

À lire aussi

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
1arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source
CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts
2arXiv cs.RO 

CoRE-VLA : vers une modélisation vision-langage-action évolutive et robuste par routage conditionnel d'experts

Des chercheurs présentent CoRE-VLA, une nouvelle architecture de modèle vision-langage-action (VLA) conçue pour résoudre un problème concret de déploiement robotique: la gestion de capteurs hétérogènes et potentiellement défaillants. Publié sur arXiv le 3 juillet 2026, le papier propose de traiter la génération d'actions comme un calcul épars conditionné par le contexte, plutôt que par un calcul dense partagé comme dans les VLA classiques. Concrètement, la disponibilité des capteurs active des experts spécialisés par modalité (le papier se concentre sur la profondeur, ou depth, comme capteur auxiliaire représentatif), tandis que l'intention de la tâche route les représentations vers des experts pertinents pour chaque sous-objectif. Les auteurs testent CoRE-VLA sur les benchmarks LIBERO et RoboCasa GR1 Tabletop, ainsi que sur des manipulations réelles à deux bras, et rapportent des performances supérieures à un modèle dense équivalent et à un VLA pré-entraîné de référence, y compris en généralisation zero-shot sur des scénarios non vus à l'entraînement. L'enjeu pratique est réel pour les intégrateurs: la plupart des VLA actuels couplent rigidement la génération d'action à un jeu de capteurs fixe, ce qui les rend fragiles dès qu'un capteur auxiliaire tombe en panne ou qu'un embodiment robotique en est simplement dépourvu par conception. CoRE-VLA promet une dégradation gracieuse sans réentraînement complet, un point clé pour des flottes hétérogènes déployées en usine ou en entrepôt où tous les robots n'ont pas la même instrumentation. C'est un signal de plus que la recherche VLA s'oriente vers la robustesse opérationnelle plutôt que la seule performance en benchmark contrôlé, un décalage régulièrement pointé du doigt entre démonstrations académiques et réalité industrielle. Ce travail s'inscrit dans la lignée des architectures VLA généralistes type Pi-0 ou GR00T N2, mais adresse un angle mort spécifique: l'hétérogénéité capteurs plutôt que la seule diversité des tâches. Il s'agit ici d'une contribution de recherche publiée sur arXiv, sans partenaire industriel ni déploiement annoncé; les prochaines étapes attendues seraient une validation sur davantage d'embodiments réels et une comparaison directe avec les VLA propriétaires déployés en production.

RechercheActu
1 source
MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche
3arXiv cs.RO 

MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche

Des chercheurs ont publié sur arXiv (2603.15265, version 2) l'article décrivant MoE-ACT, un framework de manipulation bimanuelle combinant mixture-of-experts et action chunking transformer. Le système insère des couches MoE éparses dans l'encodeur d'ACT, qui redirigent dynamiquement les tokens image vers des experts sélectionnés selon le contexte de la tâche, les observations visuelles et l'état proprioceptif des bras. Le décodeur d'action ajoute une modulation FiLM conditionnée à la tâche et une attention croisée multi-échelle pour ancrer précisément chaque geste dans l'espace. Sur le benchmark de simulation RoboTwin 2.0, couvrant 16 tâches bimanuelles complexes, MoE-ACT atteint un taux de réussite moyen de 62,0%, soit 17,4 points de plus que la version standard d'ACT. Avec seulement 195 millions de paramètres activés, le modèle dépasse de 5,1 points le modèle fondation Pi-0, qui compte 3,24 milliards de paramètres, seize fois plus. Des expériences complémentaires sur un robot réel à deux bras confirment ces résultats en conditions physiques, même si l'essentiel des chiffres cités provient du benchmark simulé. Code et documentation sont publiés en open source. Le résultat intéresse d'abord les intégrateurs cherchant à déployer des politiques multi-tâches sans la facture de calcul des grands modèles fondation. La manipulation bimanuelle multi-tâche bute régulièrement sur l'interférence entre tâches: une politique unique entraînée sur plusieurs tâches dégrade ses performances par rapport à des politiques spécialisées, phénomène connu comme le négative transfer. En routant dynamiquement le traitement visuel vers des experts spécialisés, MoE-ACT attaque ce problème sans multiplier les paramètres actifs à l'inférence, un argument pour l'embarque sur du matériel contraint en calcul et en énergie. Battre Pi-0, seize fois plus gros, alimente le débat sur la pertinence de la course à l'échelle en robotique généraliste: la spécialisation architecturale via MoE pourrait offrir un meilleur compromis performance/coût que le simple gonflement des foundation models, du moins sur des tâches bimanuelles bien délimitées. MoE-ACT prolonge ACT (Action Chunking Transformer), architecture d'imitation learning devenue référence pour le contrôle de bras robotiques, en y greffant le principe du mixture-of-experts déjà popularisé dans les grands modèles de langage. Il se positionne face aux modèles fondation vision-language-action comme Pi-0 (Physical Intelligence), dans un paysage où GR00T N2 (NVIDIA) ou Helix (Figure AI) visent aussi la manipulation généraliste. Marqué comme une version de remplacement sur arXiv, le travail reste un résultat de recherche validé sur benchmark simulé et un banc bimanuel réel, sans annonce de déploiement industriel ni partenariat commercial à ce stade.

RecherchePaper
1 source
Le fossé de l'incarnation dans les modèles fondation pour robots
4arXiv cs.RO 

Le fossé de l'incarnation dans les modèles fondation pour robots

Une étude publiée sur arXiv sous la référence 2608.18433v1, intitulée « The Embodiment Gap in Robot Foundation Models », dresse un état des lieux critique des modèles de fondation pour la robotique (RFM), dont les politiques vision-langage-action (VLA). Le papier part d'un constat simple : un modèle peut généraliser sur le papier tout en nécessitant un travail d'adaptation important avant de tourner sur un robot physique donné. Les auteurs baptisent cet écart le « embodiment gap », soit le fossé entre des modèles, représentations ou jeux de données réutilisables et leur mise en œuvre effective sur le robot cible. La contribution centrale est une cartographie à deux axes qui classe les méthodes existantes selon le type de structure partagée et le stade d'adaptation requis avant exécution. L'étude passe ensuite en revue trois axes de recherche qui se recoupent : le partage de sémantique et de perception, le partage de données et d'interfaces robotiques, et l'apprentissage de correspondances entre différents types de corps robotiques. Elle propose enfin un cadre de reporting destiné à documenter ce travail d'adaptation, jugé invisible si l'on ne regarde que le taux de réussite final. Pour les intégrateurs et décideurs B2B du secteur, ce travail vient nuancer le récit dominant selon lequel la simple mise à l'échelle (plus de données, plus de paramètres, plus de benchmarks) suffirait à résoudre le transfert d'un modèle d'un robot à un autre. En creux, l'étude interroge la promesse d'un VLA générique qui s'appliquerait tel quel à n'importe quelle plateforme, qu'il s'agisse d'un bras industriel, d'un robot mobile ou d'un humanoïde. Elle rappelle qu'un taux de réussite affiché sur une démonstration ne dit rien du travail d'ingénierie (recalibrage, réentraînement partiel, adaptation d'interface) nécessaire pour porter un modèle d'un embodiment à un autre. Pour une industrie où plusieurs politiques VLA sont présentées comme quasi prêtes à l'emploi, ce cadre offre une grille de lecture plus rigoureuse pour distinguer généralisation en laboratoire et déploiement réel sur une nouvelle chaîne robotique. Ce travail s'inscrit dans la vague de modèles de fondation robotiques apparue dans le sillage des grands modèles de langage, portée par des acteurs comme Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Figure AI avec Helix, qui revendiquent tous une forme de généralisation entre tâches et parfois entre robots. En pointant l'absence de cadre commun pour mesurer ce qui reste réellement à faire lors d'un transfert d'embodiment, les auteurs comblent un vide méthodologique plutôt qu'ils ne proposent un nouveau modèle concurrent. La suite logique consisterait en une adoption de ce cadre de reporting par la communauté pour comparer les futures publications sur une base homogène, ainsi qu'en des études de cas documentant le coût d'adaptation d'un même modèle sur plusieurs corps robotiques distincts, question que les auteurs identifient explicitement comme ouverte pour de futurs travaux.

RecherchePaper
1 source