
MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche
Des chercheurs ont publié sur arXiv (2603.15265, version 2) l'article décrivant MoE-ACT, un framework de manipulation bimanuelle combinant mixture-of-experts et action chunking transformer. Le système insère des couches MoE éparses dans l'encodeur d'ACT, qui redirigent dynamiquement les tokens image vers des experts sélectionnés selon le contexte de la tâche, les observations visuelles et l'état proprioceptif des bras. Le décodeur d'action ajoute une modulation FiLM conditionnée à la tâche et une attention croisée multi-échelle pour ancrer précisément chaque geste dans l'espace. Sur le benchmark de simulation RoboTwin 2.0, couvrant 16 tâches bimanuelles complexes, MoE-ACT atteint un taux de réussite moyen de 62,0%, soit 17,4 points de plus que la version standard d'ACT. Avec seulement 195 millions de paramètres activés, le modèle dépasse de 5,1 points le modèle fondation Pi-0, qui compte 3,24 milliards de paramètres, seize fois plus. Des expériences complémentaires sur un robot réel à deux bras confirment ces résultats en conditions physiques, même si l'essentiel des chiffres cités provient du benchmark simulé. Code et documentation sont publiés en open source.
Le résultat intéresse d'abord les intégrateurs cherchant à déployer des politiques multi-tâches sans la facture de calcul des grands modèles fondation. La manipulation bimanuelle multi-tâche bute régulièrement sur l'interférence entre tâches: une politique unique entraînée sur plusieurs tâches dégrade ses performances par rapport à des politiques spécialisées, phénomène connu comme le négative transfer. En routant dynamiquement le traitement visuel vers des experts spécialisés, MoE-ACT attaque ce problème sans multiplier les paramètres actifs à l'inférence, un argument pour l'embarque sur du matériel contraint en calcul et en énergie. Battre Pi-0, seize fois plus gros, alimente le débat sur la pertinence de la course à l'échelle en robotique généraliste: la spécialisation architecturale via MoE pourrait offrir un meilleur compromis performance/coût que le simple gonflement des foundation models, du moins sur des tâches bimanuelles bien délimitées.
MoE-ACT prolonge ACT (Action Chunking Transformer), architecture d'imitation learning devenue référence pour le contrôle de bras robotiques, en y greffant le principe du mixture-of-experts déjà popularisé dans les grands modèles de langage. Il se positionne face aux modèles fondation vision-language-action comme Pi-0 (Physical Intelligence), dans un paysage où GR00T N2 (NVIDIA) ou Helix (Figure AI) visent aussi la manipulation généraliste. Marqué comme une version de remplacement sur arXiv, le travail reste un résultat de recherche validé sur benchmark simulé et un banc bimanuel réel, sans annonce de déploiement industriel ni partenariat commercial à ce stade.
Dans nos dossiers




