Aller au contenu principal
MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche
RecherchearXiv cs.RO 

MoE-ACT : passage à l'échelle de la manipulation bimanuelle multitâche avec des transformeurs à mélange d'experts conditionnés par tâche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (2603.15265, version 2) l'article décrivant MoE-ACT, un framework de manipulation bimanuelle combinant mixture-of-experts et action chunking transformer. Le système insère des couches MoE éparses dans l'encodeur d'ACT, qui redirigent dynamiquement les tokens image vers des experts sélectionnés selon le contexte de la tâche, les observations visuelles et l'état proprioceptif des bras. Le décodeur d'action ajoute une modulation FiLM conditionnée à la tâche et une attention croisée multi-échelle pour ancrer précisément chaque geste dans l'espace. Sur le benchmark de simulation RoboTwin 2.0, couvrant 16 tâches bimanuelles complexes, MoE-ACT atteint un taux de réussite moyen de 62,0%, soit 17,4 points de plus que la version standard d'ACT. Avec seulement 195 millions de paramètres activés, le modèle dépasse de 5,1 points le modèle fondation Pi-0, qui compte 3,24 milliards de paramètres, seize fois plus. Des expériences complémentaires sur un robot réel à deux bras confirment ces résultats en conditions physiques, même si l'essentiel des chiffres cités provient du benchmark simulé. Code et documentation sont publiés en open source.

Le résultat intéresse d'abord les intégrateurs cherchant à déployer des politiques multi-tâches sans la facture de calcul des grands modèles fondation. La manipulation bimanuelle multi-tâche bute régulièrement sur l'interférence entre tâches: une politique unique entraînée sur plusieurs tâches dégrade ses performances par rapport à des politiques spécialisées, phénomène connu comme le négative transfer. En routant dynamiquement le traitement visuel vers des experts spécialisés, MoE-ACT attaque ce problème sans multiplier les paramètres actifs à l'inférence, un argument pour l'embarque sur du matériel contraint en calcul et en énergie. Battre Pi-0, seize fois plus gros, alimente le débat sur la pertinence de la course à l'échelle en robotique généraliste: la spécialisation architecturale via MoE pourrait offrir un meilleur compromis performance/coût que le simple gonflement des foundation models, du moins sur des tâches bimanuelles bien délimitées.

MoE-ACT prolonge ACT (Action Chunking Transformer), architecture d'imitation learning devenue référence pour le contrôle de bras robotiques, en y greffant le principe du mixture-of-experts déjà popularisé dans les grands modèles de langage. Il se positionne face aux modèles fondation vision-language-action comme Pi-0 (Physical Intelligence), dans un paysage où GR00T N2 (NVIDIA) ou Helix (Figure AI) visent aussi la manipulation généraliste. Marqué comme une version de remplacement sur arXiv, le travail reste un résultat de recherche validé sur benchmark simulé et un banc bimanuel réel, sans annonce de déploiement industriel ni partenariat commercial à ce stade.

À lire aussi

Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée
1arXiv cs.RO 

Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée

Des chercheurs ont publié le 18 août 2026 sur arXiv (référence 2608.15863v1) une étude intitulée "Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning", présentant MAGE, un pipeline de synthèse de données conçu pour entraîner des robots à manipuler des appareils électroménagers en suivant leurs manuels d'utilisation. MAGE s'appuie sur une architecture inédite baptisée Hierarchical Appliance Graph (HAG), qui génère automatiquement des annotations de pièces, des plans d'action à long horizon et des données de correction en boucle fermée directement à partir des manuels d'appareils. Les auteurs en ont tiré UseAppliance, présenté comme le premier jeu de données à grande échelle pour la planification de manipulation d'électroménager ancrée dans la documentation constructeur : 22 catégories d'appareils, plus de 89 000 annotations de pièces, plus de 53 000 tâches de manipulation et plus de 33 000 étapes d'ajustement en boucle fermée. Sur cette base, l'équipe a développé AppliancePlan, un modèle de bout en bout de seulement 7 milliards de paramètres, testé sur le benchmark RealAppliance-Bench où il dépasserait de plus de dix fois la meilleure référence existante en planification en boucle ouverte, avec des expériences robotiques réelles menées sur six appareils domestiques. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : l'absence de jeux de données suffisamment diversifiés et orientés tâche pour entraîner des modèles capables de planification robuste face aux imprévus, un problème qui freine le déploiement de robots polyvalents dans des environnements domestiques réels. La confirmation d'un transfert sim-to-real effectif, même à petite échelle (six appareils), constitue un signal utile pour les intégrateurs qui cherchent à évaluer si les architectures type VLA passent réellement du laboratoire au terrain, plutôt qu'un pur exercice de simulation. Ce projet s'inscrit dans une dynamique de recherche plus large sur la planification à long horizon pour la robotique domestique généraliste, où le manque de données annotées reste un frein structurel identifié par plusieurs laboratoires académiques. Les auteurs présentent leurs résultats comme une étape vers une robotique domestique généraliste, sans toutefois annoncer de calendrier de commercialisation ni de partenariat industriel à ce stade.

RecherchePaper
1 source
Apprentissage cross-modal visuo-tactile avec transformeurs à découpage d'actions pour la manipulation à contacts riches
2arXiv cs.RO 

Apprentissage cross-modal visuo-tactile avec transformeurs à découpage d'actions pour la manipulation à contacts riches

Une équipe de recherche présente une méthode d'apprentissage par contraste visuo-tactile destinée aux robots manipulateurs confrontés à des tâches nécessitant un contact physique fin. Décrite dans un article publié sur arXiv (arXiv:2602.00514v3, version corrigée), l'approche aligne les images RGB externes et les images tactiles calibrées dans un espace de représentation partagé, via un objectif de type CLIP, puis intègre cette représentation dans une politique d'imitation basée sur un Action Chunking Transformer (ACT). Pour collecter les données, les chercheurs ont conçu un préhenseur visuo-tactile low-cost baptisé LVTG, pensé comme une plateforme modulaire et durable reproductible par d'autres laboratoires. Sur des tâches de manipulation à fort contact, le taux moyen de réussite passe de 30% pour une politique ACT vision seule à 42% avec l'ajout brut de signaux tactiles, puis à 54% grâce au pré-entraînement contrastif proposé. Ce résultat cible un point de friction concret pour l'industrie robotique: les capteurs tactiles produisent des signaux image-like, dépendants du matériel et faiblement corrélés aux flux visuels externes, ce qui rend leur exploitation directe peu efficace dans les politiques d'apprentissage par imitation. En démontrant qu'un alignement explicite entre modalités visuelle et tactile surpasse un simple ajout brut du signal tactile, l'étude apporte un argument empirique en faveur du pré-entraînement contrastif comme brique standard pour les politiques de manipulation fine, un enjeu direct pour les intégrateurs travaillant sur l'assemblage, l'insertion ou la préhension d'objets déformables. Le gain de 12 points entre ajout naïf et approche alignée reste toutefois mesuré sur un jeu de tâches limité, propre à un article de recherche, et ne présage pas encore d'un déploiement industriel. Le travail s'inscrit dans une lignée de recherches cherchant à combler l'écart entre la richesse des retours tactiles et leur faible exploitation réelle dans les politiques de contrôle robotique, un problème identifié depuis plusieurs années en robotique manipulative et exacerbé par l'hétérogénéité du matériel tactile disponible. Le choix d'un capteur low-cost et modulaire (LVTG) vise explicitement la reproductibilité, un critère souvent absent des travaux utilisant des capteurs tactiles propriétaires coûteux. L'article ne mentionne pas de partenariat industriel ni de calendrier de transfert vers un produit commercial: il s'agit à ce stade d'une contribution méthodologique et matérielle destinée à la communauté de recherche en apprentissage par imitation, sans acteur français ou européen identifié dans cette publication.

RecherchePaper
1 source
Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage
3arXiv cs.RO 

Génération de données multi-tâches par apprentissage par renforcement pour la manipulation bimanuelle guidée par le langage

Des chercheurs ont publié sur arXiv (référence 2606.22471) une approche systématique pour générer automatiquement, via apprentissage par renforcement (RL), des données d'entraînement synthétiques destinées à la manipulation bimane et dextre conditionnée par le langage. Le pipeline proposé combine trois briques : une conception de récompenses généralisables (non spécifiques à une tâche), une randomisation de domaine pour combler l'écart simulation-réel (sim-to-real gap), et des annotations de tâches exprimées en langage naturel. Les expériences portent sur trois tâches de manipulation représentatives ; les auteurs concluent à une amélioration significative de la généralisation par rapport aux baselines, sans toutefois publier de métriques quantitatives précises dans le résumé disponible. Le principal verrou qu'adresse ce travail est le manque de données massives et de qualité pour entraîner des politiques généralistes sur des manipulateurs bimanes à haute dextérité. La télé-opération humaine, standard actuel pour collecter des démonstrations (méthode utilisée par des projets comme ACT, Diffusion Policy, ou les datasets de Aloha), souffre de limitations structurelles : faible diversité de tâches, inadéquation morphologique entre la main humaine et l'effecteur robot, et absence des actions robot dans les vidéos brutes. Le RL surmonte ces obstacles mais exige traditionnellement des fonctions de récompense artisanales, tâche par tâche. En proposant une conception de récompenses généralisables, les auteurs visent à rendre le pipeline scalable sans surcoût d'ingénierie par tâche, ce qui est le vrai défi industriel pour quiconque cherche à déployer des politiques multi-tâches sur des lignes d'assemblage ou de conditionnement. Ce travail s'inscrit dans une tendance de fond : face à la rareté des données robotiques réelles, la synthèse en simulation devient une voie centrale, portée par des frameworks comme Isaac Lab (NVIDIA), MuJoCo Playground, ou Genesis. Il dialogue directement avec des approches comme RoboGen, RoboCasa ou GROOT, qui cherchent également à automatiser la génération de tâches et de données. Les politiques VLA (Vision-Language-Action) telles que pi0 de Physical Intelligence ou OpenVLA nécessitent des corpus variés que la télé-opération seule ne peut pas alimenter à l'échelle requise. Les prochaines étapes naturelles seront la validation sur hardware réel et la comparaison quantitative avec des datasets de référence comme RoboSet ou Open X-Embodiment.

RecherchePaper
1 source
N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches
4arXiv cs.RO 

N₀-TWAM : passage à l'échelle d'un modèle monde-action tactile natif pour la manipulation à contacts riches

Des chercheurs présentent N0-TWAM, un modèle monde-action "tactile natif" conçu pour la manipulation robotique dans des tâches à contact riche, capable de prédire à la fois l'image future et le contact physique futur. Selon les auteurs, il s'agirait du premier modèle monde-action tactile entraîné à grande échelle, une affirmation à prendre avec la prudence habituelle pour ce type de papier arXiv (2607.23783, non encore relu par les pairs). Le pré-entraînement combine vision et tactile sur des démonstrations couvrant six morphologies de robots différentes et 450 tâches. Le système s'appuie sur NeoForce, une représentation tactile unifiée basée sur la force, censée fournir un signal de contact physiquement ancré pour guider la génération d'actions. Pour gérer les tâches longues et multi-étapes, les auteurs introduisent des "événements de contact tactile" qui marquent la progression d'une étape à l'autre. Côté architecture, un Mixture-of-Transformers asymétrique associe un expert large pour la prédiction vidéo à des experts plus légers pour l'action et le tactile, dans un souci d'efficacité temps réel. Le modèle a été évalué sur des benchmarks réels et simulés, et le code ainsi que les poids seront publiés en open source. L'enjeu dépasse la simple prouesse technique. Les modèles vision-langage-action actuels, de π0 à GR00T N2 en passant par Helix, reposent presque exclusivement sur la vision, ce qui explique une bonne partie de leurs échecs sur les tâches fines de contact : insertion de pièces, préhension d'objets déformables, assemblage. Un modèle qui démontre un gain mesurable grâce au passage à l'échelle des données tactiles apporterait un signal utile pour les intégrateurs industriels confrontés à ce fossé entre démonstration en vidéo et fiabilité en production. Le manque de jeux de données tactiles standardisés à grande échelle est resté un frein connu du secteur, contrairement à la vision où les corpus type RT-X abondent. En couvrant six embodiments, N0-TWAM s'inscrit dans cette logique de généralisation multi-robots. La publication annoncée du code et des checkpoints permettra à la communauté de vérifier ces résultats et d'évaluer si l'approche tient face à des déploiements réels sur des tâches d'assemblage ou de manipulation fine.

RecherchePaper
1 source