Aller au contenu principal
RecherchearXiv cs.RO 

MATE : plateforme de téléopération virtuelle multi-agents pour la collecte de données de collaboration humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente MATE, une plateforme de téléopération virtuelle multi-agents conçue pour collecter des données de collaboration entre robots humanoïdes, décrite dans un article déposé sur arXiv (2609.26520v1). Le système permet à plusieurs opérateurs situés dans des lieux géographiquement distincts de piloter simultanément des humanoïdes corps entier dans un même environnement virtuel basé sur un moteur physique, sans avoir besoin de robots physiques multiples ni de colocaliser les opérateurs, tout en conservant des interactions physiquement couplées entre les robots, les objets et l'environnement. Les auteurs ont constitué avec cet outil un jeu de données de 24,1 heures de comportements coordonnés, réparties en 2 500 épisodes conjoints couvrant cinq tâches à long horizon : transfert d'objets entre robots, livraison en relais, interaction avec l'environnement et transport coopératif. Pour exploiter efficacement ces démonstrations riches en interactions, l'équipe introduit aussi EAIS (Execution-Aligned Interaction Sampling), une stratégie d'échantillonnage qui calcule des signaux dans un préfixe aligné sur l'exécution réelle et priorise les comportements critiques pour la progression de la tâche et pour l'interaction entre agents. Les politiques d'apprentissage par imitation et de type vision-langage-action testées sur ces données ont montré un transfert zero-shot vers un humanoïde physique, sans réglage fin supplémentaire dans le monde réel.

Ce travail s'attaque à un goulot d'étranglement connu de la robotique humanoïde : la quasi-totalité des pipelines de données existants se concentrent sur un seul agent, alors que la collaboration physique entre plusieurs robots reste difficile à faire passer à l'échelle à cause du coût du matériel, des espaces dédiés nécessaires et des remises en configuration répétées entre chaque essai. En déplaçant la collecte dans un environnement simulé partagé, MATE promet de réduire drastiquement ces coûts tout en gardant la donnée exploitable pour l'entraînement de politiques réelles. Le résultat le plus notable pour les intégrateurs et les équipes de recherche appliquée est ce transfert zero-shot vers le monde réel sans fine-tuning : s'il se confirme au-delà des conditions de l'étude, il viendrait étayer l'idée qu'un volume suffisant de données simulées bien échantillonnées peut suffire à combler l'écart simulation-réel pour des tâches de manipulation coopérative, une hypothèse encore débattue dans le secteur.

MATE s'inscrit dans la lignée des plateformes de téléopération virtuelle déjà utilisées pour générer des données d'entraînement à moindre coût, mais se distingue en visant spécifiquement la coordination entre plusieurs humanoïdes plutôt que l'agent unique, un axe encore peu couvert par les pipelines publics existants. L'article ne mentionne ni partenaire industriel ni acteur français ou européen associé au projet, et reste à ce stade une publication de recherche accompagnée d'une page projet (yerik-yu.github.io/MATE) plutôt qu'un produit ou un déploiement commercial. Les prochaines étapes attendues, non détaillées dans le résumé, porteraient vraisemblablement sur l'extension du nombre de tâches couvertes et sur des validations à plus grande échelle sur robots physiques.

À lire aussi

HATS : système de téléopération humain-agent pour la collecte de données multi-bras
1arXiv cs.RO 

HATS : système de téléopération humain-agent pour la collecte de données multi-bras

Des chercheurs ont publié sur arXiv (référence 2606.16491) un système de télé-opération baptisé HATS (Human-Agent Teleoperation System), conçu pour collecter des données d'entraînement dans des configurations à quatre bras robotiques. Le principe repose sur un découplage du contrôle : un seul opérateur humain télé-opère deux bras principaux directement, tandis qu'un agent basé sur un MLLM (modèle de langage multimodal à grande échelle, non spécifié dans le papier) gère deux bras assistants de façon autonome, sans phase d'entraînement préalable. L'opérateur peut en temps réel corriger le comportement des bras assistants et prévenir des collisions via commandes vocales. Selon les auteurs, l'efficacité de collecte et les taux de réussite obtenus avec HATS sont comparables à ceux d'équipes de deux opérateurs experts humains. Le problème que HATS tente de résoudre est structurant pour le secteur : les scénarios de manipulation industrielle complexes nécessitent souvent plus de deux bras, mais les systèmes de télé-opération existants imposent un arbitrage difficile entre charge cognitive (un seul opérateur gérant tout) et coût de coordination (plusieurs opérateurs synchronisés). En déléguant les sous-tâches à un agent MLLM, HATS réduit la charge sur l'humain sans multiplier les intervenants. Les évaluations en aval (downstream policy evaluations) suggèrent que les données collectées produisent des politiques de manipulation efficaces, mais ces résultats restent auto-rapportés et n'ont pas encore été validés de façon indépendante. La robustesse sur des tâches longues ou à haute précision, là où des corrections vocales pourraient s'avérer insuffisantes, n'est pas encore documentée. La collecte de démonstrations téléopérées est aujourd'hui le principal goulot d'étranglement pour entraîner des politiques de manipulation polyvalentes, notamment dans les approches VLA (Vision-Language-Action, architectures combinant perception visuelle, compréhension du langage et génération d'actions). Des systèmes comme ALOHA de Stanford ou les configurations bimanuelless d'Agility Robotics reposent sur des datasets construits par télé-opération humaine à deux bras. HATS étend cette approche à quatre bras en s'appuyant sur les capacités de raisonnement spatial des MLLM récents pour automatiser les bras secondaires. Cette direction est à suivre de près : si elle se généralisait, elle réduirait significativement le coût humain de construction des datasets d'imitation, un verrou majeur pour le passage à l'échelle des robots manipulateurs.

RecherchePaper
1 source
De la cognition au contrôle : apprentissage multi-agents pour le transport collaboratif humain-humanoïde
2arXiv cs.RO 

De la cognition au contrôle : apprentissage multi-agents pour le transport collaboratif humain-humanoïde

Des chercheurs ont présenté C2C (Cognition-to-Control), une architecture de collaboration homme-robot pour le transport d'objets, dans une version mise à jour d'un article publié sur arXiv (2603.03768v2, catégorie "replace"). Plutôt que de standardiser les modules logiciels eux-mêmes (planificateur, modèle du partenaire, politique de coordination, contrôleur), C2C standardise les signaux physiques échangés entre eux : un chemin de charge vérifié géométriquement pour représenter l'intention de tâche, un état physique indépendant de sa source pour décrire le partenaire, des commandes bornées en espace de tâche à 11 dimensions pour la coordination apprise, la faisabilité propre au robot restant du ressort du contrôle corps entier (whole-body control). Le système de référence associe un modèle vision-langage, une vérification géométrique déterministe et de l'apprentissage par renforcement multi-agent (MARL) sensible au partenaire ; sur neuf scénarios de transport, les variantes MARL adaptatives atteignent 77,1 à 82,1 % de succès moyen, contre 56,5 % pour une référence à partenaire scripté. Sur robot physique, un Unitree G1 associé à un humain obtient 100 % de succès en transport dans un espace confiné et 80 % pour la manipulation d'objets très longs, et un système à trois porteurs (deux humanoïdes G1 et un humain) valide la même structure d'interface sur matériel réel. Le problème visé est concret pour les intégrateurs : les piles de collaboration homme-robot pleinement intégrées deviennent fragiles dès qu'on change un seul composant, par exemple en remplaçant un partenaire simulé par un humain, ou une équipe à deux porteurs par une équipe à trois. En montrant que la même interface reste fonctionnelle avec des acteurs neuronaux ou des arbres de décision interprétables, avec deux ou trois porteurs, et avec une substitution simulation-vers-réel, les auteurs suggèrent qu'un système de transport collaboratif homme-humanoïde peut être construit de façon modulaire plutôt que reconstruit à chaque itération. C'est un signal pertinent pour les déploiements d'humanoïdes en logistique et en usine, où la coordination physique fiable avec des opérateurs humains reste un frein avant la montée en échelle commerciale. Ce travail s'inscrit dans la vague de recherche combinant modèles vision-langage-action et apprentissage multi-agent pour la robotique humanoïde, où l'écart entre démonstrations simulées et performance réelle reste un point de friction classique du secteur. Le choix du Unitree G1, robot bipède largement utilisé par les laboratoires académiques pour ce type d'expérimentation en raison de sa disponibilité commerciale, situe l'étude comme une validation de laboratoire plutôt qu'un déploiement industriel : l'article ne mentionne ni institution ni entreprise partenaire, ni calendrier de mise en production, et les scénarios à deux et trois porteurs testés ouvrent la voie à une généralisation vers des équipes homme-robot plus larges comme prochaine étape.

RecherchePaper
1 source
MAAP : perception active multi-agents pour la manipulation collaborative
3arXiv cs.RO 

MAAP : perception active multi-agents pour la manipulation collaborative

Des chercheurs présentent MAAP (Multi-Agent Active Perception), un système de manipulation collaborative ou chaque bras joue un double rôle: exécuter des actions et servir, via sa camera de poignet, de point de vue mobile pour l'équipe. Il est couple a RAIL (Role-Aware Imitation Learning), un contrôleur qui prédit le rôle courant de chaque bras et conditionne ses actions sur celui-ci. Sur quatre taches simulées, le taux de réussite moyen passe de 56,5% avec une camera fixe a 62,5% avec un poignet actif, puis 70,0% avec tous les bras actifs, et atteint 79,2% avec MAAP+RAIL. Sur une tache a trois bras nommée Microwave, RAIL fait grimper la réussite de 47% a 82% avec les mêmes entrées. Sur une plateforme réelle a deux bras, MAAP+RAIL réussit 14 essais de placement sur 20, contre 0 sur 20 pour une base a vue fixe utilisant ACT. Publie en preprint sur arXiv (2609.21929), le papier ne précise ni affiliation des auteurs ni calendrier de déploiement industriel. Cette approche renverse l'hypothèse selon laquelle la perception active exige un agent dédié a l'observation, distinct des bras qui manipulent. En montrant que les cameras de poignet déjà présentes sur des cellules multi-bras standard suffisent a améliorer nettement la réussite des taches, sans capteur ni agent supplémentaire, MAAP donne aux intégrateurs une piste pour exploiter le matériel existant plutôt que de multiplier les cameras fixes. L'écart entre 0% et 70% de réussite obtenu sur la plateforme physique face a la base ACT a vue fixe est le chiffre le plus parlant pour un décideur industriel: il suggere que le goulot d'étranglement de nombreux systèmes de manipulation actuels tient autant a la couverture visuelle de la scene qu'a l'algorithme de contrôle lui-même. MAAP s'inscrit dans la lignée des travaux d'apprentissage par imitation en manipulation, ou ACT (Action Chunking Transformer) sert de référence a vue fixe. Teste sur quatre taches simulées puis sur une plateforme physique a deux bras, l'échantillon de 20 essais reste modeste. Le papier, une contribution académique sans partenariat industriel annonce, ne mentionne aucun calendrier de commercialisation; les suites attendues concernent l'extension a davantage de bras et de taches plus complexes.

RecherchePaper
1 source
Apprentissage de politiques ancrées en simulation pour la manipulation bimanuelle de corde à partir de données de téléopération humaine
4arXiv cs.RO 

Apprentissage de politiques ancrées en simulation pour la manipulation bimanuelle de corde à partir de données de téléopération humaine

Une équipe de recherche publie sur arXiv (ref. 2605.16043) une étude comparative sur la manipulation bimanuelle de cordes par robot, en se concentrant sur la tâche de démêlage de nœuds. Les chercheurs ont entraîné deux politiques de contrôle basées sur le framework ACT (Action Chunking with Transformers) à partir des mêmes données de télé-opération humaine : la première reçoit en entrée deux flux vidéo RGB provenant de caméras montées sur les poignets du robot, la seconde utilise un état 3D particulaire de la corde, extrait par fusion multi-vues puis propagé dans un simulateur xPBD (eXtended Position-Based Dynamics). Évaluée en boucle ouverte sur une configuration de corde inédite, la politique à base d'état réduit l'erreur L1 de 30,8 % sur l'action initiale de saisie et de traction, par rapport à son homologue visuelle. Ce résultat isole une cause souvent sous-estimée des échecs de généralisation en apprentissage par imitation : non pas l'architecture du réseau ni le volume de données, mais l'espace d'observation lui-même. Les objets linéaires déformables (DLO) comme les câbles et les cordes posent un problème d'auto-occultation fréquente sous caméra ego-centrique, rendant la perception purement visuelle peu robuste sur des configurations non vues à l'entraînement. En ancrant la représentation dans un état physique cohérent simulé par xPBD, les chercheurs comblent partiellement ce "gap d'observabilité" entre pixels bruts et état mécanique réel, ouvrant la voie à un apprentissage plus efficace en données depuis un faible nombre de démonstrations humaines. La manipulation de DLOs est un problème ouvert de longue date en robotique, car leur espace de configuration est théoriquement infini-dimensionnel. L'approche par télé-opération bimanuelle est bien établie depuis les travaux sur ACT (Stanford/Berkeley, 2023), mais sa dépendance à de grands volumes de données limite la scalabilité industrielle. Cette étude s'inscrit dans un courant qui cherche à compenser le manque de données par une meilleure structure de représentation, comparable aux travaux sur les VLA (Vision-Language-Action models) mais ici centré sur la physique plutôt que le langage. Les prochaines étapes naturelles incluent la validation en boucle fermée et l'évaluation sur des câbles industriels, contexte où des acteurs comme Cobot Systems ou des labos européens spécialisés câblage automobile pourraient trouver un intérêt direct.

UEImpact indirect : les équipementiers et laboratoires européens spécialisés dans le câblage automobile pourraient exploiter cette approche pour réduire le volume de données de téléopération requis, un goulot d'étranglement réel dans ce secteur.

RecherchePaper
1 source