Aller au contenu principal
RecherchearXiv cs.RO 

MASkillBlender : coordination décentralisée du corps entier pour la loco-manipulation multi-humanoïdes par fusion de compétences

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.01102) MASkillBlender, un cadre d'apprentissage par renforcement multi-agent (MARL) destiné à la coordination décentralisée de plusieurs humanoïdes pour des tâches de locomanipulation, c'est-à-dire des tâches où les robots marchent et manipulent des objets en même temps. Le principe tient en deux étages. Des compétences de corps entier, pré-entraînées pour un humanoïde seul, servent de briques réutilisables. Une politique de haut niveau, partagée et décentralisée, apprend ensuite à les combiner à partir de récompenses au niveau de la tâche uniquement. Elle n'a besoin ni de trajectoires de référence propres à chaque tâche, ni de l'ingénierie de récompense lourde que demandent d'ordinaire les approches existantes. Les auteurs ajoutent une augmentation de données par permutation pour les systèmes homogènes. Elle exploite l'interchangeabilité des robots identiques. Ils démontrent aussi que les échantillons permutés conservent la direction du gradient de politique de l'échantillon d'origine dans le formalisme du jeu de Markov homogène. L'évaluation couvre plusieurs tâches de coordination et deux morphologies d'humanoïdes, uniquement en simulation.

L'intérêt tient au verrou que visent les auteurs. Le contrôle corps entier d'un seul humanoïde progresse, mais le passage à plusieurs robots fait exploser la dimension de l'espace d'action, impose une prise de décision décentralisée et complique le passage à l'échelle. Réutiliser des compétences individuelles comme primitives, plutôt que d'apprendre chaque tâche coopérative de zéro, est une piste crédible pour déplacer des charges encombrantes à deux ou plus, ce qui concerne la logistique et la manutention. Les résultats sont pourtant limités. Ils portent sur la simulation, sans transfert sim-to-real, sans matériel réel et sans chiffres publiés dans le résumé (taux de réussite, nombre de robots, temps d'entraînement). La mention de performances « fortes » reste donc à vérifier dans l'article complet. Rien ne prouve non plus que les compétences mélangées tiendront face aux contacts, aux délais de communication et aux écarts de dynamique du monde réel. Ce travail relève de la recherche académique, pas d'un produit ni d'un déploiement.

Le contexte est celui d'un champ qui s'est d'abord concentré sur la locomotion et la manipulation d'un humanoïde isolé, avec des politiques apprises en simulation puis transférées. La coordination multi-robots reposait souvent sur des conceptions spécifiques à chaque tâche ou sur des références de mouvement coûteuses à produire. MASkillBlender se rattache à cette lignée de travaux sur le mélange de compétences, qu'il étend au cadre multi-agent. Les acteurs industriels qui visent des flottes d'humanoïdes en entrepôt ou en usine misent surtout sur des modèles généralistes de type VLA et sur des déploiements monorobot. La coordination décentralisée de plusieurs humanoïdes reste, elle, peu abordée publiquement. Les prochaines étapes à surveiller sont la validation sur robots physiques, le passage à davantage d'agents et une comparaison chiffrée avec les méthodes centralisées.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes
1arXiv cs.RO 

ViLoMan : apprentissage de compétences de loco-manipulation du corps entier par vision et proprioception pour robots humanoïdes

Le laboratoire à l'origine du projet ViLoMan, publié en preprint sur arXiv (arXiv:2609.19340, soumission anonyme en relecture en double aveugle, page projet viloman-anonymous.pages.dev), présente un système d'apprentissage pour la loco-manipulation autonome des robots humanoïdes. La méthode transforme des démonstrations humaines partielles, capturées de façon cinématique lors d'interactions homme-objet, en trajectoires robotiques complètes et physiquement exécutables. Ces trajectoires alimentent ensuite un entraînement par distillation enseignant-élève, qui produit une politique unique convertissant des observations de profondeur en vision égocentrique et des mesures proprioceptives directement en commandes articulaires pour l'ensemble du corps. Une fois déployée, cette politique ne nécessite ni mouvement de référence ni commande intermédiaire. Les auteurs l'ont testée sur des tâches de fermeture de porte, avec des configurations de porte et des positions de départ variées, en simulation puis sur un robot réel Unitree G1, montrant qu'une seule politique suffit à accomplir la tâche uniquement à partir des capteurs embarqués. Ce travail s'attaque à deux obstacles centraux du secteur : la rareté de données d'interaction robot-objet physiquement réalisables, et la difficulté d'apprendre un contrôle unifié du corps entier à partir des seules observations embarquées, sans capture de mouvement externe ni téléopération lourde. En démontrant un transfert simulation-réel fonctionnel avec un capteur de profondeur et la proprioception seuls, l'étude apporte un contre-exemple concret à l'hypothèse selon laquelle les politiques de loco-manipulation humanoïde exigent nécessairement de vastes jeux de données téléopérées coûteux à constituer. Pour les intégrateurs et décideurs robotique, l'intérêt réside surtout dans la méthode de conversion des démonstrations humaines en données d'entraînement robot exploitables, une piste alternative aux pipelines de collecte par téléopération utilisés par des acteurs comme Figure ou Physical Intelligence. ViLoMan s'inscrit dans la compétition croissante autour des politiques vision-langage-action et des architectures de contrôle whole-body pour humanoïdes, aux côtés d'approches commerciales comme Helix de Figure, GR00T N2 de Nvidia ou Pi-0 de Physical Intelligence, qui reposent largement sur des données de téléopération à grande échelle. Ici, l'origine académique et le statut anonyme de la soumission signalent une contribution de recherche encore au stade du laboratoire, validée sur une seule tâche restreinte de fermeture de porte plutôt que déployée en conditions industrielles. Les prochaines étapes attendues concernent l'extension à d'autres tâches de manipulation et à des environnements plus variés avant toute perspective de déploiement réel.

RecherchePaper
1 source
ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier
2arXiv cs.RO 

ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier

Une équipe de recherche présente ULTRA, un framework unifié pour le contrôle autonome de la loco-manipulation du corps entier chez les humanoïdes, publié en version révisée sur arXiv (2603.03279v2). Le système combine un algorithme de retargeting neuronal guidé par la physique, qui transpose des captures de mouvement à grande échelle vers la morphologie du robot en préservant la plausibilité physique des contacts, et un contrôleur multimodal unique traitant références denses et consignes de tâches éparses, à partir d'un état précis ou d'une vision égocentrique bruitée. La méthode distille une politique de suivi universelle, compresse les compétences motrices dans un espace latent compact, puis l'affine par apprentissage par renforcement pour améliorer la robustesse hors distribution. ULTRA a été validé en simulation et sur un robot humanoïde réel Unitree G1. L'apport central est de faire passer le contrôle humanoïde du suivi de trajectoires prédéfinies à une génération de comportement pilotée par la perception et des objectifs de haut niveau, sans référence de mouvement au moment du test, un verrou connu du secteur qui tient à la rareté des données de retargeting et à la couverture limitée des répertoires de compétences. En obtenant un comportement coordonné du corps entier à partir d'une intention éparse et d'une perception embarquée seule, sur matériel réel et pas seulement en simulation, les auteurs apportent un élément factuel au débat sur l'écart entre démonstrations scriptées et autonomie réelle, avec des résultats supérieurs aux méthodes de suivi pur à répertoire limité, un signal utile pour intégrateurs et laboratoires. Ce travail s'inscrit dans la lignée des contrôleurs de suivi par imitation pour humanoïdes, dont les limites sont pointées par les auteurs: données retargetées rares, difficulté à passer à l'échelle, dépendance à des références figées. ULTRA cherche à lever ce verrou en unifiant imitation à grande échelle et apprentissage par renforcement dans un seul contrôleur, validé sur Unitree G1, plateforme de recherche courante dans les laboratoires travaillant sur la loco-manipulation humanoïde. L'article ne précise ni affiliation institutionnelle ni calendrier de déploiement industriel: il s'agit d'une contribution de recherche, à comparer aux prochaines générations de contrôleurs généralistes pour humanoïdes plutôt qu'à un produit commercial.

RecherchePaper
1 source
EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain
3arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source
Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde
4arXiv cs.RO 

Uni-VLaT : adaptation tactile du corps entier des politiques VLA pour la loco-manipulation humanoïde

Des chercheurs publient Uni-VLaT, une méthode qui greffe un sens du toucher distribué sur tout le corps à des politiques VLA (vision-langage-action) préentraînées pour piloter un humanoïde en loco-manipulation. Le principe est d'ajouter une voie tactile dont l'état latent n'est pas seulement entraîné à produire des actions, mais aussi à prédire les représentations tactiles, proprioceptives et visuelles futures. Ce second objectif construit un contexte multimodal ancré dans le tactile. Les auteurs testent le système sur cinq tâches réelles : locomotion déclenchée par le toucher, interaction physique prolongée, contact avec un humain et loco-manipulation. Le taux de réussite moyen atteint 75 %, soit 43 points de plus qu'une base sans entrée tactile et 7 points de plus qu'une base tactile sans supervision prédictive. Sur deux architectures VLA préentraînées, le balayage de table gagne 30 points sur chacune, et la tâche « Back-Tap Walking » (marcher en réponse à une tape dans le dos) progresse de 85 à 90 points. Les ablations indiquent que la prédiction tactile contextualisée et les cibles futures absolues sont déterminantes. L'enjeu est de combler un angle mort des VLA actuels, qui reposent sur la vision et la proprioception. Quand la zone de contact est masquée, par exemple un bras qui frotte une surface ou une main humaine posée sur le dos, ces deux signaux ne suffisent pas à caractériser l'interaction. Contrairement aux capteurs de force ou de couple placés en quelques points prédéfinis, une peau tactile distribuée conserve la cartographie spatiale du contact sur tout le corps. Le résultat le plus parlant pour un intégrateur est la distinction entre simple ajout d'un capteur et apprentissage prédictif : la modalité brute apporte 36 points sur les 43 gagnés, mais la supervision prédictive rend la fusion plus robuste. Cela suggère que les politiques généralistes peuvent être étendues à de nouvelles modalités sans repartir de zéro, un point utile pour la cobotique humanoïde en contact avec des opérateurs. Les limites sont nettes : cinq tâches seulement, un robot de laboratoire, aucun chiffre sur les temps de cycle, la robustesse à long terme ou la durabilité des capteurs. Ce n'est ni un produit ni un déploiement. Ce travail s'inscrit dans la montée en puissance des modèles VLA pour humanoïdes, dont Pi-0, GR00T ou Helix, pour l'essentiel centrés sur la vision, le langage et la proprioception. Le tactile reste le parent pauvre de ces architectures, freiné par le coût, la fragilité et le câblage des peaux électroniques. La question d'une sensibilité corps entier concerne aussi des acteurs européens comme Wandercraft ou Enchanted Tools, dont les robots opèrent près des humains, même si l'article ne cite aucun partenaire industriel. Les prochaines étapes probables sont une validation sur davantage de plateformes et de capteurs, puis une comparaison avec des approches de contrôle en force, avant tout transfert industriel.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source