Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage de la prise et du transport multi-humanoïdes via un contrôle décentralisé centré sur l'objet

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (référence 2609.17824, soumission de septembre 2026) une étude consacrée à la manipulation coopérative multi-humanoïdes : plusieurs robots bipèdes soulèvent et transportent ensemble un même objet dont la taille, le poids et la géométrie varient, avec une taille d'équipe qui s'adapte à la tâche. La méthode, baptisée contrôle décentralisé centré sur l'objet, attribue à chaque humanoïde une zone d'attache locale sur l'objet partagé ; chaque robot apprend à réaliser la prise et le transport par un pincement bimanuel sans pince dédiée (gripperless bimanual pinching), c'est-à-dire en utilisant directement ses deux mains articulées. Cette interface d'attache sert d'abstraction de contrôle commune, valable aussi bien pour la prise par un seul robot que pour le transport à plusieurs ou le passage de main à main (handover) entre robots, sans qu'il faille reconcevoir l'algorithme pour chaque cas de figure. Les auteurs valident l'approche en simulation sur des tailles d'équipe et des géométries d'objets variées, puis démontrent un transfert sim-to-real sur du matériel réel, où les contrôleurs appris permettent à de vrais robots humanoïdes d'exécuter des tâches de manipulation coopérative.

Le résultat le plus significatif pour le secteur est que des politiques entraînées uniquement sur la prise par un robot seul se transfèrent déjà de façon non triviale à des scénarios coopératifs à plusieurs robots, ce qui suggère que l'abstraction par zone d'attache capture une grande partie de la structure nécessaire à la coordination. Un entraînement multi-robot explicite améliore néanmoins encore les performances, preuve que le couplage via l'objet partagé introduit une dynamique de coordination qu'il vaut la peine d'apprendre directement plutôt que de la déduire. Pour les intégrateurs et les décideurs industriels qui envisagent des flottes d'humanoïdes en logistique ou en usine, ce travail attaque un vrai goulot d'étranglement : la manutention d'objets encombrants ou lourds nécessitant plusieurs robots reste peu résolue, et une abstraction unique évitant de reprogrammer chaque configuration d'équipe réduirait fortement le coût d'ingénierie du déploiement.

Ce travail s'inscrit dans la vague plus large des politiques apprises pour la manipulation robotique, où la question du passage du simple robot isolé à la coordination multi-agents reste un axe de recherche actif à mesure que les humanoïdes commerciaux se multiplient. L'abstract ne précise ni les auteurs, ni le laboratoire, ni la plateforme humanoïde utilisée pour les essais matériels, ce qui est courant pour une prépublication arXiv en cours d'évaluation. Il s'agit d'un travail de recherche à ce stade, validé en simulation et sur du matériel réel en conditions contrôlées, sans annonce de produit, de pilote industriel ni de calendrier de déploiement commercial.

À lire aussi

DeReCo : découpler l'apprentissage de la représentation et de la coordination pour le transport coopératif décentralisé multi-robots adaptatif à l'objet
1arXiv cs.RO 

DeReCo : découpler l'apprentissage de la représentation et de la coordination pour le transport coopératif décentralisé multi-robots adaptatif à l'objet

Une revue académique (pas d'annonce produit ni de déploiement commercial), donc j'adapte le cadre en conséquence. Des chercheurs présentent DeReCo (Decoupling Representation and Coordination learning), un nouveau framework d'apprentissage par renforcement multi-agent (MARL) pour le transport coopératif décentralisé d'objets par plusieurs robots. Le problème ciblé : généraliser cette coopération à des objets de formes et de propriétés physiques très variées, sous exécution décentralisée, où chaque robot ne dispose que d'observations partielles. L'approche classique optimise conjointement, de bout en bout, la représentation de l'objet et la politique de coordination en randomisant formes et propriétés durant l'entraînement, une méthode coûteuse en échantillons car les erreurs de représentation, dues à l'observabilité partielle, déstabilisent l'apprentissage de la coordination, tandis que la non-stationnarité propre au MARL dégrade en retour la qualité des représentations. DeReCo découple les deux tâches via un entraînement en trois étapes : apprentissage centralisé de la coordination avec accès à des informations privilégiées sur l'objet, reconstruction des représentations dépendantes de l'objet à partir des observations locales seules, puis retrait progressif de ces informations privilégiées pour aboutir à une exécution totalement décentralisée. En simulation, DeReCo dépasse les méthodes de référence sur trois objets d'entraînement, se généralise à six objets inédits présentant des masses et coefficients de friction différents, et obtient de meilleurs résultats que les baselines sur deux objets inédits testés en conditions réelles avec de vrais robots. Pour l'industrie robotique, ce travail s'attaque à un verrou concret : la manipulation coopérative multi-robots reste aujourd'hui largement cantonnée à des objets connus à l'avance ou à des scénarios d'entraînement peu variés, ce qui limite son déploiement en logistique, en entrepôt ou sur chantier, où les charges à déplacer diffèrent sans cesse en poids, en forme et en friction. En démontrant qu'un découplage architectural, plutôt qu'un entraînement bout en bout monolithique, améliore à la fois l'efficacité d'apprentissage et la généralisation à des objets jamais vus, DeReCo apporte une piste méthodologique réutilisable au-delà du transport d'objets, pour tout système multi-agent décentralisé confronté à des tâches non stationnaires. Le test sur robots réels, même limité à deux objets inédits, est le point le plus significatif : il confirme que les gains obtenus en simulation ne s'évaporent pas au passage au monde réel, un écart (sim-to-real gap) qui reste l'un des principaux points de friction du secteur. Ce papier, disponible sur arXiv sous une version révisée (2603.08111v2), s'inscrit dans un courant de recherche plus large sur l'apprentissage par renforcement multi-agent appliqué à la robotique coopérative, où la difficulté majeure reste de faire coexister observabilité partielle, communication limitée entre agents et diversité des tâches. La stratégie en trois étapes de DeReCo, avec informations privilégiées en phase d'entraînement puis retrait progressif, rappelle les techniques de type teacher-student déjà utilisées en locomotion de robots quadrupèdes et humanoïdes pour combler l'écart entre simulation et déploiement réel. Les auteurs limitent pour l'instant leurs validations réelles à un nombre restreint d'objets et ne précisent pas le nombre de robots impliqués ni le matériel utilisé, ce qui laisse ouverte la question du passage à l'échelle vers des flottes plus larges ou des objets de très grande taille, typiques des usages industriels visés à terme.

RecherchePaper
1 source
Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles
2arXiv cs.RO 

Transport multi-robots de boîtes sur différentes surfaces avec contrôle proportionnel décentralisé basé sur les rôles

Des chercheurs ont publié sur arXiv (référence 2605.26430) R2P2 (Roles with Rules and Proportional-control Primitive), une architecture décentralisée pour le transport collaboratif de caisses rectangulaires par plusieurs robots agissant par poussée, sans préhension. Le système assigne dynamiquement trois rôles distincts à chaque robot - pousser, soutenir ou bloquer - selon le mode de manipulation requis : rotation ou translation de la caisse. R2P2 a été évalué en simulation sur NVIDIA IsaacSim avec une équipe de six robots, testée sur des surfaces planes, en montée et en descente avec des variations de friction et de masse de caisse. La validation physique implique quatre TurtleBots déplaçant une caisse de 1,2 kg. Les auteurs revendiquent un meilleur taux de succès que l'approche de référence par leader-suiveur virtuel, sans préciser de métriques chiffrées au-delà des graphes de comparaison. L'élément différenciant clé est l'architecture décentralisée : chaque robot prend ses décisions localement en observant uniquement sa propre position et celle de la caisse, sans communication inter-robots, consensus ou coordinateur central. Cela élimine le point de défaillance unique et réduit les contraintes de synchronisation critiques pour un déploiement en entrepôt ou en zone sinistrée. La gestion simultanée d'inclinaison et de friction variables représente un défi rarement traité dans la littérature, où la plupart des démonstrateurs fonctionnent sur sol plat homogène. La validation sim-to-real, même à petite échelle, confirme que le contrôle proportionnel basé sur les rôles reste transposable au matériel réel - un résultat non trivial pour une méthode sans apprentissage. Le transport collaboratif par poussée est un problème ouvert en robotique multi-agents depuis les années 1990, qui regagne de l'intérêt avec la montée en puissance des flottes AMR dans la logistique et la construction. Les approches concurrentes incluent les méthodes par leader-suiveur centralisé, les algorithmes de consensus distribué et, plus récemment, le renforcement multi-agent. R2P2 se positionne comme une solution légère, interprétable et sans phase d'entraînement, un avantage pour les intégrateurs qui privilégient la prédictibilité et la facilité de certification. NVIDIA IsaacSim, utilisé ici pour les tests en simulation, est devenu la plateforme de référence pour la validation robotique, notamment adoptée par Figure, Boston Dynamics et 1X. Les auteurs ne mentionnent pas de déploiement industriel ni de partenariats : il s'agit d'une contribution académique, avec comme suites logiques des tests sur des charges plus lourdes, des géométries irrégulières et des équipes plus importantes.

RecherchePaper
1 source
Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes
3arXiv cs.RO 

Apprentissage de a priori de mouvement sensibles au contexte pour le contrôle d'humanoïdes

Publié sur arXiv (référence 2608.03234v1), le framework Context-Aware Motion Priors (CMP) s'attaque à un défaut connu de l'apprentissage par imitation de mouvements chez les humanoïdes : les motion priors classiques, appris une fois sur tout le jeu de données de référence, sont appliqués uniformément durant l'entraînement sans distinguer les mouvements pertinents pour la tâche en cours. CMP apprend une compatibilité contexte-mouvement à partir des trajectoires de politique les plus prometteuses, tout en restant ancré sur les démonstrations de référence. Les scores obtenus repondèrent la supervision pour entraîner un adaptateur léger conditionné par le contexte, sans étiquetage manuel ni étape de découverte de compétences séparée. L'approche est validée avec deux familles de priors, Adversarial Motion Priors et Score-Matching Motion Priors, sur cinq tâches de contrôle humanoïde. L'enjeu dépasse la performance académique. L'imitation de mouvements par renforcement est la méthode dominante pour doter les humanoïdes de comportements fluides, une brique reprise dans la plupart des piles logicielles du secteur, de Figure à Unitree. Son talon d'Achille reste le caractère générique du prior, incapable de distinguer un mouvement utile d'un mouvement parasite selon la tâche, ce qui pèse sur l'efficacité d'échantillonnage, un facteur critique quand chaque itération d'entraînement coûte du temps de calcul en simulation. En démontrant un gain constant de performance sur cinq tâches sans labellisation additionnelle, CMP s'attaque à un goulot d'étranglement identifié de la recherche en contrôle humanoïde, sans pour autant constituer un système déployé sur robot physique ni un produit annoncé par un fabricant. Le travail s'inscrit dans la lignée des Adversarial Motion Priors, popularisées à partir de 2021 pour l'animation de personnages physiques puis largement reprises dans le contrôle humanoïde par renforcement, et des Score-Matching Motion Priors plus récentes, inspirées des modèles de diffusion. CMP se positionne comme une couche d'adaptation contextuelle au-dessus de ces deux familles plutôt que comme une méthode concurrente. La publication ne précise ni affiliation institutionnelle ni calendrier au-delà de l'article arXiv lui-même ; si les résultats se confirment sur des tâches plus complexes, la suite logique serait une intégration dans les pipelines d'entraînement sim-to-real des acteurs humanoïdes qui s'appuient déjà sur des motion priors pour la locomotion et la manipulation.

RecherchePaper
1 source
Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents
4arXiv cs.RO 

Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.09610v1) une approche par apprentissage par renforcement multi-agents (MARL) pour résoudre un problème concret de robotique collaborative : positionner automatiquement un groupe de robots mobiles sous un objet afin de le transporter de façon stable. La méthode décompose la tâche en trois sous-problèmes couplés, contrôle de formation, navigation coopérative et évitement de collisions, et produit des politiques permettant à la flotte de s'aligner sous l'objet, d'équilibrer son poids malgré une distribution de masse non uniforme, et de naviguer dans des environnements encombrés. Les expériences portent sur des configurations variées (nombre de robots variable, géométries d'objets complexes, scènes avec obstacles) sans que les auteurs précisent le nombre exact de robots testés ni les temps de cycle obtenus. Le principal apport industriel de ces travaux est la généralisation à des objets de forme arbitraire et à masse mal distribuée, ce qui représente la réalité de la plupart des charges en logistique ou en services. Les approches classiques supposent des objets symétriques ou des points de contact prédéfinis manuellement ; ici, la politique apprise s'adapte au vol à la géométrie de la charge. Pour un intégrateur ou un COO industriel, cela signifie potentiellement moins de paramétrage manuel par référence produit. Le paper démontre également une robustesse en environnement encombré, ce qui est un prérequis pour un déploiement en entrepôt réel. Il faut toutefois noter que les résultats présentés restent en simulation : aucune validation hardware n'est rapportée, et le fossé sim-to-real reste l'obstacle non résolu habituel de ce type de travaux. Ce preprint s'inscrit dans un courant actif de recherche MARL appliqué aux systèmes multi-robots physiques, en compétition avec des approches centralisées (planification MPC couplée) ou décentralisées par consensus. Côté industrie, des acteurs comme 6 River Systems, Locus Robotics ou les plateformes AMR d'OTTO Motors adressent des problèmes adjacents mais avec des charges standardisées sur des robots dédiés. Aucun partenariat industriel ni timeline de transfert vers le réel n'est mentionné dans cet article ; il s'agit d'une contribution académique ouvrant la voie à des validations expérimentales futures.

RecherchePaper
1 source