Aller au contenu principal
RecherchearXiv cs.RO 

HARL-A : un cadre de référence extensible pour l'apprentissage par renforcement adverse multi-agents hétérogènes dans IsaacLab

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire DIRECTLab ont publié HARL-A, un framework open source maintenu activement et construit sur IsaacLab, le simulateur robotique de NVIDIA. Il sert à entraîner et à évaluer des politiques adversariales multi-agents (MARL) sur des équipes de robots aux morphologies variées. Le nombre d'équipes est libre, tout comme le mélange de morphologies dans chaque équipe. HARL-A étend la bibliothèque d'algorithmes HARL et IsaacLab avec un support adversarial. Il apporte trois composants : une architecture logicielle modulaire qui réduit le travail d'ingénierie pour définir de nouveaux environnements hétérogènes, trois environnements de référence (Sumo, Soccer et 3D Galaga) et plus de dix politiques pré-entraînées, publiées sur Hugging Face. Sumo porte sur la poussée avec beaucoup de contacts, Soccer sur la maîtrise du ballon en compétition, et 3D Galaga sur la poursuite et l'évasion. Le code, les environnements et la documentation sont disponibles sur GitHub, dans le dépôt DIRECTLab/IsaacLab-HARL. Les auteurs indiquent que le framework produit de façon fiable des politiques adversariales et une spécialisation émergente des rôles. Ces résultats sont démontrés en simulation seulement, et l'abstract ne donne aucun chiffre de performance.

Pour la recherche, l'intérêt est surtout d'infrastructure. Les travaux sur le MARL adversarial en robotique sont freinés par des outils éparpillés. Les frameworks existants se concentrent sur la coopération, s'appuient sur des moteurs physiques simplifiés ou restent des implémentations isolées, difficiles à étendre. Un socle commun avec une physique de haute fidélité et des politiques déjà entraînées permet de comparer des méthodes sans repartir de zéro. Le support de morphologies mixtes compte aussi, car les flottes réelles combinent déjà quadrupèdes, humanoïdes et bras. Pour un industriel ou un intégrateur, ce n'est pas un produit déployable. Les tâches de sumo, de foot et de jeu d'arcade en 3D sont des bancs d'essai académiques, et rien n'est dit sur le transfert sim-to-real ni sur des robots physiques. Ces résultats ne disent donc rien du fossé entre démonstration et réalité.

Ce travail s'inscrit dans l'écosystème IsaacLab, devenu le standard de fait pour l'apprentissage par renforcement massivement parallèle sur GPU. Il prolonge HARL, bibliothèque d'algorithmes MARL hétérogènes, que HARL-A rend utilisable en contexte compétitif. La version 2 de l'article, signalée comme remplacement croisé sur arXiv, montre un projet encore en évolution. Les comparaisons les plus naturelles sont les plateformes MARL généralistes, mais leur physique est plus simple, et les suites d'apprentissage de NVIDIA, centrées sur un seul robot. Aucun acteur européen n'est cité. Les prochaines étapes probables sont l'ajout d'environnements, l'évaluation de la robustesse des politiques face à des adversaires inédits et, à terme, un test sur du matériel réel. Aucun calendrier n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

HARBOR : un cadre d'apprentissage par renforcement pour robots à base d'agents
1arXiv cs.RO 

HARBOR : un cadre d'apprentissage par renforcement pour robots à base d'agents

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.08610) HARBOR, un framework agentique conçu pour automatiser les pipelines d'apprentissage par renforcement (RL) appliqués à la robotique. Partant d'une spécification de tâche et d'une base de code simulateur, le système prend en charge l'ensemble du workflow : configuration de l'environnement, conception des fonctions de récompense, entraînement de la politique et tuning des hyperparamètres. HARBOR décompose ces objectifs de haut niveau en étapes bornées confiées à des agents spécialisés, coordonnés via des commandes standardisées, des artefacts persistants et des portes d'exécution vérifiables. Il scale l'itération par essais parallèles décentralisés et capitalise sur l'expérience accumulée entre les runs. Le framework a été évalué sur 6 benchmarks couvrant 16 tâches de manipulation, locomotion et contrôle bimanuel dextère. Les politiques entraînées en simulation ont ensuite été transférées sur de vrais robots. L'intérêt principal de HARBOR tient à ce qu'il attaque directement le principal frein à l'adoption du RL en robotique industrielle : la charge d'ingénierie experte requise pour chaque nouvelle tâche. Reward shaping, sélection d'algorithmes, tuning fin des hyperparamètres représentent aujourd'hui des semaines de travail spécialisé avant d'obtenir une politique viable. En automatisant ce cycle de bout en bout à un coût pratique en tokens et en temps de calcul, HARBOR abaisse concrètement la barrière d'entrée pour les intégrateurs et les équipes R&D industrielles. Le fait que les politiques se transfèrent au robot réel adresse le "sim-to-real gap", un verrou persistant du secteur. Les résultats publiés indiquent que le framework égale ou surpasse les configurations par défaut sur les benchmarks testés, bien que les conditions exactes d'évaluation méritent d'être examinées dans le papier complet avant d'en tirer des conclusions généralisées. HARBOR s'inscrit dans une tendance émergente qui consiste à utiliser des LLMs comme orchestrateurs de pipelines ML complexes, dans la lignée de travaux comme Eureka (NVIDIA, 2023), qui utilisait GPT-4 pour générer automatiquement des reward functions via evolutionary search, ou des approches AutoRL de Berkeley et Google DeepMind. HARBOR semble aller plus loin en couvrant l'intégralité du workflow plutôt que le seul reward design. Les auteurs ne sont pas identifiés dans l'abstract disponible, et aucune affiliation institutionnelle ni application industrielle spécifique n'est mentionnée : il s'agit d'un preprint de recherche, pas d'un produit commercialisé. Les prochaines étapes naturelles concerneront l'intégration avec des simulateurs standards (Isaac Sim, MuJoCo), des validations sur des plateformes humanoïdes complexes, et une éventuelle ouverture du code.

RecherchePaper
1 source
PROMO : apprentissage par renforcement multi-objectif conditionné par les préférences pour robots quadrupèdes
2arXiv cs.RO 

PROMO : apprentissage par renforcement multi-objectif conditionné par les préférences pour robots quadrupèdes

Des chercheurs proposent PROMO (Preference-Conditioned Multi-Objective Reinforcement Learning), une méthode qui transforme l'arbitrage entre objectifs de locomotion en entrée modifiable à l'exécution d'une politique unique pour robot quadrupède. Le travail, publié sur arXiv (2610.01260), vise un problème classique : le suivi de commande, la stabilité et l'efficacité énergétique entrent en conflit, et l'apprentissage par renforcement (RL) conventionnel fige leur hiérarchie dans une récompense scalaire fixée à l'entraînement. PROMO conditionne la politique sur des préférences exprimées au déploiement, tout en gardant fixes les a priori propres à l'embodiment, nécessaires à la génération d'une marche viable. En simulation, sur 100 préférences échantillonnées, 67 comportements sont non dominés au sens strict de Pareto, avec une corrélation moyenne préférence-objectif de 0,843. Sur un Unitree Go2, la même politique est transférée en zero-shot. Le seul changement de préférence, par rapport au réglage équilibré, réduit l'énergie spécifique jusqu'à 30,4 %, l'erreur de position de 38,7 % et l'écart maximal d'attitude du corps de 59,0 %. Le code et des vidéos sont en open source. L'intérêt pratique tient à l'interface. Aujourd'hui, adapter un contrôleur à une mission (économiser la batterie en inspection, privilégier la précision de placement, stabiliser une charge utile) impose souvent de réentraîner ou de maintenir plusieurs spécialistes. Une politique unique réglable à chaud simplifie la validation, le déploiement et la maintenance d'une flotte, ce qui parle aux intégrateurs de robots à pattes pour l'inspection industrielle. Les auteurs affirment qu'elle égale ou dépasse contrôleurs à objectif fixe, baselines multi-objectifs et spécialistes entraînés séparément, ce qui, si cela se confirme, rendrait la spécialisation par réentraînement moins nécessaire. Des réserves s'imposent toutefois : les gains réels sont mesurés sur une seule plateforme, relatifs à un réglage « équilibré » choisi par les auteurs, sans information sur la variété des terrains ni le nombre d'essais. Ce résultat relève de la recherche, pas d'un produit livré ni d'un déploiement. Le RL multi-objectif existait surtout comme outil hors ligne, pour construire des ensembles de Pareto que l'on exploitait ensuite en choisissant un point de fonctionnement. PROMO prolonge ce rôle en faisant de la préférence une variable de commande au runtime. Le Go2 d'Unitree est devenu la plateforme de référence de la recherche académique en locomotion par RL, ce qui facilite la comparaison et la reproduction, et l'ouverture du code va dans ce sens. La suite logique serait de tester l'approche sur d'autres morphologies, sur terrains difficiles, et de l'articuler avec des interfaces de commande de plus haut niveau, par exemple des modèles vision-langage-action ou des opérateurs humains traduisant une intention en préférence. Aucun pilote industriel ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Composition de compétences pour l'apprentissage par renforcement des robots à pattes
3arXiv cs.RO 

Composition de compétences pour l'apprentissage par renforcement des robots à pattes

Un article de recherche publié sur arXiv (référence 2609.14647v1, soumission de type "new") intitulé "Skill Composition for Legged Robot Reinforcement Learning" pose un constat simple sur l'état de l'art en robotique humanoïde : les robots à pattes, et les humanoïdes en particulier, maîtrisent de mieux en mieux des comportements isolés, chacun obtenu par l'entraînement d'un contrôleur spécialisé par apprentissage par renforcement. Ces politiques spécialisées s'entraînent vite, convergent de façon fiable puisqu'elles ne traitent qu'un problème restreint, et peuvent être validées indépendamment les unes des autres, trois propriétés qu'une politique unique de bout en bout censée tout couvrir ne possède pas. Le point faible identifié par les auteurs n'est pas l'acquisition des compétences elles-mêmes, mais la transition entre elles : le passage de contrôle d'une politique à une autre reste fragile et mal maîtrisé. L'argument central du papier est que la composition de sous-politiques indépendantes mérite d'être traitée comme un problème de recherche à part entière, et non comme un détail d'implémentation confié au premier mécanisme disponible. Une composition fiable est ce qui transforme une collection de compétences isolées en un répertoire réellement exploitable, extensible et partageable, un enjeu direct pour les intégrateurs qui cherchent à assembler des bibliothèques de comportements réutilisables plutôt que de réentraîner un modèle monolithique à chaque nouvelle tâche. Plus fondamentalement, si le contrôle peut être transféré entre politiques spécialisées de façon sûre et à tout moment, le choix de l'action suivante peut être délégué à un composant de nature différente, comme un planificateur, un automate ou un contrôleur symbolique, dont le comportement est inspectable à l'avance. Les politiques n'auraient alors plus qu'à agir, tandis que ce que le robot est autorisé à faire deviendrait vérifiable, un argument qui va à contre-courant de la course actuelle aux politiques VLA de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, et qui remet en avant l'intérêt de l'architecture modulaire pour la certification et la sécurité en environnement industriel. Il s'agit d'un article de position et de méthode, sans résultats chiffrés, démonstration matérielle ni annonce de déploiement dans le résumé disponible : aucun robot, aucune entreprise ni aucun site de test n'y sont cités, ce qui le distingue nettement des communiqués produits du secteur. Il s'inscrit dans un débat plus large qui oppose, d'un côté, les laboratoires misant sur des politiques vision-langage-action entraînées de bout en bout pour couvrir un maximum de tâches avec un seul réseau, et de l'autre, une tradition de robotique plus classique fondée sur la planification hiérarchique et les automates symboliques. En proposant de faire de la composition de compétences un objet de recherche autonome, les auteurs ouvrent une voie intermédiaire entre ces deux approches, sans préciser dans l'abstract de calendrier, de prototype ou de partenariat industriel concret pour la suite des travaux.

RecherchePaper
1 source
Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents
4arXiv cs.RO 

Formation de formes pour le transport coopératif d'objets quelconques par apprentissage par renforcement multi-agents

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.09610v1) une approche par apprentissage par renforcement multi-agents (MARL) pour résoudre un problème concret de robotique collaborative : positionner automatiquement un groupe de robots mobiles sous un objet afin de le transporter de façon stable. La méthode décompose la tâche en trois sous-problèmes couplés, contrôle de formation, navigation coopérative et évitement de collisions, et produit des politiques permettant à la flotte de s'aligner sous l'objet, d'équilibrer son poids malgré une distribution de masse non uniforme, et de naviguer dans des environnements encombrés. Les expériences portent sur des configurations variées (nombre de robots variable, géométries d'objets complexes, scènes avec obstacles) sans que les auteurs précisent le nombre exact de robots testés ni les temps de cycle obtenus. Le principal apport industriel de ces travaux est la généralisation à des objets de forme arbitraire et à masse mal distribuée, ce qui représente la réalité de la plupart des charges en logistique ou en services. Les approches classiques supposent des objets symétriques ou des points de contact prédéfinis manuellement ; ici, la politique apprise s'adapte au vol à la géométrie de la charge. Pour un intégrateur ou un COO industriel, cela signifie potentiellement moins de paramétrage manuel par référence produit. Le paper démontre également une robustesse en environnement encombré, ce qui est un prérequis pour un déploiement en entrepôt réel. Il faut toutefois noter que les résultats présentés restent en simulation : aucune validation hardware n'est rapportée, et le fossé sim-to-real reste l'obstacle non résolu habituel de ce type de travaux. Ce preprint s'inscrit dans un courant actif de recherche MARL appliqué aux systèmes multi-robots physiques, en compétition avec des approches centralisées (planification MPC couplée) ou décentralisées par consensus. Côté industrie, des acteurs comme 6 River Systems, Locus Robotics ou les plateformes AMR d'OTTO Motors adressent des problèmes adjacents mais avec des charges standardisées sur des robots dédiés. Aucun partenariat industriel ni timeline de transfert vers le réel n'est mentionné dans cet article ; il s'agit d'une contribution académique ouvrant la voie à des validations expérimentales futures.

RecherchePaper
1 source