PROMO : apprentissage par renforcement multi-objectif conditionné par les préférences pour robots quadrupèdes
Des chercheurs proposent PROMO (Preference-Conditioned Multi-Objective Reinforcement Learning), une méthode qui transforme l'arbitrage entre objectifs de locomotion en entrée modifiable à l'exécution d'une politique unique pour robot quadrupède. Le travail, publié sur arXiv (2610.01260), vise un problème classique : le suivi de commande, la stabilité et l'efficacité énergétique entrent en conflit, et l'apprentissage par renforcement (RL) conventionnel fige leur hiérarchie dans une récompense scalaire fixée à l'entraînement. PROMO conditionne la politique sur des préférences exprimées au déploiement, tout en gardant fixes les a priori propres à l'embodiment, nécessaires à la génération d'une marche viable. En simulation, sur 100 préférences échantillonnées, 67 comportements sont non dominés au sens strict de Pareto, avec une corrélation moyenne préférence-objectif de 0,843. Sur un Unitree Go2, la même politique est transférée en zero-shot. Le seul changement de préférence, par rapport au réglage équilibré, réduit l'énergie spécifique jusqu'à 30,4 %, l'erreur de position de 38,7 % et l'écart maximal d'attitude du corps de 59,0 %. Le code et des vidéos sont en open source.
L'intérêt pratique tient à l'interface. Aujourd'hui, adapter un contrôleur à une mission (économiser la batterie en inspection, privilégier la précision de placement, stabiliser une charge utile) impose souvent de réentraîner ou de maintenir plusieurs spécialistes. Une politique unique réglable à chaud simplifie la validation, le déploiement et la maintenance d'une flotte, ce qui parle aux intégrateurs de robots à pattes pour l'inspection industrielle. Les auteurs affirment qu'elle égale ou dépasse contrôleurs à objectif fixe, baselines multi-objectifs et spécialistes entraînés séparément, ce qui, si cela se confirme, rendrait la spécialisation par réentraînement moins nécessaire. Des réserves s'imposent toutefois : les gains réels sont mesurés sur une seule plateforme, relatifs à un réglage « équilibré » choisi par les auteurs, sans information sur la variété des terrains ni le nombre d'essais. Ce résultat relève de la recherche, pas d'un produit livré ni d'un déploiement.
Le RL multi-objectif existait surtout comme outil hors ligne, pour construire des ensembles de Pareto que l'on exploitait ensuite en choisissant un point de fonctionnement. PROMO prolonge ce rôle en faisant de la préférence une variable de commande au runtime. Le Go2 d'Unitree est devenu la plateforme de référence de la recherche académique en locomotion par RL, ce qui facilite la comparaison et la reproduction, et l'ouverture du code va dans ce sens. La suite logique serait de tester l'approche sur d'autres morphologies, sur terrains difficiles, et de l'articuler avec des interfaces de commande de plus haut niveau, par exemple des modèles vision-langage-action ou des opérateurs humains traduisant une intention en préférence. Aucun pilote industriel ni calendrier n'est annoncé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




