Aller au contenu principal
Athena-WBC : experts de politique alignés sur les capacités pour le contrôle corporel complet des humanoïdes en longue traîne
RecherchearXiv cs.RO 

Athena-WBC : experts de politique alignés sur les capacités pour le contrôle corporel complet des humanoïdes en longue traîne

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine du système Athena-WBC s'attaquent à un problème persistant du contrôle corps-entier des robots humanoïdes : même les meilleurs contrôleurs de suivi de mouvement à grande échelle échouent sur un sous-ensemble récalcitrant de mouvements, en particulier les transitions à haute dynamique et les gestes critiques pour l'équilibre, et ce même quand ces clips sont réentraînés de façon ciblée. L'équipe montre que la cause n'est pas seulement un manque d'exposition à ces mouvements rares, mais un décalage entre les exigences du mouvement et la capacité effective que produit la recette d'entraînement par défaut. Leur réponse est un pipeline compact de type enseignant-élève combinant des "experts" alignés sur la capacité requise : des experts dynamiques, entraînés avec un objectif de suivi allégé des pénalités conservatrices et temporelles tout en conservant les contraintes physiques de faisabilité, et des experts d'équilibre, formés via un curriculum de gravité progressif pour améliorer la survie en début d'apprentissage. Ces enseignants privilégiés sont ensuite routés par mouvement pour une distillation DAgger, puis compressés en un contrôleur unique utilisant des observations déployables, affiné par apprentissage par renforcement. Sur un humanoïde grandeur nature, la méthode améliore la récupération des mouvements rares de l'ensemble d'entraînement et le suivi sur des mouvements non vus, par rapport à une base solide utilisant la recette SONIC, avec seulement un petit nombre d'experts.

Ce travail cible directement l'un des goulots d'étranglement les plus sensibles de la robotique humanoïde actuelle : le fameux "long tail" des mouvements difficiles, qui sépare les démonstrations en vidéo soigneusement sélectionnées des déploiements réellement robustes en usine ou en environnement non contrôlé. Pour les intégrateurs et décideurs industriels, la promesse n'est pas un nouveau matériel mais une méthode d'entraînement plus efficace en données et en nombre d'experts, ce qui réduit le coût d'ingénierie nécessaire pour couvrir les cas extrêmes de chute, de rattrapage d'équilibre ou de transition rapide entre postures, souvent le vrai facteur limitant avant la mise en production de humanoïdes.

Le papier s'inscrit dans la lignée des architectures enseignant-élève par distillation DAgger désormais standard pour le contrôle de mouvement humanoïde, et se positionne explicitement contre la recette SONIC, une référence récente du domaine, en cherchant à la dépasser sur les cas rares sans multiplier le nombre d'experts spécialisés. Publié sur arXiv le 7 juillet 2026, le travail ouvre la voie à des comparaisons futures avec d'autres pipelines de contrôle corps-entier utilisés par les acteurs commerciaux du secteur, sans toutefois préciser à ce stade de calendrier de transfert vers un produit industriel.

Dans nos dossiers

À lire aussi

LAC : compliance linéaire et angulaire pour le contrôle corporel complet des humanoïdes
1arXiv cs.RO 

LAC : compliance linéaire et angulaire pour le contrôle corporel complet des humanoïdes

Un article publie sur arXiv (2608.25405) présente LAC, un contrôleur de corps entier pour humanoïdes qui traite simultanément les forces linéaires et les couples angulaires appliques sur le haut du corps. La méthode entraine, via apprentissage par renforcement en schéma enseignant-élevé, une politique unique a suivre des mouvements de conformité calcules par un modèle d'admittance virtuelle, a partir d'un jeu de données augmente ou des forces et couples sont appliques sur des points de contact extraits d'interactions humaines réelles. Simulations et essais sur robot réel montrent une réponse conforme sur tout le haut du corps, une modulation continue de la raideur commandée, et une application a la loco-manipulation téléopérée ; le projet est documente sur lac-humanoid.github.io. La plupart des contrôleurs humanoïdes actuels traitent les forces externes comme des perturbations a rejeter pour garder l'équilibre, ou ne tolèrent la conformité que sur quelques liaisons, sans tenir compte des couples. En unifiant conformité linéaire et angulaire sur tout le haut du corps avec une seule politique, LAC vise des interactions physiques plus sures avec des objets ou des humains, utiles pour l'assistance au geste, le guidage physique ou la manipulation collaborative. Pour les intégrateurs, ce travail illustre le passage de contrôleurs rigides orientes stabilité vers des architectures apprises a raideur réglable, un ingrédient recherche pour rapprocher les humanoïdes d'une téléopération ou d'une autonomie exploitables en usine ou en logistique. LAC s'inscrit dans la lignée des travaux sur le contrôle en impédance et en admittance pour humanoïdes, un champ transforme ces dernières années par l'apprentissage par renforcement sim-to-real, une approche aussi explorée par des acteurs comme Figure, Unitree ou Boston Dynamics, sans qu'aucun ne soit associe a cette publication académique. Il s'agit d'une contribution de recherche validée en simulation et sur robot réel en laboratoire, non d'un produit commercialise ni d'un déploiement industriel : les démonstrations doivent donc être lues comme une preuve de concept. Aucun calendrier de transfert commercial n'est communique, mais le site du projet met les résultats a disposition, en vue d'extensions vers le contrôle du bas du corps ou l'intégration a des piles logicielles humanoïdes existantes.

RecherchePaper
1 source
X-WBC : un modèle fondation à embodiment croisé pour le contrôle corporel complet des humanoïdes
2arXiv cs.RO 

X-WBC : un modèle fondation à embodiment croisé pour le contrôle corporel complet des humanoïdes

Des chercheurs ont publié le 15 septembre 2026 sur arXiv (référence 2609.15213v1) une architecture baptisée X-WBC, conçue pour entraîner une politique de contrôle corps entier ("whole-body control") partagée entre plusieurs robots humanoïdes de morphologies différentes. Le problème ciblé est concret : jusqu'ici, chaque robot nécessite sa propre politique entraînée isolément, ce qui empêche de mutualiser les corpus de mouvement humain et l'expérience d'apprentissage entre plateformes. X-WBC sépare la sémantique du mouvement humain, jugée largement transférable, de l'exécution physique propre à chaque robot. Le système utilise des tokens de commande centrés sur l'humain pour aligner mouvement humain complet, mouvement de référence du robot et observations éparses issues de dispositifs VR, un Transformer causal pour extraire une structure temporelle réutilisable à partir de trajectoires mélangées de plusieurs robots, et des modules légers spécifiques à chaque plateforme pour traduire cette représentation partagée vers la proprioception et l'espace d'action de chaque machine. Les auteurs rapportent des tests sur neuf embodiments simulés, des mouvements externes non vus à l'entraînement, et quatre robots réels. Pour l'industrie robotique, l'enjeu dépasse la prouesse technique : si l'entraînement croisé entre embodiments tient à l'échelle, il ouvre la voie à des modèles fondation de contrôle corps entier nourris par des flottes hétérogènes plutôt que par un seul robot à la fois, un goulot d'étranglement bien connu des fabricants qui peinent à collecter des données de téléopération en volume suffisant. Cela complèterait les modèles vision-langage-action comme Pi-0 ou GR00T N2, aujourd'hui centrés sur la manipulation, en s'attaquant cette fois au versant locomotion et équilibre, réputé plus contraint par les différences de cinématique et de dynamique entre robots. Les résultats restent toutefois ceux d'un article de recherche non encore relu par les pairs, validés majoritairement en simulation, avec seulement quatre plateformes physiques testées : rien n'indique à ce stade un déploiement industriel ni un produit commercialisable. Ce travail s'inscrit dans la lignée des modèles fondation pour la robotique lancée par les VLA de manipulation, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, mais transpose l'idée du transfert cross-robot au contrôle corps entier, un domaine où l'hétérogénéité des morphologies humanoïdes complique historiquement le partage de données d'apprentissage. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article ; les auteurs présentent X-WBC comme une preuve de concept méthodologique, dont la confirmation passera par des essais sur davantage de plateformes physiques et par une revue par les pairs.

RecherchePaper
1 source
Commande corpo-entière sûreté-critique pour robots humanoïdes via les barrières de contrôle entrée-état
3arXiv cs.RO 

Commande corpo-entière sûreté-critique pour robots humanoïdes via les barrières de contrôle entrée-état

Des chercheurs ont publié sur arXiv (référence 2605.25546) un framework hiérarchique de contrôle sécurisé corps entier pour robots humanoïdes, fondé sur les fonctions barrières robustes aux perturbations (ISSf-CBF, Input-to-State Safe Control Barrier Functions). L'architecture s'articule en trois couches : un contrôleur whole-body cinématique (KinWBC) qui génère des références articulaires à partir de tâches priorisées, un filtre ISSf-CBF qui les ajuste au minimum pour satisfaire les contraintes de sécurité sous perturbations bornées, et un contrôleur whole-body dynamique (DynWBC) qui garantit la faisabilité corps entier et la stabilité des contacts. Les contraintes couvertes incluent les limites articulaires, l'évitement d'auto-collision, l'évitement d'obstacles et les frontières du workspace. Validé en simulation et sur robot réel, le système a été testé dans trois scénarios : locomotion, téleopération et équilibre monopode avec contrôle simultané des mains. L'intérêt de l'approche tient à un problème fondamental en robotique humanoïde : les garanties de sécurité formelles s'effondrent dès qu'apparaît un écart entre le modèle de simulation et le comportement physique réel. Les CBFs classiques supposent un système parfaitement connu et deviennent fragiles face aux incertitudes de modèle, aux erreurs de suivi de trajectoire ou aux perturbations externes, précisément les conditions d'un environnement industriel. Les ISSf-CBFs étendent ce formalisme en admettant des perturbations bornées tout en maintenant des garanties formelles transférables du niveau cinématique vers la dynamique complète. Le filtre intervient de façon minimalement invasive, ne corrigeant les références nominales que lorsque nécessaire, ce qui préserve la performance globale. C'est une réponse directe au "demo-to-reality gap" structurellement reproché aux humanoïdes actuels, et un prérequis pour toute certification de robot collaboratif en environnement humain. Les Control Barrier Functions sont un outil bien établi en automatique, popularisé dans les années 2010 pour les véhicules autonomes et les bras robotiques. Leur extension aux ISSf-CBFs pour la robustesse aux perturbations est plus récente, et leur application à un humanoïde corps entier avec des dizaines de degrés de liberté, des contacts multiples et des dynamiques non linéaires représente un saut de complexité notable. Dans la course actuelle aux humanoïdes, les acteurs comme Figure, Boston Dynamics, Tesla (Optimus), Agility Robotics, Apptronik ou Unitree publient peu sur les garanties de sécurité formelles corps entier, un domaine resté majoritairement académique. Ce travail n'annonce pas de déploiement industriel, mais fournit une brique méthodologique directement applicable aux pipelines de validation et de certification des futurs robots collaboratifs.

UELes garanties de sécurité formelles apportées par ce framework sont directement pertinentes pour la certification des robots collaboratifs humanoïdes dans le cadre du Machinery Regulation et de l'AI Act européens.

RecherchePaper
1 source
ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs
4arXiv cs.RO 

ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs

Un preprint publié sur arXiv (2609.09918) décrit ViBe (Visual Behavior Adaptation), un framework de post-entraînement qui ajoute une perception visuelle aux contrôleurs de suivi de mouvement pour humanoïdes à corps complet. La méthode réutilise des encodeurs visuels pré-entraînés via un module extracteur multi-requêtes, injecte ce retour perceptif dans le tracker par des adaptateurs low-rank (LoRA) pour un réglage économe en paramètres, puis ajuste l'ensemble par optimisation de politique à partir d'un reward de tâche et d'un jeu de données de référence. Sur quatre tâches, la marche perceptive sur trottoirs et parcours type parkour, le repositionnement d'un cube (Repose Cube), la locomotion-manipulation d'objets variés et l'esquive de balles (dodgeball), le transfert sim-to-real s'effectue en zero-shot et reste robuste en extérieur, en faible luminosité et face à des distracteurs visuels RGB, y compris pour une variante orientée objectif de Repose Cube résolue avec un planificateur volontairement simple. L'apport ne se limite pas à la démonstration technique. Les trackers de mouvement actuels, entraînés en simulation par imitation de trajectoires, n'intègrent aucune perception extéroceptive et dépendent donc d'un planificateur de haut niveau pour réagir à l'environnement. Les contrôleurs perceptifs existants comblaient ce manque en entraînant des encodeurs purement géométriques depuis zéro, plus faciles à transférer en réel mais pauvres en sémantique, et en passant par une distillation élève-enseignant propre à chaque tâche, coûteuse à répéter. En réutilisant des encodeurs visuels pré-entraînés et en cantonnant l'adaptation à des modules low-rank, ViBe suggère que le goulot d'étranglement du contrôle humanoïde perceptif se déplace de la simulation physique, déjà largement maîtrisée, vers l'intégration efficace de la perception sémantique, un point clé pour les intégrateurs qui cherchent à sortir ces robots des environnements contrôlés d'usine. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement à grande échelle pour la locomotion humanoïde, où le transfert sim-to-real reste le paradigme dominant, et se distingue des architectures vision-langage-action de bout en bout comme Pi-0 ou GR00T N2 en proposant une adaptation légère d'un tracker déjà entraîné plutôt qu'une politique généraliste entraînée sur un large corpus de démonstrations. Publié comme contribution académique, sans partenariat industriel ni plateforme commerciale nommée à ce stade, l'article n'évoque aucun déploiement réel. La suite logique consisterait à valider la méthode sur des humanoïdes commerciaux et à la comparer directement, en coût d'entraînement et en robustesse, aux pipelines de distillation élève-enseignant aujourd'hui utilisés par les acteurs du secteur.

RecherchePaper
1 source