Aller au contenu principal
RecherchearXiv cs.RO 

Affinage tenant compte du filtre pour un suivi sûr du corps entier d'un robot humanoïde

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02341) CoFiT, pour Constrained Filter-aware Tuning, une méthode de fine-tuning qui adapte un tracker de mouvement humanoïde pré-entraîné à la présence d'un filtre de sécurité. Le tracker est une politique d'apprentissage par renforcement qui suit une référence fournie par un planificateur, un téléopérateur ou un générateur de mouvement. Le filtre, de type control barrier function (CBF), corrige les sorties de la politique à l'exécution pour respecter de nouvelles contraintes. Les auteurs testent la méthode sur deux trackers existants, TWIST2 et SONIC, dans diverses scènes de contraintes. Par rapport à un entraînement limité au filtre seul, CoFiT réduit le temps de violation de 91 % sur TWIST2 et de 21 % sur SONIC, avec des corrections du filtre moins importantes. Sur un Unitree G1 réel, la réduction atteint 83 % pour TWIST2. Tous les essais se terminent sans intervention de l'opérateur, contre 50 % d'essais de référence qui ont exigé un arrêt manuel. Le nombre d'essais n'est pas précisé dans le résumé.

L'intérêt tient au constat que tracker et filtre de sécurité ne peuvent pas être conçus séparément. Le filtre modifie les actions exécutées, donc aussi la distribution des états que la politique rencontre, ce qui crée des écarts de dynamique, d'objectif et d'information entre ce que le tracker a appris et ce qu'il subit. Pour un intégrateur, l'architecture « référence, tracker RL, filtre CBF » ne garantit donc pas la sécurité par simple empilement. Le fine-tuning d'un tracker existant, sans réentraînement complet, offre une voie pragmatique vers le déploiement en environnement non structuré. L'écart de gain entre TWIST2 (91 %) et SONIC (21 %) signale toutefois que le bénéfice dépend fortement du tracker de départ. La validation matérielle repose sur un seul robot, le G1, un humanoïde de recherche à faible coût, et sur des scénarios de contraintes dont la complexité reste à examiner dans l'article complet.

Ce travail s'inscrit dans la généralisation des contrôleurs de suivi de mouvement du corps entier, devenus la couche d'exécution standard de la téléopération et des politiques pilotées par des modèles génératifs. Les CBF fournissent depuis longtemps des garanties de sécurité en robotique, mais surtout sur des systèmes plus simples. Il s'agit d'une prépublication v1, non évaluée par des pairs, sans déploiement industriel ni produit annoncé. Les suites probables sont des essais sur d'autres plateformes, des contraintes plus riches comme le contact ou l'évitement de personnes, et une extension à d'autres trackers. Les auteurs revendiquent des principes de conception, ce qui sera utile à tout acteur combinant politique apprise et couche de sécurité certifiable, y compris en Europe, où les exigences de sécurité machine pèsent sur les humanoïdes.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques
1arXiv cs.RO 

KungfuBot : contrôle physique du corps entier d'un robot humanoïde pour l'apprentissage de compétences hautement dynamiques

Des chercheurs présentent KungfuBot, un cadre de contrôle corps-entier pour robots humanoïdes basé sur la physique, capable d'imiter des mouvements humains hautement dynamiques comme le kungfu ou la danse, là où les algorithmes existants ne parviennent à suivre que des mouvements lents et fluides malgré un travail soigné sur les récompenses et le curriculum d'apprentissage. Le système repose sur un pipeline de traitement du mouvement qui extrait, filtre, corrige et retargete les captures de mouvement humain tout en respectant au maximum les contraintes physiques du robot. Pour l'imitation, les auteurs formulent un problème d'optimisation à deux niveaux qui ajuste dynamiquement la tolérance de précision de suivi selon l'erreur courante, créant un mécanisme de curriculum adaptatif, complété par une architecture acteur-critique asymétrique pour l'entraînement des politiques. Déployé sur le robot Unitree G1, le système atteint des erreurs de suivi nettement inférieures aux approches existantes et produit des comportements stables et expressifs. Le projet est documenté sur kungfubot.github.io. L'enjeu dépasse la simple prouesse technique : la capacité à reproduire des mouvements rapides et dynamiques est un point de blocage connu du contrôle corps-entier par imitation, où le compromis entre stabilité physique et fidélité au mouvement source devient critique à haute vitesse. En démontrant qu'un curriculum adaptatif basé sur l'erreur de suivi permet de dépasser ce plafond, KungfuBot apporte une preuve de concept utile pour toute l'industrie humanoïde, où l'expressivité et la robustesse des mouvements dynamiques sont devenues un argument de démonstration autant qu'un vrai défi d'ingénierie. Reste que les vidéos de démonstration, comme souvent dans ce type de publication, présentent probablement une sélection de résultats plutôt qu'un comportement systématique et généralisable. Ce travail s'inscrit dans la lignée des recherches sur l'imitation de mouvement par apprentissage par renforcement physique, un domaine où le retargeting de capture de mouvement humain vers des morphologies robotiques reste une difficulté majeure. Le fait qu'il s'agisse d'une troisième version révisée sur arXiv suggère un travail affiné après retours de la communauté. Le choix du Unitree G1, plateforme largement utilisée dans la recherche académique en robotique humanoïde, positionne ces résultats comme reproductibles par d'autres laboratoires, dans un secteur où Unitree, Figure ou Boston Dynamics rivalisent sur la démonstration de comportements dynamiques et expressifs.

RecherchePaper
1 source
Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes
2arXiv cs.RO 

Apprentissage d'une politique de suivi de trajectoire asynchrone dans l'espace des tâches du haut du corps pour robots humanoïdes

Des chercheurs ont publié le 25 juin 2026 sur arXiv (preprint 2606.25706) un cadre de contrôle baptisé "asynchronous upper body task-space tracking" pour robots humanoïdes. Le problème qu'ils adressent est architectural : les planificateurs de haut niveau génèrent des trajectoires dans l'espace des tâches à faible fréquence (quelques Hz), alors que les contrôleurs de corps entier tournent à haute fréquence (typiquement plusieurs centaines de Hz). Cette désynchronisation temporelle entre planification et exécution produit des dérives de référentiel et des incohérences dans le contrôle. Pour y remédier, l'équipe propose une politique étudiante initialisée par distillation enseignant-étudiant, conditionnée sur la trajectoire future complète mise en cache et un index d'exécution temporel, puis entraînée avec une récompense globale à fenêtre glissante. Un module MPC (Model Predictive Control) complète les références creuses en guidage corps flottant et membre supérieur, tandis que des contraintes au niveau des actions et de la cinématique directe (FK) limitent la dérive de la politique. Les expériences ont été conduites en simulation et sur le robot Unitree G1, un humanoïde commercial à 23 degrés de liberté. Ce travail touche un goulot d'étranglement concret qui freine la commercialisation des humanoïdes : la chaîne planification-exécution reste fragmentée dans la quasi-totalité des architectures actuelles, forçant des compromis entre réactivité et cohérence de mouvement. Le fait que la politique obtienne de meilleures performances que les baselines synchrones et découplées, et qu'elle s'adapte plus sûrement aux mouvements hors distribution, suggère une progression vers un déploiement robuste en environnement non contrôlé. L'approche sans estimation explicite de référentiel réduit aussi la charge computationnelle, ce qui est pertinent pour les intégrateurs industriels cherchant à embarquer le traitement. Toutefois, il s'agit d'un preprint non encore évalué par les pairs, et les métriques de suivi de trajectoire présentées restent contextualisées à des scénarios de laboratoire ; la généralisabilité à des tâches industrielles réelles reste à démontrer. Unitree Robotics, fabricant chinois fondé en 2016, s'est imposé comme fournisseur de plateformes de recherche abordables avec des robots quadrupèdes puis le G1 humanoïde. Ce contexte explique le choix du matériel : le G1 est accessible à de nombreux labos académiques, ce qui élargit la portée reproductible des résultats. Sur le fond, la course à la maîtrise du pipeline planification-exécution pour les humanoïdes mobilise simultanément Figure (02 et bientôt 03), Tesla Optimus, Agility Robotics, 1X Technologies et les laboratoires académiques liés à Physical Intelligence (Pi-0) et à NVIDIA (GR00T N2). La distillation enseignant-étudiant couplée au MPC comme module de complétion de trajectoire s'inscrit dans une tendance plus large : combler le sim-to-real gap par des architectures hybrides apprises/optimisées plutôt que par du RL pur. Les prochaines étapes naturelles seraient une validation sur des cycles de manipulation répétitifs en cadence industrielle et une intégration avec des VLA (Vision-Language-Action models) pour fermer la boucle perception-planification-exécution.

RecherchePaper
1 source
CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes
3arXiv cs.RO 

CWI : système d'imitation du corps entier pour la loco-manipulation de robots humanoïdes

Des chercheurs ont publié fin juin 2026 sur arXiv (réf. 2606.27676) le framework CWI (Composite Whole-Body Imitation), une architecture de contrôle pour robots humanoïdes visant à coordonner locomotion et manipulation bimanuelle en simultané. Le système a été évalué en simulation puis déployé sur un LimX Oli, humanoïde pleine taille du fabricant chinois LimX Robotics. L'approche repose sur une dissociation du recours aux données de capture de mouvement (MoCap) : les données MoCap de manipulation diversifiées pilotent le contrôle du haut du corps, tandis que la locomotion est guidée par deux discriminateurs adversariaux (Adversarial Motion Prior, AMP) entraînés sur des clips curatés de marche et d'accroupissement. Une architecture multi-critique réduit les conflits entre objectifs de locomotion, de manipulation et de style de mouvement ; une étape de distillation enseignant-élève produit ensuite une politique conditionnée uniquement sur les poses des mains et des commandes de vitesse et hauteur. La loco-manipulation reste l'un des verrous majeurs de la robotique humanoïde. Les méthodes purement par renforcement, sans MoCap, souffrent de récompenses creuses et nécessitent des curricula finement réglés ; les méthodes imitant le corps entier butent sur le déséquilibre des datasets, les trajectoires de locomotion trop dynamiques dégradant la stabilité globale. CWI propose une dissociation architecturale qui contourne les deux écueils. Le résultat pratique est une téléopération sans équipement MoCap complet, ce qui abaisse le seuil d'intégration industrielle. Pour les intégrateurs et les décideurs B2B, cela signifie qu'un humanoïde capable d'agir dans des environnements mixtes (déplacements et saisie d'objets) devient envisageable sans infrastructure de capture de mouvement coûteuse. Cela dit, la publication ne fournit aucune métrique de temps de cycle ni de volumes de déploiement, ce qui invite à lire ces résultats comme une preuve de concept compétitive, pas comme un produit shipé. CWI s'inscrit dans une vague de travaux combinant apprentissage par renforcement et imitation de mouvement humain, dont l'Adversarial Motion Prior (AMP) de Peng et al. constitue la brique fondatrice. LimX Robotics reste un acteur discret face aux mastodontes du secteur : Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (Pi-0) ou encore Boston Dynamics (Atlas) travaillent sur des architectures comparables intégrant contrôle corps entier et politiques Vision-Language-Action (VLA). CWI ne mentionne ni calendrier de déploiement industriel, ni partenariat commercial : il s'agit d'un preprint arXiv sans revue par les pairs publiée. Les prochaines étapes probables passeront par une validation en conditions réelles plus variées et une publication dans une conférence robotique de référence (ICRA, IROS ou RAL).

RecherchePaper
1 source
HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier
4arXiv cs.RO 

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier

Des chercheurs présentent HOTICE, un framework d'apprentissage pour robots humanoïdes dédié au transport d'objets en environnement encombré, détaillé dans un preprint publié sur arXiv (2609.25363v1). Le système combine des « champs de potentiel découplés humanoïde-objet », qui calculent simultanément l'évitement de collision pour le corps du robot et pour l'objet porté, et une architecture de renforcement à deux agents séparant le contrôle du haut et du bas du corps tout en gardant une coordination globale via des observations et récompenses partagées. Pour généraliser à des scènes variées, les auteurs distillent plusieurs politiques enseignantes « privilégiées » en une seule politique étudiante déployable. HOTICE a été testé en simulation MuJoCo puis sur un robot Unitree G1 réel, transportant des objets de formes différentes à travers des obstacles ; le papier ne cite toutefois aucun chiffre de taux de réussite, de charge utile ou de temps de cycle, se limitant à des qualificatifs comme « efficace » et « robuste ». Le transport d'objets en espace contraint reste une capacité rare dans les démonstrations humanoïdes actuelles, la plupart des systèmes commerciaux comme Figure 03 ou Optimus Gen 3 étant montrés en environnement dégagé. En traitant simultanément l'évitement de collision du robot et de sa charge, HOTICE cible un problème concret pour les intégrateurs logistiques confrontés à des couloirs d'entrepôt ou des ateliers exigus. L'approche illustre aussi une alternative aux modèles vision-langage-action monolithiques comme Pi-0 ou GR00T N2 : découper la loco-manipulation en agents spécialisés coordonnés réduit l'espace d'action à apprendre et facilite, selon les auteurs, le transfert de la simulation vers un robot réel. HOTICE demeure un résultat de recherche en preprint, sans affiliation institutionnelle précisée ni partenariat industriel ou pilote commercial annoncé. Il s'inscrit dans une recherche active sur la loco-manipulation humanoïde, où plusieurs équipes explorent des architectures multi-agents pour coordonner bras et jambes, aux côtés de modèles généralistes comme Helix chez Figure AI ou GR00T N2 chez NVIDIA. Le choix du Unitree G1, plateforme chinoise largement adoptée par les laboratoires académiques pour son coût abordable, confirme son rôle de banc d'essai de référence pour ce type de travaux. Aucun calendrier de transfert vers un produit n'est mentionné ; les auteurs annoncent seulement la validation technique de leur méthode.

RecherchePaper
1 source