Aller au contenu principal
RecherchearXiv cs.RO 

HumanoidTTT : réutilisation des capacités au moment du test pour un contrôle humanoïde efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.00198) HumanoidTTT, un cadre logiciel de réutilisation de capacités au moment du test pour le contrôle continu de robots humanoïdes. Le système repose sur deux composants. Le premier, Selective Full-Motion Reuse, autorise le rejeu direct d'une motion complète déjà validée, mais uniquement depuis des états d'entrée certifiés comme applicables, ce qui permet de court-circuiter une nouvelle génération de mouvement. Le second, Test-Time Capability Consolidation, gère un Full-Motion Store de taille bornée et décide quelles capacités qualifiées y restent, en utilisant les réutilisations observées en déploiement comme signal de retour. Les auteurs annoncent zéro acceptation dangereuse (unsafe accept) et une accélération de bout en bout de 16,4 fois par rapport à une génération à chaque requête. La consolidation en ligne évite en outre 13,2 appels au générateur supplémentaires par tranche de 200 requêtes par rapport à une version figée du même magasin. Le code et un site de projet sont publiés.

L'enjeu est pragmatique. Les progrès récents en génération de mouvement et en suivi du corps entier (whole-body tracking) permettent aux humanoïdes d'exécuter des gestes variés, mais le coût de calcul et la latence de génération pèsent sur un déploiement continu où les mêmes demandes reviennent. Rejouer aveuglément un mouvement qui a réussi est risqué, car les mouvements intermédiaires modifient l'état d'entrée du robot. Cette approche traite la réutilisation comme un problème de certification d'état, et non de simple cache, ce qui répond à une préoccupation d'intégrateur : réduire la latence sans sacrifier la sécurité. Le chiffre de 16,4 fois reste cependant à nuancer. Il s'agit d'un gain mesuré contre une génération fraîche, donc dépendant du coût du générateur choisi comme référence et de la fréquence de répétition des requêtes. Rien n'indique, dans le résumé, une validation sur robot réel en conditions industrielles ; il s'agit d'un travail de recherche préimprimé, non évalué par des pairs.

Le contexte est celui d'une chaîne qui s'allonge : modèles génératifs de mouvement, contrôleurs de suivi du corps entier, puis, désormais, couches d'orchestration qui amortissent leur coût à l'usage. HumanoidTTT s'inscrit dans cette logique de passage de la démonstration à l'exploitation continue, où la gestion de la mémoire bornée et de la sûreté compte autant que la qualité du mouvement. Le résumé ne cite ni plateforme matérielle, ni comparaison avec des systèmes concurrents comme les VLA généralistes ; ces éléments devront être vérifiés dans l'article complet et le dépôt de code. La suite probable relève de la validation sur davantage de robots et de tâches, avec des environnements où les états d'entrée dérivent de façon moins contrôlée.

Dans nos dossiers

À lire aussi

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes
1arXiv cs.RO 

CMoE : mélange d'experts contrastif pour le contrôle de mouvement et l'adaptation au terrain des robots humanoïdes

Une équipe de recherche présente CMoE (Contrastive Mixture of Experts), un framework d'apprentissage par renforcement en une seule étape pour la locomotion de robots humanoïdes sur terrains complexes. L'article, référencé arXiv:2603.03067v2 et publié en version révisée, part d'un constat technique : dans une architecture classique de mixture of experts (MoE), le réseau de gating censé activer sélectivement des experts selon le terrain finit en pratique par répartir presque uniformément l'activation entre eux, annulant l'intérêt de la spécialisation. CMoE corrige ce défaut par une contrainte d'apprentissage contrastif qui rend les activations d'experts cohérentes sur un même type de terrain tout en les différenciant d'un terrain à l'autre. Testée sur le robot humanoïde Unitree G1, la méthode permet de franchir des marches continues jusqu'à 20 cm de haut et des espaces jusqu'à 80 cm de large, avec une démarche jugée robuste et naturelle sur des terrains mixtes, des résultats présentés comme supérieurs aux méthodes existantes. Le code est publié en accès libre. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : la généralisation de la locomotion sur terrain non structuré, condition nécessaire à tout déploiement hors laboratoire. L'architecture MoE gagne du terrain pour doter un même modèle de comportements moteurs spécialisés, mais l'étude montre que sa spécialisation théorique ne se matérialise pas sans mécanisme correctif dédié, un avertissement pour les équipes qui empilent des experts sans vérifier leur activation réelle. Les chiffres de franchissement donnent un repère concret pour comparer les capacités locomotrices annoncées par différents laboratoires, mais restent des résultats obtenus en conditions expérimentales contrôlées sur une seule plateforme, sans validation en déploiement réel. CMoE s'inscrit dans la lignée des travaux adaptant les architectures mixture of experts, popularisées par les grands modèles de langage, au contrôle moteur des robots à pattes et humanoïdes, un domaine où plusieurs équipes cherchent à dépasser les limites des politiques de marche uniques entraînées par renforcement. Le choix du Unitree G1 confirme le rôle de ce robot chinois disponible dans le commerce comme banc d'essai de référence pour la recherche académique en locomotion humanoïde. En publiant leur code, les auteurs visent à permettre à la communauté de reproduire et d'étendre leurs résultats, sans annoncer de partenariat industriel, de pilote commercial ni de calendrier de transfert vers un produit, ce qui situe ce travail au stade de la recherche plutôt que du déploiement.

RecherchePaper
1 source
X-WBC : un modèle fondation à embodiment croisé pour le contrôle corporel complet des humanoïdes
2arXiv cs.RO 

X-WBC : un modèle fondation à embodiment croisé pour le contrôle corporel complet des humanoïdes

Des chercheurs ont publié le 15 septembre 2026 sur arXiv (référence 2609.15213v1) une architecture baptisée X-WBC, conçue pour entraîner une politique de contrôle corps entier ("whole-body control") partagée entre plusieurs robots humanoïdes de morphologies différentes. Le problème ciblé est concret : jusqu'ici, chaque robot nécessite sa propre politique entraînée isolément, ce qui empêche de mutualiser les corpus de mouvement humain et l'expérience d'apprentissage entre plateformes. X-WBC sépare la sémantique du mouvement humain, jugée largement transférable, de l'exécution physique propre à chaque robot. Le système utilise des tokens de commande centrés sur l'humain pour aligner mouvement humain complet, mouvement de référence du robot et observations éparses issues de dispositifs VR, un Transformer causal pour extraire une structure temporelle réutilisable à partir de trajectoires mélangées de plusieurs robots, et des modules légers spécifiques à chaque plateforme pour traduire cette représentation partagée vers la proprioception et l'espace d'action de chaque machine. Les auteurs rapportent des tests sur neuf embodiments simulés, des mouvements externes non vus à l'entraînement, et quatre robots réels. Pour l'industrie robotique, l'enjeu dépasse la prouesse technique : si l'entraînement croisé entre embodiments tient à l'échelle, il ouvre la voie à des modèles fondation de contrôle corps entier nourris par des flottes hétérogènes plutôt que par un seul robot à la fois, un goulot d'étranglement bien connu des fabricants qui peinent à collecter des données de téléopération en volume suffisant. Cela complèterait les modèles vision-langage-action comme Pi-0 ou GR00T N2, aujourd'hui centrés sur la manipulation, en s'attaquant cette fois au versant locomotion et équilibre, réputé plus contraint par les différences de cinématique et de dynamique entre robots. Les résultats restent toutefois ceux d'un article de recherche non encore relu par les pairs, validés majoritairement en simulation, avec seulement quatre plateformes physiques testées : rien n'indique à ce stade un déploiement industriel ni un produit commercialisable. Ce travail s'inscrit dans la lignée des modèles fondation pour la robotique lancée par les VLA de manipulation, à l'image de Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, mais transpose l'idée du transfert cross-robot au contrôle corps entier, un domaine où l'hétérogénéité des morphologies humanoïdes complique historiquement le partage de données d'apprentissage. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans l'article ; les auteurs présentent X-WBC comme une preuve de concept méthodologique, dont la confirmation passera par des essais sur davantage de plateformes physiques et par une revue par les pairs.

RecherchePaper
1 source
ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes
3arXiv cs.RO 

ReactiveBFM : planification de mouvement réactive en boucle fermée pour le contrôle global des humanoïdes

Des chercheurs ont publié le 30 juin 2026 sur arXiv (identifiant 2606.30362) les travaux ReactiveBFM, un framework de planification-contrôle en boucle fermée temps réel pour humanoïdes, validé sur le robot Unitree G1. L'approche atteint un taux de succès de 93,1 % lors de benchmarks sim-to-sim soumis à des perturbations sévères, surpassant de 28,6 points les baselines en boucle ouverte classiques. Le système permet notamment la poursuite de cibles mobiles en zero-shot, c'est-à-dire sans avoir été entraîné explicitement sur cette tâche, en mobilisant une coordination corps entier fluide et une replanification à la volée. Le verrou technique adressé est le problème dit d'exposition bias : quand un modèle génératif de planification de mouvement est naïvement chaîné avec un contrôleur d'exécution, les écarts de suivi s'accumulent jusqu'à provoquer des effondrements comportementaux. ReactiveBFM répond à cela via un curriculum d'échantillonnage par préfixe planifié (scheduled prefix sampling), qui force le planificateur à apprendre des comportements de récupération d'erreur à partir d'états physiques imparfaits plutôt que de trajectoires de référence idéales. Un second mécanisme d'asynchronisme découple la replanification autorégressive, lente, du tracking haute fréquence, tandis qu'un chunking de trajectoire assure la cohérence spatio-temporelle sans jitter physique. Pour les intégrateurs industriels et les équipes de recherche en contrôle humanoïde, cela valide une piste concrète pour rendre les Behavior Foundation Models (BFMs) exploitables hors conditions laboratoire. Les BFMs sont une classe émergente de modèles pré-entraînés qui fournissent des priors de contrôle pour humanoïdes, analogues aux LLMs pour le texte. Jusqu'ici, leur limitation majeure était l'exécution figée de mouvements pré-définis, sans adaptation à l'environnement. Le Unitree G1, humanoïde chinois à 16 000 dollars commercialisé depuis 2024, s'est imposé comme banc de test standard dans la recherche académique. Les concurrents directs sur le plan scientifique incluent les travaux autour de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) et les architectures VLA embarquées chez Figure et Agility Robotics. Ce papier reste à ce stade un preprint non évalué par les pairs : les résultats sim-to-sim sont prometteurs mais aucun déploiement industriel ni transfert sim-to-real robuste n'est encore démontré.

UELes techniques ReactiveBFM (curriculum de préfixe planifié, réplanification asynchrone, chunking de trajectoire) sont directement exploitables par les équipes R&D européennes travaillant sur les Behavior Foundation Models pour humanoïdes, mais aucun acteur français ou européen n'est impliqué dans ces travaux.

RechercheOpinion
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
4arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source