Aller au contenu principal
LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme
RecherchearXiv cs.RO 

LUCID : contrôle unifié des compétences latentes via une dynamique imaginée pour la loco-manipulation humanoïde à long terme

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire de recherche à l'origine du papier arXiv:2608.07746v1 (soumis en catégorie cross-listing, daté d'août 2026) présente LUCID, acronyme de "Latent-Skill Unified Control via Imagined Dynamics", un framework d'apprentissage par renforcement hiérarchique et basé sur un modèle du monde, destiné aux tâches de loco-manipulation humanoïde longue durée. La méthode se déroule en deux temps : une politique bas niveau, conditionnée par des codes latents structurés, est d'abord entraînée par imitation adversariale puis gelée ; un modèle de dynamique de haut niveau ("macro-dynamics world model") est ensuite appris conjointement avec une politique de décision, ce modèle prédisant les transitions d'état à horizon étendu induites par chaque décision latente, ce qui permet d'optimiser la politique haut niveau via des simulations imaginées plutôt que par essais réels. Les auteurs évaluent LUCID sur des scénarios simulés de réarrangement multi-objets et rapportent une amélioration du taux de réussite complète des tâches ainsi que des taux de complétion partielle, comparés à des méthodes de référence combinant planificateurs scriptés, automates à états finis ou politiques model-free spécifiques à une tâche.

Le problème visé est celui de la coordination longue durée chez les robots humanoïdes : enchaîner marche, atteinte et préhension sur des séquences complexes sans dépendre d'automates codés à la main, un goulot d'étranglement que les démonstrations courtes de nombreux acteurs du secteur (modèles VLA type Pi-0, GR00T N2 ou Helix) laissent souvent dans l'ombre. En remplaçant la planification scriptée par un modèle du monde appris, capable de projeter les conséquences de décisions latentes avant de les exécuter, LUCID propose une alternative architecturale aux pipelines VLA end-to-end dominants, ce qui intéresse directement les intégrateurs cherchant à fiabiliser des tâches multi-étapes en logistique ou en usine plutôt qu'à empiler des démonstrations isolées.

Il s'agit toutefois d'une contribution strictement académique et simulée : aucun robot physique, aucune entreprise ni aucun site de déploiement n'est mentionné dans l'abstract, et les gains rapportés portent uniquement sur des environnements de simulation de réarrangement d'objets, sans chiffres de charge utile, de degrés de liberté ou de temps de cycle réels. LUCID s'inscrit dans la lignée des travaux sur les modèles du monde appliqués à la robotique (dans l'esprit de Dreamer ou TD-MPC), en offrant une voie hiérarchique et modulaire face à l'approche monolithique des modèles VLA. Aucun essai matériel, partenariat industriel ou calendrier de transfert vers un robot réel n'est annoncé à ce stade.

À lire aussi

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
1arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source
ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier
2arXiv cs.RO 

ULTRA : contrôle multimodal unifié pour la loco-manipulation humanoïde autonome du corps entier

Une équipe de recherche présente ULTRA, un framework unifié pour le contrôle autonome de la loco-manipulation du corps entier chez les humanoïdes, publié en version révisée sur arXiv (2603.03279v2). Le système combine un algorithme de retargeting neuronal guidé par la physique, qui transpose des captures de mouvement à grande échelle vers la morphologie du robot en préservant la plausibilité physique des contacts, et un contrôleur multimodal unique traitant références denses et consignes de tâches éparses, à partir d'un état précis ou d'une vision égocentrique bruitée. La méthode distille une politique de suivi universelle, compresse les compétences motrices dans un espace latent compact, puis l'affine par apprentissage par renforcement pour améliorer la robustesse hors distribution. ULTRA a été validé en simulation et sur un robot humanoïde réel Unitree G1. L'apport central est de faire passer le contrôle humanoïde du suivi de trajectoires prédéfinies à une génération de comportement pilotée par la perception et des objectifs de haut niveau, sans référence de mouvement au moment du test, un verrou connu du secteur qui tient à la rareté des données de retargeting et à la couverture limitée des répertoires de compétences. En obtenant un comportement coordonné du corps entier à partir d'une intention éparse et d'une perception embarquée seule, sur matériel réel et pas seulement en simulation, les auteurs apportent un élément factuel au débat sur l'écart entre démonstrations scriptées et autonomie réelle, avec des résultats supérieurs aux méthodes de suivi pur à répertoire limité, un signal utile pour intégrateurs et laboratoires. Ce travail s'inscrit dans la lignée des contrôleurs de suivi par imitation pour humanoïdes, dont les limites sont pointées par les auteurs: données retargetées rares, difficulté à passer à l'échelle, dépendance à des références figées. ULTRA cherche à lever ce verrou en unifiant imitation à grande échelle et apprentissage par renforcement dans un seul contrôleur, validé sur Unitree G1, plateforme de recherche courante dans les laboratoires travaillant sur la loco-manipulation humanoïde. L'article ne précise ni affiliation institutionnelle ni calendrier de déploiement industriel: il s'agit d'une contribution de recherche, à comparer aux prochaines générations de contrôleurs généralistes pour humanoïdes plutôt qu'à un produit commercial.

RecherchePaper
1 source
MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
3arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable
4arXiv cs.RO 

OmniContact : enchaînement de méta-compétences par flux de contact pour la loco-manipulation humanoïde généralisable

Des chercheurs ont publié le 26 juin 2026 sur arXiv (réf. 2606.26201) un framework hiérarchique baptisé OmniContact, conçu pour enchaîner des séquences complexes de locomotion et manipulation sur des humanoïdes. Le coeur du système est une représentation intermédiaire appelée "contact flow" (CF): trajectoires corporelles clés et signaux binaires de contact en série temporelle. Deux modules s'appuient dessus, CF-Track (politique bas-niveau, bibliothèque de compétences unifiée) et CF-Gen (planificateur haut-niveau heuristique qui synthétise les séquences futures). En simulation, les résultats annoncés atteignent 98,7% de succès sur la tâche "Carry Box" et 76,5% sur "Push-Stack Boxes", soit respectivement +40,9% et +66,5% face aux baselines sur l'exécution de méta-compétences et leur enchaînement. Le dataset OmniContact, constitué via capture de mouvement (MoCap) d'interactions humain-objet, supporte l'entraînement. Le vrai défi des humanoïdes industriels n'est pas l'exécution d'un geste unitaire mais l'enchaînement robuste de séquences longues avec récupération autonome en cas de défaillance, ce verrou précis que OmniContact cible. Le système propose une interface structurée lisible par le planificateur haut-niveau, une voie médiane entre représentations explicites trop rigides pour la planification et embeddings implicites trop opaques pour la composition fiable. L'intégration avec des VLMs (Vision-Language Models) permettrait des instructions en langage naturel converties en séquences de contact flows, comme l'illustre la démonstration d'arrangement de boîtes en forme de coeur. Nuance importante: toutes les métriques publiées sont issues de conditions contrôlées en laboratoire, sans validation sur hardware physique ni déploiement industriel réel, ce qui laisse entier le problème du sim-to-real. La loco-manipulation longue horizon est devenu le benchmark officieux du secteur humanoïde en 2025-2026. Figure AI (Figure 03), Tesla (Optimus Gen 3), Physical Intelligence (pi0) et Boston Dynamics s'affrontent sur des tâches de plus en plus généralisables, tandis que NVIDIA pousse GR00T N2 comme couche de policy universelle. OmniContact vient du monde académique, sans entreprise identifiée derrière ce preprint, mais son approche par contact flow s'inscrit dans la tendance des représentations intermédiaires structurées, en parallèle des architectures VLA à diffusion. La collecte MoCap dédiée aux interactions humain-objet sur humanoïdes confirme que les données de référence restent un goulot d'étranglement même quand la simulation abonde. La prochaine étape déterminante sera le transfert sur un humanoïde physique, condition sine qua non pour que ce framework passe du laboratoire au hangar.

RecherchePaper
1 source