Aller au contenu principal
Co${}^{2}$Skill : contrôle du corps entier par composition de compétences pour l'interaction humain-environnement à long horizon
RecherchearXiv cs.RO 

Co${}^{2}$Skill : contrôle du corps entier par composition de compétences pour l'interaction humain-environnement à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.09291) Co²Skill, un contrôleur « whole-body » en simulation physique qui unifie deux capacités traitées jusqu'ici séparément : l'interaction avec la scène (s'asseoir, se lever, grimper, franchir des escaliers) et la manipulation dextre d'objets. Le système repose sur une politique unique, construite sur un a priori de mouvement préentraîné (motion prior). Des masques d'observation, dépendants de la tâche et de la phase en cours, sélectionnent l'information utile à chaque objectif. L'entraînement combine deux curriculums. Le premier, de loco-manipulation conditionnée par un but, associe un guidage partiel par trajectoires de référence, pour la précision, à une exploration depuis des états initiaux variés, ce qui autorise une exécution au-delà des démonstrations. Le second, inter-tâches, entraîne conjointement des compétences isolées et des séquences de tâches sélectionnées. Il préserve l'état physique d'une tâche à l'autre, par exemple en maintenant une prise pendant une interaction avec la scène. Les tests couvrent chaque compétence, leur enchaînement et des conditions aléatoires. Une démonstration de composition de compétences est aussi présentée dans des environnements intérieurs. Le résumé ne donne ni taux de réussite, ni nombre de degrés de liberté, ni durée de cycle.

L'intérêt tient à la jonction entre deux sous-domaines qui avancent en parallèle. D'un côté, les contrôleurs de personnages physiques savent produire des mouvements plausibles pour l'interaction avec la scène. De l'autre, la manipulation dextre est traitée à part, avec ses propres politiques. Un humanoïde utile en usine, en entrepôt ou à domicile doit pourtant porter un objet tout en montant une marche ou en s'asseyant, sans lâcher sa prise. La préservation de l'état physique entre les tâches vise précisément ce point, qui fait souvent échouer les enchaînements de compétences appris séparément. Pour un intégrateur, le résultat ne prouve rien sur le transfert vers un robot réel : il s'agit d'une évaluation en simulation, sans validation matérielle annoncée, donc l'écart sim-to-real reste entier. Les décideurs B2B doivent le lire comme une brique de recherche et non comme un produit ou un déploiement.

Le travail s'inscrit dans la lignée des contrôleurs physiques fondés sur des a priori de mouvement, nés de l'animation et de l'imitation de capture de mouvement, que la robotique humanoïde réutilise pour la locomotion et la manipulation. Il se situe en amont des modèles fondation pour humanoïdes, comme GR00T N2 de NVIDIA ou Helix de Figure, qui visent l'échelle par la donnée et le langage plutôt que par la composition explicite de compétences. Aucun partenaire industriel, calendrier de pilote ni code publié n'est mentionné dans le résumé. La suite logique serait une validation sur matériel, puis une comparaison avec les approches VLA sur des tâches longues, à vérifier dans le texte complet.

Dans nos dossiers

À lire aussi

MASkillBlender : coordination décentralisée du corps entier pour la loco-manipulation multi-humanoïdes par fusion de compétences
1arXiv cs.RO 

MASkillBlender : coordination décentralisée du corps entier pour la loco-manipulation multi-humanoïdes par fusion de compétences

Des chercheurs publient sur arXiv (2610.01102) MASkillBlender, un cadre d'apprentissage par renforcement multi-agent (MARL) destiné à la coordination décentralisée de plusieurs humanoïdes pour des tâches de locomanipulation, c'est-à-dire des tâches où les robots marchent et manipulent des objets en même temps. Le principe tient en deux étages. Des compétences de corps entier, pré-entraînées pour un humanoïde seul, servent de briques réutilisables. Une politique de haut niveau, partagée et décentralisée, apprend ensuite à les combiner à partir de récompenses au niveau de la tâche uniquement. Elle n'a besoin ni de trajectoires de référence propres à chaque tâche, ni de l'ingénierie de récompense lourde que demandent d'ordinaire les approches existantes. Les auteurs ajoutent une augmentation de données par permutation pour les systèmes homogènes. Elle exploite l'interchangeabilité des robots identiques. Ils démontrent aussi que les échantillons permutés conservent la direction du gradient de politique de l'échantillon d'origine dans le formalisme du jeu de Markov homogène. L'évaluation couvre plusieurs tâches de coordination et deux morphologies d'humanoïdes, uniquement en simulation. L'intérêt tient au verrou que visent les auteurs. Le contrôle corps entier d'un seul humanoïde progresse, mais le passage à plusieurs robots fait exploser la dimension de l'espace d'action, impose une prise de décision décentralisée et complique le passage à l'échelle. Réutiliser des compétences individuelles comme primitives, plutôt que d'apprendre chaque tâche coopérative de zéro, est une piste crédible pour déplacer des charges encombrantes à deux ou plus, ce qui concerne la logistique et la manutention. Les résultats sont pourtant limités. Ils portent sur la simulation, sans transfert sim-to-real, sans matériel réel et sans chiffres publiés dans le résumé (taux de réussite, nombre de robots, temps d'entraînement). La mention de performances « fortes » reste donc à vérifier dans l'article complet. Rien ne prouve non plus que les compétences mélangées tiendront face aux contacts, aux délais de communication et aux écarts de dynamique du monde réel. Ce travail relève de la recherche académique, pas d'un produit ni d'un déploiement. Le contexte est celui d'un champ qui s'est d'abord concentré sur la locomotion et la manipulation d'un humanoïde isolé, avec des politiques apprises en simulation puis transférées. La coordination multi-robots reposait souvent sur des conceptions spécifiques à chaque tâche ou sur des références de mouvement coûteuses à produire. MASkillBlender se rattache à cette lignée de travaux sur le mélange de compétences, qu'il étend au cadre multi-agent. Les acteurs industriels qui visent des flottes d'humanoïdes en entrepôt ou en usine misent surtout sur des modèles généralistes de type VLA et sur des déploiements monorobot. La coordination décentralisée de plusieurs humanoïdes reste, elle, peu abordée publiquement. Les prochaines étapes à surveiller sont la validation sur robots physiques, le passage à davantage d'agents et une comparaison chiffrée avec les méthodes centralisées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
BAT : concilier agilité et stabilité par commutation de politiques en ligne pour le contrôle du corps entier d'un robot humanoïde sur de longs horizons
2arXiv cs.RO 

BAT : concilier agilité et stabilité par commutation de politiques en ligne pour le contrôle du corps entier d'un robot humanoïde sur de longs horizons

Des chercheurs proposent BAT, un cadre de commutation de politiques en ligne pour le contrôle du corps entier d'humanoïdes sur de longs enchaînements de mouvements. Le travail, publié sur arXiv (2604.01064, version 2), part d'un constat : les approches existantes suivent deux paradigmes. Les politiques couplées coordonnent tout le corps de façon globale, tandis que les politiques découplées traitent chaque module séparément pour gagner en précision. BAT choisit dynamiquement entre deux contrôleurs généralistes entraînés par apprentissage par renforcement, l'un couplé et l'autre découplé, selon le contexte du mouvement en cours. Deux prédicteurs de commutation travaillent en parallèle. OpVQ-VAE s'appuie sur des « tokens » de mouvement et généralise bien. OpHRL est un prédicteur en boucle fermée qui tient compte de l'état du robot. Un routeur de familiarité des tokens (Token-Familiarity Router) arbitre lorsque les deux divergent : il privilégie OpHRL pour les séquences de tokens connues et OpVQ-VAE pour les séquences inédites. Les auteurs annoncent 85,2 % de réussite sur des combinaisons de mouvements longues déjà vues à l'entraînement, et 71,3 % sur des mouvements jamais rencontrés. Ils rapportent aussi de meilleurs résultats que les contrôleurs corps entier existants sur les mouvements pris isolément, ainsi qu'un déploiement zéro-shot sur le Unitree G1. L'intérêt pratique tient au compromis que les équipes rencontrent sans cesse. Une politique couplée donne des gestes dynamiques et agiles, comme des sauts ou des mouvements amples, mais elle perd en précision. Une politique découplée manipule ou positionne mieux, mais elle devient moins robuste quand le mouvement exige une coordination globale. Plutôt que de chercher un contrôleur unique qui concilie tout, BAT montre qu'on peut combiner des spécialistes et basculer entre eux à l'exécution. Le point à surveiller est l'écart entre mouvements vus et inédits : 85,2 % contre 71,3 %, soit près de 14 points perdus, ce qui reste loin de la fiabilité attendue en production. Ces chiffres viennent de benchmarks de recherche, sans durée de tâche, nombre d'essais ni conditions détaillés dans le résumé. Le transfert zéro-shot sur G1 est encourageant, mais rien ne dit qu'il couvre toute la distribution de mouvements testée en simulation. Ce travail s'inscrit dans la vague des contrôleurs généralistes corps entier pour humanoïdes, nourrie par l'apprentissage par renforcement en simulation et l'imitation de mouvements humains. Le Unitree G1, peu coûteux et très répandu dans les laboratoires, sert désormais de plateforme de référence pour valider ces méthodes. Les auteurs ne se positionnent pas ici face aux modèles VLA commerciaux (Figure, Tesla, NVIDIA), car BAT agit à la couche basse de contrôle, pas au niveau du raisonnement ou de la planification. Cette couche reste pourtant un goulot d'étranglement pour passer des démonstrations à des tâches longues et enchaînées. La version 2 laisse penser que l'article a été révisé après relecture. Les suites logiques seraient des tests sur d'autres plateformes, des tâches de manipulation plus longues et une mesure de la robustesse hors laboratoire. Aucun calendrier de déploiement industriel n'est annoncé.

RecherchePaper
1 source
KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde
3arXiv cs.RO 

KINO : une interface à images-clés pour la planification par VLM et le contrôle du corps entier en loco-manipulation humanoïde

Des chercheurs présentent KINO (arXiv:2609.18869v1), un framework hiérarchique pour la loco-manipulation de robots humanoïdes qui insère des « keyframes » de mouvement comme représentation intermédiaire entre un modèle vision-langage (VLM) chargé de la planification et un contrôleur par renforcement (RL) chargé de l'exécution corps entier. Chaque keyframe encode une pose cible pour l'ensemble du corps du robot et, si nécessaire, la pose de l'objet manipulé. À partir d'une instruction en langage naturel, d'observations de la scène et d'un retour d'exécution, le VLM sélectionne successivement des keyframes pertinentes dans une bibliothèque prédéfinie ; ces keyframes sont ensuite réajustées à la scène courante pour tenir compte de la position et des dimensions des objets, avant qu'une politique conditionnée par keyframe ne génère les actions articulaires. Les auteurs introduisent une stratégie d'échantillonnage de keyframes basée sur la saillance pour l'entraînement de la politique bas niveau, qui fait passer le taux de réussite de bout en bout de 44 % à 92 % lorsque le VLM ne fournit que des keyframes éparses. Le système a été évalué sur des tâches de prise, transport et dépose d'objets, en simulation et sur un humanoïde Unitree G1, avec manipulation à une et deux mains. Ce résultat s'inscrit dans un débat central du secteur robotique : comment relier des modèles vision-langage capables de raisonner sur des instructions abstraites à des contrôleurs bas niveau capables de produire des mouvements corps entier stables. Plutôt que de miser sur une architecture VLA (vision-language-action) de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, KINO mise sur une représentation intermédiaire discrète et interprétable, ce qui pourrait faciliter le débogage et le contrôle qualité pour des intégrateurs industriels tout en limitant la fréquence des appels au VLM, coûteux en calcul. Le saut de 44 % à 92 % de succès reste toutefois une mesure obtenue en conditions contrôlées de recherche, pas un chiffre de déploiement industriel, et mériterait d'être confirmé sur des tâches plus variées. Le travail s'inscrit dans la vague de recherches académiques cherchant à rendre les humanoïdes capables de manipulation généraliste sans réentraînement massif pour chaque nouvelle scène, un axe exploré en parallèle par les architectures VLA de Physical Intelligence, NVIDIA ou Figure. Le choix du Unitree G1, plateforme humanoïde accessible et déjà utilisée dans de nombreux laboratoires, en fait un banc d'essai plutôt qu'un produit fini : aucun partenariat industriel ni calendrier de commercialisation n'est mentionné dans l'article. Les auteurs indiquent que le système généralise à des emplacements de dépose non vus pendant l'entraînement, un point clé pour juger de sa robustesse au-delà des démonstrations sélectionnées, mais le nombre d'essais et les conditions exactes de ces tests de généralisation ne sont pas précisés.

RecherchePaper
1 source
4arXiv cs.RO 

Compétences de manipulation à très long horizon en robotique grâce à la génération de code continue guidée par l'humain

Des chercheurs proposent LYRA, un cadre de génération de code robotique qui apprend des compétences de manière continue à partir des retours humains. Il vise les tâches de manipulation dites « ultra-longues », où l'enchaînement d'actions dépasse ce qu'un grand modèle de langage (LLM) sait produire de façon fiable en une seule passe. Le système distille chaque correction humaine en compétences modulaires et réutilisables, puis étend leurs fonctionnalités au fil des interactions sans écraser les comportements déjà acquis. Une mémoire externe stocke ces compétences et des exemples d'exécution. Une récupération augmentée (RAG) sélectionne les connaissances pertinentes pour chaque tâche. Quand cette récupération ne suffit pas, l'utilisateur donne un indice pour orienter la réutilisation. Les auteurs annoncent un taux de succès de 0,93, jusqu'à 27 % au-dessus des méthodes de référence, et un gain de 42 % en efficacité de correction, c'est-à-dire en nombre d'interventions humaines nécessaires. Les tests couvrent les benchmarks Ravens, Franka Kitchen, LIBERO-long et MetaWorld, ainsi que des tâches en conditions réelles. LYRA réussit notamment la tâche « construire une maison », qui exige de planifier plus de 20 primitives. Ce travail s'attaque à un point faible connu de la robotique pilotée par LLM. Les modèles traduisent bien une consigne en code, mais l'ambiguïté des instructions, le bruit des générations et la fenêtre de contexte limitée rendent les longues séquences peu fiables. Les boucles fermées qui reposent seulement sur le retour d'un LLM ne règlent pas le problème, car ces modèles raisonnent mal sur l'état physique d'un robot, même quand l'erreur saute aux yeux d'un humain. L'intérêt pour un intégrateur est concret : plutôt que de réentraîner un modèle ou de réécrire des prompts à chaque correction, l'opérateur enrichit une bibliothèque de compétences qui se transmet d'une tâche à l'autre. Cela limite l'oubli catastrophique, fréquent quand les retours s'accumulent dans des représentations qui généralisent mal. L'approche est une alternative à bas coût aux modèles vision-langage-action (VLA) entraînés de bout en bout, mais elle déplace la charge vers l'humain dans la boucle. Les résultats sont à lire avec prudence : il s'agit d'un preprint sans validation par les pairs. Les benchmarks sont en grande partie simulés. L'article ne donne pas de temps de cycle, de robot industriel ni de volume de déploiement. Le gain de 27 % est relatif aux méthodes de référence choisies par les auteurs. Le papier arrive en version 3 sur arXiv (2509.18597), ce qui indique plusieurs cycles de révision depuis la première soumission de septembre 2025. Il s'inscrit dans la lignée des approches de génération de code pour la robotique, comme Code as Policies, qui font du LLM un planificateur écrivant des appels à des primitives. Il s'oppose à la voie des VLA généralistes (Pi-0, GR00T, Helix), qui encodent la compétence dans les poids du modèle. Aucun partenaire industriel, calendrier de pilote ni publication de code n'est mentionné dans le résumé. La suite logique serait un test sur bras industriels avec des opérateurs non experts, et une mesure de la façon dont la bibliothèque de compétences se comporte à grande échelle, quand la récupération doit trier des centaines de compétences.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source