Aller au contenu principal
Robot humanoïde : transfert de mouvement corporel complet à grande échelle via un recalage cinéodynamique implicite
RecherchearXiv cs.RO 

Robot humanoïde : transfert de mouvement corporel complet à grande échelle via un recalage cinéodynamique implicite

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent IKMR (Implicit Kinodynamic Motion Retargeting), un pipeline neuronal conçu pour transférer des mouvements humains complets vers des robots humanoïdes à très grande échelle. Le système repose sur un autoencodeur double à convolution de graphes basé sur le squelette, qui projette les configurations cinématiques humaines et robotiques, structurellement différentes, dans un espace latent topologique commun. Une phase de raffinement physique vient ensuite corriger les trajectoires grâce à un retour de suivi physique simulé, garantissant leur viabilité mécanique. Résultat clé : un débit de conversion de données dépassant 5000 images par seconde, un ordre de grandeur inatteignable avec les méthodes classiques d'optimisation numérique image par image. Les auteurs rapportent aussi des déploiements réels de contrôle corps entier sur robot humanoïde pour valider l'approche au-delà de la simulation.

L'enjeu dépasse la prouesse technique. L'apprentissage par imitation humain-vers-humanoïde est vu comme une des voies les plus prometteuses pour contourner la pénurie de données d'entraînement en robotique, en exploitant les vastes corpus de mouvement humain déjà disponibles (vidéos, capture de mouvement, modèles génératifs). Mais ces données brutes sont bruitées, saccadées, sujettes au scintillement image par image, des défauts qui, une fois amplifiés par le retargeting classique, peuvent produire des mouvements physiquement dangereux pour le matériel. En traitant le nettoyage du bruit comme un sous-produit implicite de l'apprentissage plutôt qu'une étape séparée, et en déplaçant le coût de calcul vers l'inférence hors ligne, IKMR lève un goulot d'étranglement pratique pour quiconque veut synthétiser des jeux de données massifs de mouvements humanoïdes exploitables sans validation manuelle intensive.

Ce travail, publié en version révisée sur arXiv, s'inscrit dans une dynamique de recherche plus large où plusieurs laboratoires cherchent à automatiser et industrialiser la conversion de données de mouvement humain en données d'entraînement robotique, un préalable identifié pour faire progresser les politiques de contrôle corps entier de type VLA (vision-language-action) utilisées par les plateformes humanoïdes actuelles. Les auteurs ne précisent pas de partenariat industriel ni de plateforme robotique commerciale associée à cette publication.

Dans nos dossiers

À lire aussi

CoMo : apprendre le mouvement latent continu depuis des vidéos internet pour un apprentissage robotique à grande échelle
1arXiv cs.RO 

CoMo : apprendre le mouvement latent continu depuis des vidéos internet pour un apprentissage robotique à grande échelle

Des chercheurs ont publié sur arXiv (référence 2505.17006, version 3) une méthode baptisée CoMo, pour "Continuous Motion", conçue pour extraire automatiquement des représentations continues du mouvement à partir de vidéos issues d'Internet, et les réutiliser comme étiquettes d'action pour entraîner des politiques robotiques. CoMo repose sur deux mécanismes distincts : une différence temporelle précoce (Td) appliquée en amont de l'encodeur pour rendre plus difficile l'apprentissage par raccourcis visuels (les modèles ont tendance à coder l'arrière-plan statique plutôt que le mouvement lui-même), et un apprentissage contrastif temporel (Tcl) qui construit des paires positives avec un décalage temporel réduit vers le futur, et des paires négatives en inversant la direction du temps. Le résultat est un espace latent continu, entraîné sur des vidéos à grande échelle, capable de générer des pseudo-étiquettes d'action pour des vidéos jamais vues en phase d'inférence. Des expériences en simulation et en conditions réelles montrent des gains de performance par rapport aux approches discrètes, aussi bien avec des architectures diffusion que autorégressives. L'enjeu industriel est direct : l'un des goulots d'étranglement du robot learning est la rareté des démonstrations téléopérées, coûteuses à collecter. Si une méthode peut extraire un signal d'action utilisable depuis des vidéos YouTube ou des caméras industrielles non étiquetées, elle réduit mécaniquement le coût de constitution des datasets. La contribution principale de CoMo face aux méthodes discrètes par quantification vectorielle (VQ) est de supprimer la perte d'information liée à la projection dans un codebook de petite taille, et surtout de combler le fossé de distribution entre un espace discret de tokens visuels et un espace d'actions continues à valeurs réelles, fossé qui pénalise l'apprentissage conjoint d'une politique unifiée. La généralisation zéro-shot annoncée est la prétention la plus forte : elle signifie que CoMo pourrait étiqueter des vidéos de nouveaux environnements ou tâches sans ré-entraînement, ce qui reste à valider sur des benchmarks standardisés ; l'abstract ne cite pas de métriques numériques précises. Ce travail s'inscrit dans un axe de recherche très actif depuis 2023, qui cherche à exploiter Internet comme source de supervision pour les robots, aux côtés de méthodes comme RT-2 de Google DeepMind, Pi-0 de Physical Intelligence, ou encore les travaux sur les VLA (Vision-Language-Action models) d'UC Berkeley et du MIT. Les approches discrètes concurrentes (type GROOT ou méthodes VQ-VAE appliquées à la vidéo) souffrent précisément des limitations que CoMo prétend résoudre. La prochaine étape naturelle serait une validation sur des benchmarks robotiques communautaires comme RLBench, LIBERO ou BridgeData V2, et un test à l'échelle de données réellement "internet-scale" pour confirmer si la généralisation zéro-shot tient face à la diversité des distributions visuelles du monde réel.

RecherchePaper
1 source
Contrôle du mouvement corporel complet de l'humanoïde tenant compte des collisions sous trajectoires cibles imparfaites
2arXiv cs.RO 

Contrôle du mouvement corporel complet de l'humanoïde tenant compte des collisions sous trajectoires cibles imparfaites

RECAL (Robot-Environment Cross-Attention Layer) est un module qui vient se greffer sur les contrôleurs corps-entier (whole-body controllers, WBC) des robots humanoïdes, décrit dans un preprint mis en ligne le 16 septembre 2026 sur arXiv (2609.16405). Le problème visé : la plupart des WBC suivent des cibles de mouvement sans percevoir la géométrie de la scène, ce qui provoque des collisions quand les commandes issues de la perception, de la planification ou de la téléopération sont imparfaites. RECAL encode le robot, les objets tenus et l'environnement sous forme de nuages de points, puis applique une attention croisée entre les points du robot/objet et ceux de l'environnement pour produire des variables de contrôle sensibles à la géométrie, arbitrant en continu entre suivi de trajectoire et évitement de collision. Le système gère aussi bien des commandes de base flottante que d'organe terminal, y compris l'évitement de collision pour des objets portés. Les auteurs le valident en simulation sur des scénarios de locomotion à bras figé ou adaptatif, de transport d'objets et de manipulation en position debout, puis le démontrent sur un humanoïde Digit V3 réel, la plateforme bipède d'Agility Robotics. Le résultat cible un angle mort connu des piles de contrôle humanoïdes actuelles : la sécurité géométrique est en général traitée en amont, au niveau de la planification, plutôt qu'à l'exécution, ce qui laisse une marge d'erreur dangereuse quand la perception ou la téléopération se trompe. En intégrant une correction géométrique directement dans la boucle de contrôle bas niveau, RECAL répond à un besoin concret des intégrateurs qui veulent déployer des humanoïdes dans des environnements encombrés, entrepôts ou lignes d'assemblage, sans multiplier les zones d'exclusion statiques. La démonstration sur robot réel, et pas seulement en simulation, compte dans le débat récurrent du secteur sur l'écart entre démonstration et réalité : elle suggère qu'un contrôle sensible à la géométrie par nuages de points peut transférer du simulateur au matériel physique sans réentraînement massif, un point de friction classique pour les architectures apprises. Les WBC restent le cœur de la plupart des piles de contrôle humanoïde, de Digit (Agility Robotics) à Optimus (Tesla) en passant par G1 et H1 (Unitree) ou Figure 03, mais ils ont historiquement été conçus pour l'équilibre et le suivi de trajectoire, pas pour la perception de scène, tâche généralement déléguée à des modules de planification séparés ou, plus récemment, à des architectures vision-langage-action comme Pi-0 ou GR00T N2. RECAL se positionne comme une alternative modulaire à ces approches de bout en bout : il laisse un WBC classique inchangé et lui ajoute une couche de sécurité géométrique. Le travail reste au stade preprint, sans revue par les pairs ni annonce de déploiement industriel ou de partenariat constructeur ; les auteurs ne donnent pas de calendrier de transfert vers un produit commercial, ce qui en fait pour l'instant une contribution de recherche et non une brique prête pour la production.

RecherchePaper
1 source
Améliorer le transfert sim-vers-réel des robots à commande de couple via l'estimation dynamique réel-vers-sim et l'apprentissage par renforcement
3arXiv cs.RO 

Améliorer le transfert sim-vers-réel des robots à commande de couple via l'estimation dynamique réel-vers-sim et l'apprentissage par renforcement

Une équipe de recherche a publié en août 2026 sur arXiv (2608.22629) un pipeline nommé Real2Sim2Real pour améliorer le transfert simulation-réel de politiques d'apprentissage par renforcement sur des bras robotiques pilotés en couple. Testé sur le Franka Emika Panda, bras à 7 degrés de liberté du fabricant allemand Franka Emika, le système identifie d'abord les paramètres réels de friction, d'inertie et de compensation de gravité en minimisant l'écart entre trajectoires articulaires réelles et simulées, les optimise par algorithme génétique, puis entraîne en simulation un agent TQC (Truncated Quantile Critics) avec randomisation de domaine. La politique est validée dans les simulateurs Gazebo et MuJoCo avant déploiement sur le robot physique pour des tâches d'atteinte de cible. Les auteurs rapportent une nette amélioration de la précision de suivi et de la robustesse une fois les paramètres calibrés, avec un transfert jugé fluide vers le monde réel. Le contrôle en couple reste l'un des points durs du sim-to-real : une erreur de modélisation dynamique, même mineure, peut rendre un bras réel instable ou dangereux, contrairement au contrôle en position. En calibrant le simulateur sur des données physiques mesurées avant l'entraînement, plutôt qu'en misant sur une randomisation aveugle des paramètres, cette approche real2sim intéresse directement les intégrateurs travaillant sur des tâches de préhension fine ou d'assemblage sous contrôle de force, et appuie l'idée que le fossé simulation-réalité se réduit surtout par une modélisation physique rigoureuse. Les résultats portent cependant sur des tâches d'atteinte de cible simples et un seul bras : une preuve de concept académique, pas un déploiement industriel validé. Le Franka Emika Panda, dérivé des travaux du centre aérospatial allemand DLR et commercialisé depuis 2017, s'est imposé en recherche robotique grâce à sa mesure native de couple articulaire, rare à ce niveau de prix. Le pipeline real2sim2real prolonge une lignée de travaux qui, depuis les premières démonstrations de manipulation par randomisation de domaine à la fin des années 2010, cherchent à réduire la dépendance à un volume massif de simulations en misant sur la fidélité du modèle physique. L'article, publié en preprint non relu par les pairs, ne précise ni calendrier de suivi ni extension annoncée à d'autres plateformes.

UELe bras utilisé, le Franka Emika Panda, est fabriqué par l'allemand Franka Emika et largement déployé dans les laboratoires de robotique européens, ce qui rend ce pipeline directement testable par les équipes de recherche et d'intégration en France et en UE.

RecherchePaper
1 source
Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut
4arXiv cs.RO 

Robotique évoluée : améliorer l'efficacité humaine dans le post-entraînement de robots à grande échelle via un pipeline guidé par VLAC-Cut

Les chercheurs à l'origine de ce rapport technique publié sur arXiv proposent un nouveau pipeline pour l'entraînement post-hoc des modèles Vision Language Action (VLA), ces systèmes qui permettent à un robot de traduire une consigne en langage naturel en actions physiques. Le constat de départ est simple: un seul cycle de collecte de données ne suffit jamais à corriger toutes les faiblesses d'un modèle, ce qui impose plusieurs rounds successifs de réentraînement. L'équipe organise le travail humain autour de deux rôles distincts, un téléopérateur formé qui intervient à distance uniquement sur les cas à forte valeur ajoutée et les démonstrations de récupération après échec, et un opérateur de terrain qui surveille plusieurs robots simultanément, déclenche les prises de contrôle et effectue les réinitialisations physiques. À cela s'ajoute VLAC CUT, un outil de curation automatique qui découpe les trajectoires autonomes des robots en segments utiles, en distinguant les portions qui font progresser la tâche, les phases d'inactivité, celles qui provoquent l'échec et celles de récupération, pour ne conserver que les données exploitables. Sur quatre tâches réelles de manipulation, les politiques finales atteignent entre 80 et 95% de taux de réussite et multiplient le débit de tâches par 1,7 à 4,2 par rapport au modèle de base. L'enjeu ici est économique autant que technique. Le vrai goulot d'étranglement du déploiement des VLA à grande échelle n'est pas la puissance de calcul mais le coût du travail humain de supervision et de téléopération, un point sensible pour toute l'industrie robotique qui vise la commercialisation de flottes de robots manipulateurs ou humanoïdes. En montrant qu'une réutilisation intelligente des trajectoires autonomes, combinée à une supervision humaine mieux répartie, surpasse un entraînement reposant uniquement sur l'humain dans la boucle à budget d'intervention égal, ce travail apporte un argument concret dans le débat sur la viabilité économique des VLA déployés en usine ou en entrepôt. Ce rapport s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation et le human-in-the-loop pour les VLA, où la collecte de démonstrations reste le principal poste de coût. Aucun partenaire industriel ni plateforme robotique spécifique n'est nommé dans cette publication académique, qui reste à ce stade validée sur un nombre restreint de tâches en laboratoire, sans indication de calendrier vers un déploiement à plus grande échelle.

RechercheActu
1 source