Aller au contenu principal
RecherchearXiv cs.RO 

KungfuAthleteBot : apprendre des mouvements humanoïdes très dynamiques à partir de vidéos, avec une récupération robuste unifiée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient KungfuAthleteBot (KAB), un cadre d'apprentissage qui fait acquérir à un robot humanoïde des mouvements très dynamiques à partir de vidéos. Les auteurs ont constitué le jeu de données KungfuAthlete à partir de vidéos d'artistes martiaux de niveau national. Ils y appliquent une correction de trajectoire parabolique guidée par la physique. Elle supprime trois défauts de la reconstruction vidéo dans les phases aériennes et d'atterrissage : flottement en hauteur, pénétration du sol et vibrations haute fréquence. Ils introduisent ensuite un échantillonnage dit « pseudo-LKE » (low kinetic energy, faible énergie cinétique), qui oriente l'initialisation de l'entraînement vers des états dynamiquement faisables. Enfin, la récupération après perturbation et après chute est apprise dans la même politique que le suivi du mouvement vidéo. Cette approche n'exige ni données de référence de récupération ni bascule manuelle entre modes. Sur un robot humanoïde, les auteurs rapportent une récupération après des chutes arbitraires en environ 0,7 s. Ils la présentent comme la plus rapide publiée pour une politique unifiée. Le robot utilisé et le détail des conditions d'essai ne figurent pas dans le résumé de l'étude (preprint arXiv 2610.03388, non évalué par des pairs).

L'intérêt tient au diagnostic plus qu'au record. La vidéo est une source de mouvement abondante et bon marché, mais reciblage direct d'une trajectoire reconstruite ne suffit pas. Elle est physiquement incohérente, ne contient aucune information de couple ou de force, et ne dit rien des échecs. Suivre strictement une telle référence est dynamiquement irréalisable, et une initialisation guidée par l'erreur relance sans cesse la politique depuis des poses aériennes impossibles. Les ablations indiquent que réparer et compenser les données vidéo compte plus que d'en accumuler davantage. Cette conclusion nuance la tendance à tout miser sur le volume de données pour les politiques de mouvement du corps entier. Pour un intégrateur, la fusion du suivi et de la récupération dans un seul réseau simplifie l'architecture de contrôle et réduit les transitions fragiles entre contrôleurs. Les réserves habituelles s'appliquent toutefois : le résultat vient d'un laboratoire, et le résumé ne donne ni taux de réussite ni nombre d'essais. Le chiffre de 0,7 s dépend aussi de la définition de la « récupération » et de la posture initiale de chute, que le résumé ne précise pas.

Ces travaux s'inscrivent dans la série de méthodes qui apprennent à des humanoïdes des mouvements humains par suivi de référence en simulation, puis par transfert vers le robot réel. Des approches comme DeepMimic, puis les politiques de suivi du corps entier, ont popularisé cette logique. La difficulté restait le passage de mouvements capturés en studio à des mouvements acrobatiques extraits de vidéos. Les gestes de kung-fu, avec sauts et réceptions, sont un banc d'essai exigeant pour cette question. Les prochaines étapes à surveiller sont la publication du code et du jeu de données, la validation sur plusieurs plateformes et la mesure de la robustesse hors laboratoire. Aucun déploiement industriel ni produit n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée
1arXiv cs.RO 

Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée

Des chercheurs proposent TRACC (Track-and-Complete), un pipeline qui permet à un humanoïde d'apprendre une compétence à partir d'une seule vidéo d'humain en situation d'échec, sans aucune démonstration réussie. La méthode se déroule en deux temps. Elle imite d'abord la partie exploitable de la trajectoire, c'est-à-dire le préfixe de mouvement observé avant que la tentative ne tourne mal. Elle infère ensuite le résultat visé par la tâche, puis utilise une récompense d'accomplissement pour que la politique apprenne à finir le travail après le point de rupture. Le préfixe sert d'a priori jusqu'à l'échec, la récompense prend le relais ensuite. L'évaluation porte sur six tâches humaines « in the wild » en échec, tirées du jeu de données Oops!, une collection de vidéos amateurs de ratés. L'étude est publiée sur arXiv (2609.36924v1) et présente des résultats jugés positifs par les auteurs. Le résumé ne donne ni taux de réussite, ni comparaison chiffrée, ni précision sur le robot utilisé ou sur un éventuel transfert vers du matériel réel. L'intérêt tient au coût de la donnée. L'apprentissage de compétences humanoïdes par imitation vidéo suppose en général une démonstration réussie, souvent collectée sur mesure : téléopération, capture de mouvement ou scènes scriptées. Or le web regorge de tentatives ratées, que la robotique traite d'ordinaire comme de simples exemples négatifs. Si l'approche tient à plus grande échelle, un corpus jusque-là écarté devient une source de supervision, ce qui réduit le goulot d'étranglement des données que rencontrent les acteurs des politiques généralistes de type VLA. Une réserve s'impose toutefois. Six tâches sont un échantillon très mince, et la robustesse de l'inférence du but à partir d'une vidéo ambiguë reste à démontrer. Le résumé ne dit pas non plus si l'apprentissage se fait uniquement en simulation. La question du passage au réel, le fameux sim-to-real, n'est pas tranchée par ce texte. Ce travail s'inscrit dans un mouvement plus large de retargeting de mouvements humains vers des humanoïdes et d'apprentissage par renforcement guidé par vidéo, où la plupart des méthodes supposent des démonstrations propres. Les grands acteurs de la course humanoïde, de Figure à Tesla avec Optimus, en passant par les modèles fondation comme Pi-0 ou GR00T, misent surtout sur la téléopération et la simulation à grande échelle pour alimenter leurs politiques. TRACC propose une voie complémentaire, moins coûteuse en collecte, qui reste académique et sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont l'extension à davantage de tâches et de morphologies, la validation sur robot physique et la confrontation avec des méthodes exploitant des démonstrations réussies.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire
2arXiv cs.RO 

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire

Une équipe de recherche propose BeyondRetarget, un framework qui apprend des mouvements exécutables pour robots humanoïdes directement à partir de vidéos RGB monoculaires, sans passer par l'étape classique de reconstruction explicite du mouvement humain puis de retargeting vers le squelette du robot. Décrit dans un preprint arXiv publié fin septembre 2026, le système apprend une représentation implicite orientée robot directement depuis les images, complétée par un mécanisme d'optimisation de mouvement dit "contact-aware" censé améliorer la cohérence temporelle et la plausibilité physique des trajectoires générées. Les auteurs rapportent des gains en précision, en robustesse et en taux de réussite d'exécution, ainsi qu'une latence réduite, à la fois en simulation et sur des robots humanoïdes réels. L'abstract ne fournit toutefois aucun chiffre précis (pas de taux de succès, de latence en millisecondes, ni de payload ou DOF du robot testé), ce qui limite pour l'instant l'évaluation indépendante de l'ampleur réelle des gains annoncés. L'enjeu dépasse le simple gain de performance technique. Les pipelines actuels d'apprentissage par démonstration à partir de vidéos humaines butent sur un problème structurel: les différences de morphologie et de degrés de liberté entre humain et robot rendent les mouvements retargetés difficiles à exécuter, et les erreurs d'estimation de pose humaine se propagent sans pouvoir être corrigées a posteriori par optimisation conjointe. En supprimant cette étape intermédiaire, BeyondRetarget s'attaque directement à un goulot d'étranglement identifié par une large partie du secteur: la capacité à exploiter le volume massif de vidéos humaines disponibles (tutoriels, contenus web) pour entraîner des humanoïdes sans dépendre uniquement de téléopération coûteuse ou de données de mouvement capturées en laboratoire. Si les résultats se confirment à plus grande échelle, cela renforcerait la piste "apprentissage par imitation vidéo" comme alternative ou complément aux approches VLA entraînées sur données robot réelles. Le travail se positionne dans la lignée des méthodes de retargeting de mouvement humain vers robot, dominantes dans la littérature récente sur l'apprentissage de démonstrations pour humanoïdes, mais s'en distingue en éliminant la représentation humaine intermédiaire. Il s'agit d'un résultat de recherche publié en preprint, non encore validé par relecture par les pairs ni associé à un déploiement industriel ou à un partenaire robotique identifié dans l'abstract, ce qui en fait pour l'instant une contribution méthodologique à suivre plutôt qu'une solution prête à l'emploi.

RecherchePaper
1 source
Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos
3arXiv cs.RO 

Retargeting dynamique direct pour l'apprentissage par imitation des humanoïdes à partir de vidéos

Une nouvelle méthode d'apprentissage par imitation pour robots humanoïdes vient d'être publiée sur arXiv (2605.23762, mai 2026), proposant un cadre à étape unique baptisé Direct Dynamic Retargeting (DDR). L'objectif est d'apprendre des comportements moteurs complexes à partir de simples vidéos monoculaires de démonstration humaine, sans capteurs de mouvement ni combinaisons de capture. Le défi central est morphologique : un humain et un robot humanoïde ne partagent ni les mêmes proportions, ni les mêmes centres de masse, ni les mêmes contraintes articulaires, ce qui rend la transposition directe des trajectoires impossible. Les approches standards, dites Geometric Retargeting ou Indirect Dynamic Retargeting, projettent d'abord le mouvement humain dans un espace cinématique intermédiaire avant de générer les commandes robot, introduisant ce que les auteurs appellent un biais géométrique qui restreint l'espace de solutions et produit des comportements sous-optimaux. DDR supprime cette étape intermédiaire en formulant le problème directement dans l'espace des tâches (task space), couplé à un solveur de contrôle prédictif par modèle (Model Predictive Control, MPC) à base d'échantillonnage, exécuté au sein d'un simulateur physique. Ce couplage permet au système d'optimiser nativement les séquences de contact sol-pied tout en limitant la dérive des entrées, garantissant la faisabilité dynamique des trajectoires générées. Les expériences montrent que DDR surpasse les méthodes de référence en précision de suivi des démonstrations. Plus significatif pour les praticiens : fournir ces références physiquement viables à un agent d'apprentissage par renforcement accélère la convergence de l'entraînement et améliore l'exécution finale de comportements agiles et d'équilibrage dynamique. L'apprentissage par imitation à partir de vidéo est devenu un axe majeur de la robotique humanoïde, porté par des travaux comme Pi-0 de Physical Intelligence ou les pipelines de données de téléopération développés chez Figure AI et Agility Robotics. Ces approches cherchent à exploiter l'immense corpus de vidéos de mouvements humains disponibles en ligne pour réduire le coût prohibitif de la collecte de données sur robot. DDR s'inscrit dans cette tendance mais attaque le problème par la dynamique plutôt que par la géométrie, un pari prometteur qui reste à valider en conditions réelles : aucun résultat physique sur robot n'est présenté dans cet article, uniquement des évaluations en simulation. Le code source sera rendu public, ce qui permettra à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines
4arXiv cs.RO 

UniDex-ViTac : apprendre une politique de manipulation dextérique visuo-tactile unifiée à partir de vidéos humaines

UniDex-ViTac, décrit dans un article arXiv de septembre 2026 (2609.16504), convertit des vidéos de démonstrations humaines en trajectoires robotiques simulées associées à des observations de contact au bout des doigts, via des spécialistes de renforcement résiduel qui adaptent, objet par objet, chaque interaction main-objet filmée à un bras-main robotique. À partir de 50 démonstrations humaines sur dix objets, les auteurs génèrent 10 000 trajectoires simulées pour entraîner une politique généraliste unique basée sur l'architecture Action Chunking with Transformers (ACT), combinant nuages de points, proprioception et quatre signaux de contact binaires par doigt, sans référence humaine ni pose d'objet connue au déploiement. En simulation, la version avec contact atteint 68,3% de réussite contre 55,5% pour une base vision seule ; sur robot réel, sans démonstration réelle ni réglage fin, elle réussit 73 essais sur 110 (66,4%) sur six objets vus et cinq inédits, contre 60 sur 110 (54,5%) pour la base de comparaison, un gain de 11,8 points. Le résultat vise un goulot d'étranglement connu de la manipulation dextre : le coût et la rareté des démonstrations robotiques réelles nécessaires à des politiques robustes. Qu'une politique entraînée uniquement en simulation, sans donnée robot réelle ni fine-tuning, réussisse plus de deux essais sur trois en conditions physiques alimente le débat sur la faisabilité du sim-to-real pour la manipulation fine avec retour tactile. L'ajout de simples signaux tactiles binaires, plutôt que des capteurs continus coûteux, améliore surtout la généralisation à des objets inédits, même si l'échantillon de 110 essais reste modeste pour en tirer des conclusions industrielles. Le travail s'inscrit dans une recherche plus large qui exploite les vidéos humaines non annotées pour contourner la téléopération, principal goulot d'étranglement de l'apprentissage par imitation en manipulation dextre. Sa contribution propre tient à la génération, par simulation physique, d'observations de contact absentes des vidéos humaines brutes, la comparaison avec une base vision seule isolant l'apport du signal tactile plutôt que celui de l'architecture ACT. L'article, accompagné d'une page projet (unidex-vitac.github.io), ne mentionne ni partenariat industriel ni calendrier de déploiement : il s'agit d'une preuve de faisabilité académique dont les suites attendues portent sur davantage d'objets, de tâches et une validation à plus grande échelle en conditions réelles.

RecherchePaper
1 source