Aller au contenu principal
RecherchearXiv cs.RO 

Track-and-Complete : apprendre des compétences humanoïdes à partir d'une seule vidéo humaine ratée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TRACC (Track-and-Complete), un pipeline qui permet à un humanoïde d'apprendre une compétence à partir d'une seule vidéo d'humain en situation d'échec, sans aucune démonstration réussie. La méthode se déroule en deux temps. Elle imite d'abord la partie exploitable de la trajectoire, c'est-à-dire le préfixe de mouvement observé avant que la tentative ne tourne mal. Elle infère ensuite le résultat visé par la tâche, puis utilise une récompense d'accomplissement pour que la politique apprenne à finir le travail après le point de rupture. Le préfixe sert d'a priori jusqu'à l'échec, la récompense prend le relais ensuite. L'évaluation porte sur six tâches humaines « in the wild » en échec, tirées du jeu de données Oops!, une collection de vidéos amateurs de ratés. L'étude est publiée sur arXiv (2609.36924v1) et présente des résultats jugés positifs par les auteurs. Le résumé ne donne ni taux de réussite, ni comparaison chiffrée, ni précision sur le robot utilisé ou sur un éventuel transfert vers du matériel réel.

L'intérêt tient au coût de la donnée. L'apprentissage de compétences humanoïdes par imitation vidéo suppose en général une démonstration réussie, souvent collectée sur mesure : téléopération, capture de mouvement ou scènes scriptées. Or le web regorge de tentatives ratées, que la robotique traite d'ordinaire comme de simples exemples négatifs. Si l'approche tient à plus grande échelle, un corpus jusque-là écarté devient une source de supervision, ce qui réduit le goulot d'étranglement des données que rencontrent les acteurs des politiques généralistes de type VLA. Une réserve s'impose toutefois. Six tâches sont un échantillon très mince, et la robustesse de l'inférence du but à partir d'une vidéo ambiguë reste à démontrer. Le résumé ne dit pas non plus si l'apprentissage se fait uniquement en simulation. La question du passage au réel, le fameux sim-to-real, n'est pas tranchée par ce texte.

Ce travail s'inscrit dans un mouvement plus large de retargeting de mouvements humains vers des humanoïdes et d'apprentissage par renforcement guidé par vidéo, où la plupart des méthodes supposent des démonstrations propres. Les grands acteurs de la course humanoïde, de Figure à Tesla avec Optimus, en passant par les modèles fondation comme Pi-0 ou GR00T, misent surtout sur la téléopération et la simulation à grande échelle pour alimenter leurs politiques. TRACC propose une voie complémentaire, moins coûteuse en collecte, qui reste académique et sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont l'extension à davantage de tâches et de morphologies, la validation sur robot physique et la confrontation avec des méthodes exploitant des démonstrations réussies.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire
1arXiv cs.RO 

BeyondRetarget : apprendre des mouvements humanoïdes exécutables directement à partir d'une vidéo monoculaire

Une équipe de recherche propose BeyondRetarget, un framework qui apprend des mouvements exécutables pour robots humanoïdes directement à partir de vidéos RGB monoculaires, sans passer par l'étape classique de reconstruction explicite du mouvement humain puis de retargeting vers le squelette du robot. Décrit dans un preprint arXiv publié fin septembre 2026, le système apprend une représentation implicite orientée robot directement depuis les images, complétée par un mécanisme d'optimisation de mouvement dit "contact-aware" censé améliorer la cohérence temporelle et la plausibilité physique des trajectoires générées. Les auteurs rapportent des gains en précision, en robustesse et en taux de réussite d'exécution, ainsi qu'une latence réduite, à la fois en simulation et sur des robots humanoïdes réels. L'abstract ne fournit toutefois aucun chiffre précis (pas de taux de succès, de latence en millisecondes, ni de payload ou DOF du robot testé), ce qui limite pour l'instant l'évaluation indépendante de l'ampleur réelle des gains annoncés. L'enjeu dépasse le simple gain de performance technique. Les pipelines actuels d'apprentissage par démonstration à partir de vidéos humaines butent sur un problème structurel: les différences de morphologie et de degrés de liberté entre humain et robot rendent les mouvements retargetés difficiles à exécuter, et les erreurs d'estimation de pose humaine se propagent sans pouvoir être corrigées a posteriori par optimisation conjointe. En supprimant cette étape intermédiaire, BeyondRetarget s'attaque directement à un goulot d'étranglement identifié par une large partie du secteur: la capacité à exploiter le volume massif de vidéos humaines disponibles (tutoriels, contenus web) pour entraîner des humanoïdes sans dépendre uniquement de téléopération coûteuse ou de données de mouvement capturées en laboratoire. Si les résultats se confirment à plus grande échelle, cela renforcerait la piste "apprentissage par imitation vidéo" comme alternative ou complément aux approches VLA entraînées sur données robot réelles. Le travail se positionne dans la lignée des méthodes de retargeting de mouvement humain vers robot, dominantes dans la littérature récente sur l'apprentissage de démonstrations pour humanoïdes, mais s'en distingue en éliminant la représentation humaine intermédiaire. Il s'agit d'un résultat de recherche publié en preprint, non encore validé par relecture par les pairs ni associé à un déploiement industriel ou à un partenaire robotique identifié dans l'abstract, ce qui en fait pour l'instant une contribution méthodologique à suivre plutôt qu'une solution prête à l'emploi.

RecherchePaper
1 source
Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine
2arXiv cs.RO 

Robots acquièrent des compétences de manipulation en secondes grâce à une seule vidéo humaine

Des chercheurs ont présenté HOST (Human-to-robot One-Shot Skill AcquisiTion), un framework permettant à un robot d'acquérir une nouvelle compétence de manipulation à partir d'une seule vidéo humaine, en 29 secondes en moyenne au moment de l'inférence. Le système fonctionne par une cascade de prédictions auto-référencées : il estime d'abord la progression du robot dans la tâche démontrée, traduit cette progression en observations futures propres à l'embodiment du robot, puis en déduit les actions à exécuter. L'entraînement de cette cascade s'appuie sur une correspondance entre la trajectoire du robot et la vidéo de démonstration, projetées sur une même variété de progression de tâche, ce qui permet d'aligner les cibles d'apprentissage sur le déroulé futur de la vidéo. Sur les tâches testées, HOST atteint un taux de réussite moyen de 62%, soit 45 points de plus qu'une baseline zero-shot, tout en conservant les compétences déjà maîtrisées par le robot. Ce résultat s'attaque directement à un goulot d'étranglement connu du secteur de la robotique manipulatrice : les méthodes actuelles d'apprentissage de compétences reposent sur des boucles d'entraînement lourdes et coûteuses, qui en plus dégradent souvent les compétences précédemment acquises à chaque nouvel apprentissage (le problème dit du "catastrophic forgetting"). En affichant des performances supérieures à une baseline fine-tunée sur 50 démonstrations robot par tâche, tout en n'utilisant qu'une seule vidéo humaine et 507 fois moins de temps d'acquisition, HOST illustre une piste concrète pour réduire drastiquement le coût de déploiement des VLA (vision-language-action models) en environnement industriel réel, un enjeu central pour les intégrateurs qui doivent reconfigurer rapidement des cellules robotiques sur de nouvelles références produit sans campagne de collecte de données coûteuse. Cette approche s'inscrit dans la lignée des travaux récents sur l'apprentissage par imitation cross-embodiment, où des modèles comme GR00T N2 ou Pi-0 cherchent également à exploiter des données humaines ou hétérogènes pour accélérer l'apprentissage robotique. La contribution spécifique de HOST réside dans sa capacité à opérer en one-shot, à l'inférence, sans réentraînement du modèle sous-jacent, et sans effacer les compétences déjà en mémoire du robot. Les auteurs renvoient vers un site du projet pour des démonstrations complémentaires ; il s'agit à ce stade de résultats de recherche publiés sur arXiv, non d'un produit ou d'un déploiement industriel.

RecherchePaper
1 source
RoboMirror : comprendre avant d'imiter pour la locomotion humanoïde à partir de vidéo
3arXiv cs.RO 

RoboMirror : comprendre avant d'imiter pour la locomotion humanoïde à partir de vidéo

Des chercheurs présentent RoboMirror, un système qui permet a un robot humanoïde d'apprendre a marcher directement a partir de vidéos, sans capture de mouvement ni retargeting du squelette. Contrairement aux méthodes existantes, qui s'appuient soit sur des trajectoires de motion capture organisées, soit sur des commandes textuelles éparses, RoboMirror utilise des modèles vision-langage (VLM) pour extraire l'intention de mouvement visuelle brute de vidéos filmées a la première personne (égocentriques) ou a la troisième personne, et alimente directement avec cette intention une politique de contrôle basée sur la diffusion générant des mouvements physiquement plausibles sans reconstruction explicite de pose. Selon les expériences rapportées par les auteurs, le système permet la téléprésence via vidéo égocentrique, réduit de 80% la latence de contrôle en mode troisième personne, et obtient un taux de réussite des taches supérieur de 3,7% par rapport aux méthodes de référence. Le papier, publie sur arXiv sous l'identifiant 2512.23649, en est a sa quatrième version révisée. Ce travail s'attaque a un problème concret pour l'industrie de la robotique humanoïde: la difficulté de transférer un mouvement observe en vidéo vers un contrôleur robotique sans étape intermédiaire couteuse et sujette aux erreurs, comme la capture de mouvement ou le retargeting manuel. Si les résultats se confirment a plus grande échelle, cela ouvrirait la voie a l'apprentissage de locomotion a partir de vidéo "en conditions réelles" plutôt que de jeux de données de motion capture couteux a produire. Pour les équipes de R&D en téléopération, la réduction de latence en contrôle troisième personne cible un goulot d'étranglement connu, ou le délai entre observation vidéo et exécution du mouvement dégradé la réactivité et la stabilité. Ces chiffres restent toutefois issus d'évaluations internes des auteurs sur des baselines qu'ils ont eux-mêmes sélectionnées, sans validation indépendante ni déploiement documente sur robot physique en conditions réelles. Cette approche s'inscrit dans un mouvement de recherche plus large visant a combler l'écart entre compréhension visuelle et action chez les humanoïdes, un axe pousse notamment par les modèles vision-langage-action. Les méthodes précédentes se divisaient en deux camps limites: les approches texte-vers-mouvement, pénalisées par la pauvreté sémantique du texte et l'accumulation d'erreurs dans des pipelines a étapes multiples, et les approches vidéo-vers-mouvement, qui se contentaient d'une imitation mécanique de la pose sans véritable compréhension du contenu. RoboMirror revendique être la première méthode vidéo-vers-locomotion sans retargeting en conditionnant directement une politique de diffusion sur l'intention extraite par un VLM. Le résume ne précise ni affiliation institutionnelle des auteurs ni calendrier de déploiement sur matériel réel: il s'agit a ce stade d'une contribution de recherche académique, sans pilote industriel ni partenariat annonce.

RecherchePaper
1 source
4arXiv cs.RO 

EgoHumanoid-V2 : transférer à un robot humanoïde des compétences coordonnées du corps entier en locomanipulation, à partir de l'humain

Des chercheurs publient EgoHumanoid-V2 (arXiv 2609.37181), un cadre de transfert de compétences d'un humain vers un robot humanoïde à partir de vidéos égocentriques, c'est-à-dire filmées depuis le point de vue de l'opérateur. Il vise la loco-manipulation coordonnée du corps entier, où la marche et l'usage des bras sont planifiés ensemble. Son cœur est un alignement d'actions « du grossier au fin ». Une première étape corrige la référence cinématique. Une seconde affine le résultat en tenant compte de la dynamique, ce qui améliore la précision de pose de l'effecteur final tout en préservant la coordination corps entier. Pour réduire l'écart visuel entre l'humain et le robot, l'équipe ajoute un rendu du bras robotique dans les images humaines, ainsi qu'une augmentation d'images à l'entraînement pour gagner en robustesse au changement de point de vue. Sur quatre tâches réelles, des politiques VLA (vision-langage-action) entraînées sur ces données humaines alignées réalisent un transfert « zéro-shot », sans aucune démonstration robot sur la tâche cible. Les scores sont annoncés comme comparables à ceux de politiques entraînées par téléopération, pour un coût de collecte plus faible. Le résumé ne donne ni le robot utilisé, ni le nombre de démonstrations, ni le coût chiffré. L'enjeu est d'abord économique. La téléopération reste le principal goulot d'étranglement des politiques humanoïdes : elle exige des robots, des opérateurs formés et du temps machine, et ses volumes plafonnent bien en dessous de ce que réclame un modèle généraliste. Filmer des humains est bien moins cher et couvre une diversité de scènes que aucun parc de robots ne peut reproduire. Si le résultat se confirme, il indique que la donnée humaine peut servir de supervision directe de compétences, et non plus seulement de préentraînement de la perception. Pour un intégrateur, cela ouvrirait la voie à des compétences apprises sur site sans mobiliser de robot. Il faut toutefois rester prudent : quatre tâches, une comparaison « comparable » sans écart chiffré dans le résumé, et un article en version préliminaire (v1) qui n'a pas passé de relecture par les pairs. Rien ne dit non plus que ces scores tiennent hors du laboratoire, sur des cadences industrielles. Ce travail prolonge une première génération de méthodes égocentriques qui misait surtout sur la généralisation de scènes, avec un contrôle découplé entre locomotion et manipulation, ce qui laissait de côté les compétences corps entier coordonnées. Il s'inscrit dans une course plus large à la donnée humaine : les grands acteurs des modèles fondation humanoïdes, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0, cherchent tous à réduire leur dépendance à la téléopération, par la simulation, la vidéo humaine ou les deux. Aucun déploiement ni calendrier commercial n'est annoncé ici, il s'agit d'une contribution de recherche. La suite logique serait un test sur davantage de tâches et de morphologies, avec des comparaisons chiffrées de coût et de performance face à la téléopération.

RecherchePaper
1 source