
AutodidactWAM : auto-distillation intermodale de la vidéo générée vers les actions du robot
Des chercheurs ont publié sur arXiv (2610.08119) AutodidactWAM, une méthode d'auto-distillation qui corrige les actions générées par un modèle monde-action (WAM) en s'appuyant sur la vidéo que ce même modèle produit. Le point de départ est Cosmos 3, un WAM qui génère conjointement vidéo future et actions robot à partir d'une observation et d'une instruction. Adapté par un fine-tuning LoRA léger à un humanoïde Unitree G1 doté de mains à cinq doigts BrainCo, il révèle une asymétrie : la vidéo montre des exécutions plausibles, mais l'action co-générée vise systématiquement à côté. En essais réels en boucle fermée, l'action native réussit environ 17 % (pré-saisie), 10 % (saisie) et 7 % (pick-and-place), avec de moins bons résultats sur objets inconnus. La méthode entraîne, sans téléopération, un estimateur de pose de main appliqué à la vidéo générée, puis une cinématique inverse en tire des actions. Ces actions « récupérées » donnent environ 75 %, 47 % et 42 % de réussite sur les trois étapes. Le meilleur objectif combine préférence, ajustement supervisé et ancrage de trajectoire cartésienne (DPO+SFT+DTW). Sur l'Oreo d'entraînement, il atteint 90 % en pré-saisie et 20 % sur la tâche complète. Sur un objet hors entraînement, il atteint 80 % et 30 %.
L'intérêt tient d'abord au diagnostic. Le goulot d'étranglement des WAM n'est pas forcément la compréhension de la tâche, que la vidéo exprime correctement, mais le décodage vers les actions d'un nouvel embodiment. Cela nuance les démonstrations de vidéos plausibles : un rendu convaincant ne garantit pas un contrôle exploitable. Pour les intégrateurs, la piste est séduisante : après une adaptation unique à la morphologie, plus de téléopération par tâche, ce qui réduit le coût principal de collecte de données. Les chiffres appellent toutefois la prudence. Le taux de réussite complet reste de 20 à 30 % sur des essais apparemment peu nombreux, avec un seul type de robot et peu d'objets. Un tel niveau est très loin d'un seuil industriel. L'écart entre pré-saisie (90 %) et tâche complète (20 %) montre que la saisie et le placement restent le point faible.
Un résultat négatif mérite attention : le Flow-DPO seul tombe à 0 % de réussite malgré 1,000 de précision de préférence en validation. L'objectif contrastif n'est donc pas la cause des gains, et une métrique de validation parfaite peut masquer un échec en conditions réelles. Côté contexte, ces travaux s'inscrivent dans la montée des modèles de fondation d'action, des VLA type Pi-0 ou GR00T aux WAM comme Cosmos, qui cherchent à exploiter les priors vidéo pour la robotique. Le G1 d'Unitree est devenu une plateforme de recherche courante, notamment pour son prix relativement bas. Les prochaines étapes probables sont des validations sur d'autres embodiments, davantage de tâches et des statistiques plus solides, ainsi qu'une réduction de l'écart sur la saisie.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




