DreamMimic : apprentissage de la loco-manipulation visuomotrice du corps entier via un modèle du monde
Un article publié le 25 août 2026 sur arXiv (référence 2608.22278v1) présente DreamMimic, un framework de recherche pour le contrôle de robots humanoïdes en loco-manipulation à corps entier à partir d'entrées visuelles. La méthode distille une politique "enseignante" disposant d'informations privilégiées (état complet de la simulation) vers une politique "étudiante" qui ne dispose que d'entrées visuelles au moment du déploiement. Plutôt que d'utiliser le modèle du monde de type Dreamer (RSSM, Recurrent State-Space Model) pour de la planification comme c'est l'usage classique, les auteurs le détournent pour apprendre une dynamique latente prédictive servant à la fois d'espace de représentation et de signal de supervision multi-étapes conditionné par l'action. Le système ajoute des têtes de prédiction auxiliaires pour l'état privilégié, le contact, l'état des objets et la récompense, et introduit un mécanisme appelé Performance-Conditioned Guidance (PCG), qui ajuste dynamiquement l'équilibre entre guidage par l'enseignant et exploration autonome. Les expériences ont été menées sur les benchmarks de simulation OMOMO et BEHAVE, deux jeux de données de référence pour le suivi d'interactions humain-objet, sans déploiement sur robot physique ni précision de gabarit, de degrés de liberté ou de charge utile.
Pour le secteur de la robotique humanoïde, ce travail s'attaque à un problème central plutôt qu'à une démonstration produit : comment transférer des compétences de manipulation en contact riche, apprises avec des informations privilégiées en simulation, vers des contrôleurs qui ne s'appuient que sur la vision au moment de l'exécution, un enjeu directement lié au fossé entre performances en simulation et robustesse réelle. Les résultats indiqués montrent une amélioration du suivi par rapport à des bases vision-only existantes, suggérant que les modèles du monde peuvent stabiliser la distillation de politiques visuelles dans des tâches de manipulation dynamique. Il s'agit toutefois d'un résultat de simulation, pas d'une validation sur matériel réel.
Le travail s'inscrit dans la lignée des modèles du monde façon Dreamer, initialement conçus pour la planification en apprentissage par renforcement, et dans la vague plus large des architectures vision-langage-action (VLA) qui cherchent à faire tenir des comportements complexes à l'échelle, à l'image de Pi-0, GR00T N2 ou Helix. Le code de DreamMimic est publié sur GitHub, et les auteurs mentionnent des tests qualitatifs supplémentaires sur des changements de morphologie et de simulateur, sans annoncer pour l'instant de passage à des essais sur robot physique.
Dans nos dossiers




