
RoboDreamer : la locomotion humanoïde anticipative par modèles d'état prédictifs
Des chercheurs ont mis en ligne une version révisée d'un article arXiv (identifiant 2609.07096v2) intitulé "RoboDreamer: Anticipatory Humanoid Locomotion with Predictive State-Space Models", qui décrit une méthode de contrôle de la marche bipède robuste face à des capteurs imparfaits. Le système s'appuie sur un entraînement en deux temps: un modèle "enseignant" apprend d'abord sur des observations propres et complètes, puis un modèle "élève" est distillé à partir de ce premier en ne recevant que des observations récentes partiellement masquées de façon continue et aléatoire, ce qui force la politique de contrôle à reconstituer l'état manquant à partir de l'historique de mouvement. À l'inférence, cette même interface de masquage sert aussi à affiner les actions en boucle fermée de manière implicite et, en option, à regrouper plusieurs pas d'action consécutifs (action chunking). L'architecture repose sur Mamba, un modèle à espace d'états, comme colonne vertébrale temporelle. Des ablations comparatives menées dans les simulateurs IsaacLab et MuJoCo, puis directement sur un robot humanoïde Unitree G1, montrent un suivi de mouvement robuste malgré le masquage d'observations, avec un déploiement réel réussi en latence temps réel.
Pour l'industrie robotique, ce travail cible un verrou concret du déploiement des humanoïdes: la dégradation, le bruit ou les retards de capteurs en conditions réelles, qui font souvent échouer des politiques entraînées sur des observations propres en simulation. En montrant qu'un entraînement par masquage temporel et distillation comble une grande partie de l'écart de robustesse, et que Mamba n'apporte qu'un gain complémentaire de suivi tout en tenant le temps réel, l'étude nuance l'idée que seule l'architecture du réseau (transformer, VLA) explique la performance: la stratégie d'entraînement compte au moins autant.
Ce travail s'inscrit dans la lignée des méthodes de distillation enseignant-élève déjà utilisées pour la locomotion des robots à pattes, en y ajoutant un mécanisme inspiré des "world models" prédictifs. Le choix du Unitree G1, plateforme largement adoptée par les laboratoires de recherche pour sa disponibilité et son coût, en fait un banc d'essai courant plutôt qu'un partenariat commercial annoncé. Le statut de "replace" sur arXiv indique une révision d'un article déjà soumis, sans calendrier de commercialisation ni d'industrialisation communiqué à ce stade.
Dans nos dossiers




