HuGo : des LLM comme concepteurs de code de politique corps entier pour la loco-manipulation humanoïde
Le laboratoire ICON Lab, associé à Negar Mehr et présenté sur iconlab.negarmehr.com, publie sur arXiv (2609.30594) une méthode nommée HuGo, pour Humanoid policy code Generation. Un grand modèle de langage y génère, à partir d'une description de tâche, du code exécutable en boucle fermée qui pilote un humanoïde au-dessus d'une politique de contrôle corps entier bas niveau laissée figée. Ce code est ensuite affiné automatiquement grâce aux trajectoires numériques et à des images vidéo sélectionnées des essais, sans récompense ni démonstration spécifiques à la tâche. Sur cinq tâches de loco-manipulation simulées et deux politiques bas niveau, HuGo dépasse nettement une base d'apprentissage par renforcement et se rapproche d'une base fondée sur des démonstrations ; un transfert zero-shot vers du matériel réel est également rapporté, amélioré par la même boucle d'affinement appliquée aux essais réels, sans démonstration experte ni réentraînement.
Ce travail cible un goulot d'étranglement connu de la robotique humanoïde : produire une politique de loco-manipulation par tâche exige aujourd'hui une ingénierie de récompense coûteuse ou la collecte de démonstrations suivie d'un entraînement dédié, deux voies difficiles à faire passer à l'échelle. En déplaçant la logique de tâche vers du code généré par un LLM plutôt que vers des poids appris, HuGo se positionne comme une alternative aux modèles vision-langage-action tels que Pi-0, GR00T N2 ou Helix, qui reposent sur de vastes jeux de démonstrations pour entraîner des politiques bout en bout. Si l'approche se confirme à plus grande échelle, elle ouvrirait une voie moins gourmande en données pour ajouter des tâches à un humanoïde déjà déployé, un enjeu que suivent de près les intégrateurs. Le périmètre testé, cinq tâches simulées, reste restreint et appelle vérification sur des benchmarks plus larges.
Cette publication s'inscrit dans une lignée de recherches sur le contrôle hiérarchique, où une couche bas niveau entraînée une fois reste figée pendant qu'une couche supérieure générée par LLM pilote la tâche. Il s'agit pour l'instant d'un preprint arXiv classé comme nouvelle soumission, sans robot ni entreprise commerciale nommés ni pilote industriel annoncé. Les auteurs renvoient vers le site du projet, iconlab.negarmehr.com/HuGo, pour les démonstrations, sans calendrier pour une extension à davantage de tâches ou de plateformes.
Dans nos dossiers




