Being-M0.7 : un modèle du monde et de l'action latent pour robots humanoïdes
Being-M0.7 est un modèle monde-action latent pour robots humanoïdes, présenté dans un preprint arXiv (2610.11283v1). Il vise la loco-manipulation, c'est-à-dire la coordination de la marche et de la manipulation en anticipant l'évolution de la scène et les mouvements du corps entier. Ses auteurs s'appuient sur un corpus constitué à partir de plus de 10 000 heures de données brutes centrées sur l'humain. Ce corpus mêle trois types de flux: vidéo seule, mouvement seul, et paires vidéo-mouvement. L'entraînement se fait en trois temps. Un pré-entraînement apprend la dynamique visuelle et la structure cinématique du corps entier. Un « mid-training » robot adapte ensuite ce prior aux points de vue et à la dynamique corporelle des robots. Enfin, un post-entraînement d'action greffe un « action expert » qui combine les représentations prédictives du prior figé avec les images courantes et la proprioception, par attention croisée à portes (gated cross-attention), pour produire des commandes corps entier exécutables. Les auteurs annoncent le meilleur taux de succès agrégé parmi les baselines comparées sur le benchmark SIMPLE. Sur des tâches réelles de loco-manipulation avec un Unitree G1, le modèle égale la meilleure baseline sans la dépasser. Le résumé ne donne ni chiffres de succès, ni liste des tâches, ni nombre d'essais.
L'intérêt tient à l'attaque d'un goulot d'étranglement connu: les démonstrations robot sont rares et coûteuses, alors que la vidéo et la capture de mouvement humaines abondent. Leur exploitation se heurte à deux obstacles. Beaucoup de jeux de données n'ont qu'une modalité, et le mouvement humain ne se traduit pas directement en actions robot. Prédire conjointement les états visuels latents futurs et le mouvement pousse les représentations visuelles à encoder la cinématique à venir. L'étape intermédiaire robot et l'action expert servent de pont vers l'exécution. Le résultat réel reste nuancé. L'avantage est net en simulation, mais il disparaît sur le matériel: la parité avec la meilleure baseline sur G1 suggère que l'écart simulation-réel n'est pas résolu et que le gain du pré-entraînement sur données humaines reste à démontrer au-delà de benchmarks maîtrisés. Les intégrateurs doivent y voir une piste de recherche prometteuse pour réduire la dépendance à la téléopération, et non une capacité prête pour le déploiement. Il s'agit d'une publication académique, sans produit, sans pilote industriel ni calendrier de commercialisation.
Ce travail s'inscrit dans la vague des modèles monde-action et des VLA (vision-langage-action) appliqués aux humanoïdes, où plusieurs acteurs cherchent à exploiter la vidéo humaine à grande échelle. On y trouve des modèles généralistes de type Pi-0, GR00T ou Helix, et des approches qui prédisent le futur visuel pour guider l'action. Le Unitree G1, humanoïde abordable très répandu dans les laboratoires, sert de plateforme de validation commune, ce qui facilite la comparaison entre équipes. La version «0.7» laisse penser à une série de modèles Being, dont les itérations précédentes ne sont pas détaillées ici. Les suites à surveiller sont la publication du code, des poids et des protocoles d'évaluation, ainsi que des tests sur des plateformes plus variées et des tâches plus longues. Une confirmation indépendante sur matériel réel dira si l'avantage observé en simulation se maintient.
Pas d\'impact direct sur la France/UE
Dans nos dossiers



