
Démonstration de combat du Unitree G1 : le modèle du monde UnifoLM-X2-1.0 sans téléopération
Unitree Robotics a diffusé une vidéo montrant son humanoïde G1 en séance de sparring contre un entraîneur humain équipé de protections, piloté par UnifoLM-X2-1.0, un modèle de fondation "monde-action" que l'entreprise chinoise, basée à Hangzhou, présente comme capable de prédire les états physiques à court terme et de planifier les mouvements en temps réel sans téléopération ni chorégraphie scriptée. Le clip, d'environ 39 secondes et publié autour du 7 septembre 2026, montre le G1 esquiver des coups, ajuster ses appuis et rendre des frappes au poing et au pied. Unitree affirme que son architecture s'attaque aux goulots d'étranglement habituels des modèles monde-action : planification à l'échelle de la milliseconde, choix tactiques face à un adversaire mobile, et exécution en boucle fermée sous des forces de contact continues. Contrairement aux démonstrations qui traduisent des commandes de casque VR ou de manette en cibles articulaires, UnifoLM-X2-1.0 est présenté comme une boucle prédictive perception-action anticipant l'évolution de la scène et de l'adversaire, puis sélectionnant et révisant les actions en gardant l'équilibre et la posture dans le plan. Ce système fait suite au précédent UnifoLM-WMA-0, un modèle monde par diffusion vidéo doté d'une tête d'action, ouvert en source libre par Unitree en 2025.
Cette démonstration importe car le sparring en contact constitue un test de latence bien plus exigeant que la manipulation statique de type pick-and-place : toute réaction retardée échoue immédiatement lorsque coups de poing et de pied arrivent en mouvement continu et que les fenêtres de récupération se réduisent à des fractions de seconde. Si les affirmations d'Unitree se confirment par des essais reproductibles, cela renforcerait l'hypothèse selon laquelle les modèles monde-action peuvent piloter un contrôle corporel complet en autonomie dans des interactions physiques dynamiques, et non plus seulement dans des tâches de manipulation statique, un argument clé pour les intégrateurs évaluant la maturité réelle des humanoïdes au-delà des démonstrations scénarisées. Toutefois, la prudence s'impose : Unitree n'a publié ni article de recherche, ni poids du modèle, ni chiffres de latence, ni benchmark tiers pour cette version, et n'a pas confirmé si elle sera ouverte en source libre comme sa devancière. L'adversaire est un partenaire coopératif protégé, pas un opposant cherchant à déstabiliser le robot, et aucune télémétrie publique ne précise le nombre de prises nécessaires ni si l'inférence tournait entièrement embarquée ou via un serveur externe lié à la plateforme.
Le G1 est le modèle humanoïde d'entrée de gamme d'Unitree, déjà largement diffusé pour la recherche et les démonstrations, tandis qu'UnifoLM-X2-1.0 se positionne comme le successeur orienté production d'UnifoLM-WMA-0, visant l'interaction hautement dynamique plutôt que la seule manipulation statique. Cette annonce s'inscrit dans la course mondiale aux modèles vision-langage-action pour humanoïdes, aux côtés d'acteurs comme Figure AI (Figure 03), Tesla (Optimus), Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2), chacun cherchant à démontrer une autonomie robuste au-delà des vidéos éditées. Sans données techniques publiques ni essais répétés, ce clip doit être considéré comme un signal de faisabilité pour un contrôle corporel autonome piloté par modèle monde, non comme une spécification de produit finalisé ni une preuve qu'une autonomie générale prête pour l'usine industriel est déjà atteinte.
Dans nos dossiers




