
Unitree ouvre la page du projet UnifoLM-WLA-1.0, son modèle fondation pour humanoïdes
Unitree a mis en ligne le 10 septembre la page projet de UnifoLM-WLA-1.0, un modèle de fondation vision-langage-action pour humanoïdes généralistes d'environ 6 milliards de paramètres. Un checkpoint unique, entraîné sur environ 2500 heures de données réelles collectées sur robot, coordonnerait 64 tâches réparties entre 10 mouvements impliquant tout le corps et 54 manipulations de table, avec compatibilité pinces à deux doigts et mains dextres à cinq doigts. Distinct de la précédente démonstration de combat UnifoLM-X2, ce modèle cible les tâches domestiques et de bureau courantes. L'architecture associe une modélisation du monde centrée sur l'interaction, un module de raisonnement incarné baptisé UnifoLM-ER-1 et bâti sur Qwen3-VL-4B (plus de 5 millions d'échantillons couvrant détection, trajectoires 2D, détection 3D et raisonnement spatial), une prédiction de zones dynamiques par flux optique compressée via un VQ-VAE, et un apprentissage d'actions discrètes par quantification vectorielle résiduelle alimentant un expert MMDiT. Sur seize bancs d'essai multimodaux, Unitree revendique la tête parmi les modèles ouverts sur sept d'entre eux, et un score supérieur au modèle propriétaire GPT-6 Astra sur des tests spatiaux comme Where2Place ou CV-Bench, illustré par des vidéos tournées sur robot G1 (plier du linge, faire un lit, ranger des chaussures, nettoyer une salle de bain).
Cette annonce s'inscrit dans la course engagée autour des modèles de fondation pour humanoïdes, aux côtés de Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, où l'enjeu est de faire tenir dans une seule politique la manipulation fine et la locomotion du corps entier. Sa portée pratique reste toutefois limitée à ce stade : la page projet promet un accès open source, mais code, poids et jeux de données affichent tous la mention "coming soon". Les vidéos de démonstration restent des séquences choisies par le fabricant, sans validation indépendante, et la comparaison à GPT-6 Astra provient d'une évaluation interne non vérifiée par un tiers. Pour les intégrateurs et décideurs industriels, le signal utile à ce jour est donc une feuille de route et une architecture documentées, pas encore un checkpoint prêt à déployer sur du matériel tiers.
Unitree, fabricant chinois connu pour ses humanoïdes H1 et G1, avait déjà exposé UnifoLM-X2, une démonstration de sparring centrée sur la réactivité motrice plutôt que sur la polyvalence cognitive. UnifoLM-WLA-1.0 s'inscrit dans une compétition mondiale où Tesla avance avec Optimus Gen 3, Figure AI avec Figure 03 et son modèle Helix, et Nvidia avec GR00T N2, chacun cherchant à démontrer qu'un même modèle vision-langage-action peut généraliser à des dizaines de tâches ménagères ou industrielles sans réentraînement spécifique. Aucune date ferme n'a été communiquée pour la publication effective du code, des poids et des corpus d'entraînement (Unitree Open Datasets, BitRobot-HIW-500) annoncés comme open source. En attendant, chercheurs et intégrateurs devront se contenter du tableau de benchmarks et de la description architecturale publiés sur la page projet.
Dans nos dossiers




