Qwen3.8-Max d'Alibaba et Nebula de ZTE à égalité en tête des modèles chinois du classement SuperCLUE Embodied Brain
Le groupe d'évaluation chinois SuperCLUE a publié l'édition de septembre 2026 de son classement EmbodiedCLUE-VLA, qui mesure la capacité d'un modèle d'IA à servir de « cerveau » à un robot, c'est-à-dire à planifier et raisonner sur des tâches physiques. Parmi les modèles chinois, Qwen3.8-Max-0902 d'Alibaba et Nebula-EmbodiedBrain de ZTE partagent la première place avec un score total identique de 77,48. Le benchmark couvre quatre domaines : la perception de base (temporelle, d'objets, spatiale), le raisonnement visuel (mathématique, temporel, spatial, logique), l'interaction et la planification (planification de tâches et de trajectoires) et la sécurité incarnée (conformité éthique, sécurité physique, protection de la vie privée). SuperCLUE considère comme à égalité les modèles séparés de moins d'un point et ne cite les modèles internationaux qu'à titre indicatif, hors classement. Les deux leaders y arrivent par des chemins différents. Qwen3.8-Max-0902 obtient les meilleurs scores chinois en perception de base (83,33) et en raisonnement visuel (84,72). Nebula-EmbodiedBrain domine en sécurité (97,92 contre 89,58). Les deux font 39,29 en interaction et planification, mais le modèle de ZTE est meilleur en planification de tâches (64,29 contre 28,57), celui d'Alibaba en planification de trajectoires (50 contre 14,29). Derrière, on trouve des modèles open source de 10 milliards de paramètres ou moins : MiMo-Embodied-7B de Xiaomi (56,95, également premier du classement séparé des moins de 10B), RynnBrain1.1-9B d'Alibaba (50,33), RoboBrain2.5-8B-NV de BAAI (46,36) et HY-Embodied-0.5 de Tencent, 4B (29,14).
Pour les intégrateurs et les décideurs industriels, le signal principal est que la planification reste le maillon faible : aucun modèle chinois ne dépasse 40 en interaction et planification, et les quatre modèles open source plafonnent à 14,29 ou moins. Autrement dit, la perception et le raisonnement visuel progressent nettement plus vite que la capacité à enchaîner des actions fiables, ce qui limite l'autonomie réelle des robots sur des tâches longues. L'écart avec les références internationales reste net : GPT-6 Astra atteint 86,75, Gemini-3.8-Flash 82,12 et Gemini-Robotics-ER-2-Preview, spécialisé en robotique, 70,86. Il faut toutefois lire ces chiffres avec prudence. Il s'agit d'un benchmark par un seul organisme, et le média chinois MyDrivers note lui-même que les classements fondés sur des jeux de tests différents donnent souvent des résultats contradictoires. Les deux leaders sont par ailleurs des modèles fermés accessibles par API, ce qui pèse sur leur reproductibilité et leur adoption embarquée. Le positionnement diffère : selon MyDrivers, Alibaba se distingue par sa mémoire spatio-temporelle, capable de retenir une tâche inachevée après une interruption, tandis que ZTE vise le déploiement sur machine et l'adaptation au matériel.
Ce classement s'inscrit dans une série : SuperCLUE avait déjà publié des éditions en janvier et février 2026. ZTE avait auparavant sorti EmbodiedBrain 1.0, un modèle vision-langage pour la planification de tâches incarnées, dont les poids 7B et 32B sont publiés sur Hugging Face. Xiaomi a ouvert MiMo-Embodied, Alibaba DAMO Academy a lancé RynnBrain et Tencent Robotics X a publié trois modèles incarnés en open source, ce qui montre que les grands groupes chinois du numérique et des télécoms se disputent désormais la couche cognitive des robots, face aux modèles américains. Aucun déploiement industriel ni calendrier de pilote n'est annoncé ici : il s'agit d'une évaluation, pas d'une preuve de performance en production. La prochaine édition dira si l'écart en planification se réduit et si les modèles ouverts rattrapent les modèles fermés.




