Aller au contenu principal
Chine/AsiePandaily 

Qwen3.8-Max d'Alibaba et Nebula de ZTE à égalité en tête des modèles chinois du classement SuperCLUE Embodied Brain

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le groupe d'évaluation chinois SuperCLUE a publié l'édition de septembre 2026 de son classement EmbodiedCLUE-VLA, qui mesure la capacité d'un modèle d'IA à servir de « cerveau » à un robot, c'est-à-dire à planifier et raisonner sur des tâches physiques. Parmi les modèles chinois, Qwen3.8-Max-0902 d'Alibaba et Nebula-EmbodiedBrain de ZTE partagent la première place avec un score total identique de 77,48. Le benchmark couvre quatre domaines : la perception de base (temporelle, d'objets, spatiale), le raisonnement visuel (mathématique, temporel, spatial, logique), l'interaction et la planification (planification de tâches et de trajectoires) et la sécurité incarnée (conformité éthique, sécurité physique, protection de la vie privée). SuperCLUE considère comme à égalité les modèles séparés de moins d'un point et ne cite les modèles internationaux qu'à titre indicatif, hors classement. Les deux leaders y arrivent par des chemins différents. Qwen3.8-Max-0902 obtient les meilleurs scores chinois en perception de base (83,33) et en raisonnement visuel (84,72). Nebula-EmbodiedBrain domine en sécurité (97,92 contre 89,58). Les deux font 39,29 en interaction et planification, mais le modèle de ZTE est meilleur en planification de tâches (64,29 contre 28,57), celui d'Alibaba en planification de trajectoires (50 contre 14,29). Derrière, on trouve des modèles open source de 10 milliards de paramètres ou moins : MiMo-Embodied-7B de Xiaomi (56,95, également premier du classement séparé des moins de 10B), RynnBrain1.1-9B d'Alibaba (50,33), RoboBrain2.5-8B-NV de BAAI (46,36) et HY-Embodied-0.5 de Tencent, 4B (29,14).

Pour les intégrateurs et les décideurs industriels, le signal principal est que la planification reste le maillon faible : aucun modèle chinois ne dépasse 40 en interaction et planification, et les quatre modèles open source plafonnent à 14,29 ou moins. Autrement dit, la perception et le raisonnement visuel progressent nettement plus vite que la capacité à enchaîner des actions fiables, ce qui limite l'autonomie réelle des robots sur des tâches longues. L'écart avec les références internationales reste net : GPT-6 Astra atteint 86,75, Gemini-3.8-Flash 82,12 et Gemini-Robotics-ER-2-Preview, spécialisé en robotique, 70,86. Il faut toutefois lire ces chiffres avec prudence. Il s'agit d'un benchmark par un seul organisme, et le média chinois MyDrivers note lui-même que les classements fondés sur des jeux de tests différents donnent souvent des résultats contradictoires. Les deux leaders sont par ailleurs des modèles fermés accessibles par API, ce qui pèse sur leur reproductibilité et leur adoption embarquée. Le positionnement diffère : selon MyDrivers, Alibaba se distingue par sa mémoire spatio-temporelle, capable de retenir une tâche inachevée après une interruption, tandis que ZTE vise le déploiement sur machine et l'adaptation au matériel.

Ce classement s'inscrit dans une série : SuperCLUE avait déjà publié des éditions en janvier et février 2026. ZTE avait auparavant sorti EmbodiedBrain 1.0, un modèle vision-langage pour la planification de tâches incarnées, dont les poids 7B et 32B sont publiés sur Hugging Face. Xiaomi a ouvert MiMo-Embodied, Alibaba DAMO Academy a lancé RynnBrain et Tencent Robotics X a publié trois modèles incarnés en open source, ce qui montre que les grands groupes chinois du numérique et des télécoms se disputent désormais la couche cognitive des robots, face aux modèles américains. Aucun déploiement industriel ni calendrier de pilote n'est annoncé ici : il s'agit d'une évaluation, pas d'une preuve de performance en production. La prochaine édition dira si l'écart en planification se réduit et si les modèles ouverts rattrapent les modèles fermés.

À lire aussi

L'équipe Qwen d'Alibaba entre dans l'IA incarnée avec son modèle VLA
1Pandaily 

L'équipe Qwen d'Alibaba entre dans l'IA incarnée avec son modèle VLA

L'équipe Tongyi Qianwen d'Alibaba a annoncé en 2026 son entrée dans le domaine de l'IA embodiée avec Qwen-VLA, un modèle vision-langue-action (VLA) destiné à doter robots et appareils intelligents d'une capacité de perception, de compréhension et d'action dans le monde physique. L'architecture unifiée du modèle intègre trois composantes : la perception visuelle, la compréhension du langage naturel, et la planification d'actions physiques. Concrètement, un système embarquant Qwen-VLA serait en mesure d'analyser son environnement via des caméras, d'interpréter des instructions vocales ou textuelles, et de générer les commandes motrices correspondantes. Les applications visées couvrent un spectre large : robots industriels, robots de service, et équipements domestiques connectés. Le modèle s'appuie sur l'expertise accumulée par la série Qwen en LLM et IA multimodale, en étendant ces capacités vers la prédiction d'actions robotiques. Aucune métrique de performance (charge utile, degrés de liberté, temps de cycle) n'a été communiquée à ce stade, ce qui situe clairement cette publication comme une annonce de cap stratégique plutôt que le lancement d'un produit finalisé. L'entrée d'Alibaba reconfigure l'équilibre de la course à l'IA embodiée en Chine, non pas par une approche hardware-first, mais par la couche modèle. Qwen-VLA est positionné comme une plateforme ouverte : Alibaba ne construit pas ses propres robots, mais fournit le "cerveau" que des partenaires matériels peuvent embarquer dans leurs systèmes, quel que soit le facteur de forme. Cette stratégie rappelle davantage celle d'un fournisseur de fondations que celle d'un constructeur robotique intégré. L'atout différenciant réside dans les ressources mobilisables : la puissance de calcul d'Alibaba Cloud, les données réelles issues des opérations logistiques de Cainiao et des flux e-commerce de Taobao, et un écosystème dense de partenaires industriels. Si ces données propriétaires représentent un avantage réel pour l'entraînement et le fine-tuning de VLA, leur exploitation sans friction juridique ou de gouvernance reste à démontrer en pratique. La publication de Qwen-VLA s'inscrit dans une accélération marquée du marché chinois de l'IA embodiée en 2026, portée par la convergence des modèles de fondation, des capteurs et des capacités manufacturières. Alibaba rejoint un champ concurrentiel déjà dense : Unitree Robotics et Deep Robotics sur le hardware, Zhiyuan et AgiBot sur l'intégration système, et des géants tech comme Xiaomi et ByteDance qui investissent de plus en plus dans la robotique généraliste. La stratégie d'Alibaba, modèle ouvert sans robot propriétaire, la distingue de Figure AI ou 1X Technologies aux États-Unis, qui misent sur une intégration verticale complète. Elle se rapproche davantage de l'approche de NVIDIA avec GR00T N2, ou de Physical Intelligence avec Pi-0 côté américain. Les prochaines étapes à surveiller : des partenariats hardware concrets, des benchmarks comparables aux standards du secteur, et d'éventuels pilotes industriels chez des opérateurs logistiques comme Cainiao, qui constitueraient le premier vrai test de passage à l'échelle.

UEL'accélération de l'IA embodiée en Chine avec Qwen-VLA accentue la pression concurrentielle sur les acteurs européens du secteur, sans impact direct immédiat sur le marché français ou les réglementations EU.

Chine/AsieOpinion
1 source
La Chine et les robots humanoïdes en 2026 : le boom de la production face à la réalité du déploiement, AgiBot et Unitree en tête
2Pandaily 

La Chine et les robots humanoïdes en 2026 : le boom de la production face à la réalité du déploiement, AgiBot et Unitree en tête

Lors de la conférence de presse du World Artificial Intelligence Conference (WAIC), en juillet 2026, Gan Xiaobin, directeur adjoint du département Science et Technologie du ministère chinois de l'Industrie (MIIT), a annoncé que la production chinoise de robots humanoïdes devrait dépasser 100 000 unités sur l'année, contre environ 20 000 en 2025, un bond par cinq que le vice-ministre Ke Jixin présente comme le passage d'une phase exploratoire à un développement standardisé et à grande échelle. Selon MIR Databank, AgiBot et Unitree forment un duopole net : AgiBot a annoncé 15 000 unités sorties d'usine début juin, Unitree environ 11 000 fin mars, avec des déploiements couvrant sept usages, du chargement en ligne de production au nettoyage commercial, en passant par la manutention, le tri logistique, l'accueil, le commerce et la surveillance. Unitree vise un doublement des livraisons par rapport aux 6 500 unités de 2025 et porte sa capacité à 30 000 unités par an, mais plus de 70% de son chiffre d'affaires humanoïde provenait, à fin septembre 2025, de clients recherche et éducation, contre seulement 9% pour l'industriel. UBTech, troisième en production mais quatrième en livraisons, signe typique d'un stock qui s'accumule, a lancé le 30 juin son U1 (169 800 yuans en version Pro, plus de 13 361 commandes), un produit grand public non comptabilisé dans les statistiques industrielles. Cet écart entre production et livraisons révèle la tension centrale du secteur : la capacité de fabrication est là, mais la demande réelle et des boucles commerciales durables restent à construire. Pour les intégrateurs et décideurs industriels, le chiffre brut de 100 000 unités ne dit rien du taux d'usage réel en usine, comme le montre le cas Unitree où l'essentiel des ventes va encore à la recherche et à l'éducation plutôt qu'à la production. Cela confirme un scepticisme déjà présent dans le secteur sur l'écart entre démonstration et réalité opérationnelle : produire en série ne signifie pas que l'autonomie des robots tient la cadence d'une chaîne industrielle. Le recul relatif d'UBTech en livraisons, malgré une production élevée, illustre que la course chinoise aux humanoïdes se joue désormais autant sur l'écoulement commercial que sur la capacité industrielle brute. Au-delà du duopole AgiBot-Unitree, cinq autres exposants du WAIC 2026 illustrent des trajectoires bien différentes. Le Centre national-local d'innovation en robots humanoïdes mise sur des usages pragmatiques : guidage touristique, patrouille de sécurité, tri industriel. Matrix Intelligence positionne son MATRIX-3 en haut de gamme bipède, à 580 000 yuans, avec 1 000 commandes cumulées. Banxing Embodied suit une logique de sous-traitance ODM personnalisée à 208 000 yuans l'unité. La filiale Huajian de Zhongjian Technology n'a présenté que le concept ZERO, encore au stade de prototype. MagicLab, enfin, a choisi une entrée verticale par cas d'usage avec son robot de régulation du trafic Xiaomai, déployé lors du marathon de Wuxi. Ensemble, ces cinq acteurs dessinent un écosystème plus fragmenté et plus incertain que le seul récit d'un boom industriel des humanoïdes chinois.

Chine/AsieOpinion
1 source
Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée
3Pandaily 

Alibaba lance Qwen-Robot, sa première famille de modèles d'IA incarnée

Alibaba a publié mardi la suite Qwen-Robot, sa première famille de modèles d'IA incarnée, destinée à relier les grands modèles de langage à l'action robotique dans le monde physique. La suite comprend trois modèles : Qwen-RobotNav pour la navigation visuo-langagière, entraîné sur 15,6 millions d'échantillons en unifiant instruction following, navigation par cible et suivi d'objets ; Qwen-RobotManip pour la manipulation robotique via une architecture VLA (Visual Language Action) basée sur un backbone Qwen3.5-4B VL couplé à une tête de diffusion par flow matching, entraîné sur plus de 38 100 heures de données issues exclusivement de sources open source ; et Qwen-RobotWorld, un modèle de monde prédit des futurs physiquement cohérents pour la manipulation, la conduite et la navigation via une interface en langage naturel. La démonstration centrale met en scène un robot quadrupède Unitree Go2 sur hardware NVIDIA Jetson Thor, équipé d'une unique caméra basse résolution : sans cartographie préalable, il navigue dans un appartement inconnu en suivant des instructions verbales, avec une latence d'inférence de 196 millisecondes. Alibaba a également présenté Qwen-RobotClaw, un framework agent permettant aux modèles Qwen VLM d'appeler les outils Qwen-Robot pour gérer des tâches longues et la mémoire de contexte, et mis en open source Chat2Robot, une plateforme d'évaluation navigateur supportant Qwen-RobotManip sur 50 tâches via le dataset RoboTwin-Clean. Pour les intégrateurs et décideurs industriels, deux points méritent attention. L'entraînement de Qwen-RobotManip exclusivement sur des données open source est un choix architectural significatif : il abaisse les barrières de reproduction et contourne le verrou des données propriétaires qui bloque nombre d'acteurs du secteur. La latence de 196 ms sur Jetson Thor illustre la viabilité de l'inférence embarquée pour la navigation, même si cette performance a été mesurée dans un environnement contrôlé et non en production industrielle. La robustesse à grande échelle reste à démontrer : les vidéos présentées constituent une preuve de concept, pas un déploiement validé. L'architecture Qwen-RobotClaw adresserait un problème concret si elle tient ses promesses en production : la gestion de tâches multi-étapes sans reprogrammation manuelle, qui reste le verrou central de l'adoption robotique en environnements non structurés. Alibaba entre tardivement dans l'espace des modèles de fondation robotiques face à des acteurs déjà positionnés : Physical Intelligence (pi0, levée de 400 M$ en 2024), Figure AI (Figure 03, partenariat BMW), Google DeepMind et NVIDIA avec GR00T N2. En Chine, Unitree (fournisseur du Go2 de la démo), Zhiyuan Robot et Agibot développent leurs propres stacks logicielles embarquées. En Europe, Enchanted Tools et Pollen Robotics avancent sur des plateformes collaboratives, mais sans modèle VLA de cette envergure à ce stade. Les prochaines étapes annoncées incluent l'extension de Chat2Robot à de nouvelles plateformes et tâches robotiques, ainsi qu'une intégration commerciale potentielle via Alibaba Cloud.

UEL'entrée d'Alibaba avec une suite VLA entraînée sur données open source creuse l'écart technologique avec les acteurs européens (Enchanted Tools, Pollen Robotics) qui ne disposent pas encore de modèles de fondation robotiques comparables, même si la stack open source pourrait leur servir de base de développement.

Chine/AsieOpinion
1 source
BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour
4Pandaily 

BAAI et Alibaba, tous les deux jours un nouveau modèle d'IA incarnée voit le jour

Treize nouveaux modèles fondation et modèles du monde pour la robotique embarquée ont été annoncés en juin 2026, soit environ un tous les 48 heures. Lors de la Conférence Zhiyuan 2026, le BAAI (Beijing Academy of Artificial Intelligence) a présenté deux avancées : Wujie Physis-v0.1, qui prédit l'état physique suivant en compressant vidéo, données RGB-D, nuages de points 3D et retour tactile dans un espace latent unifié, et Wujie RoboBrain Orca, un "cerveau" robotique combinant représentation unifiée, raisonnement causal et décodage multimodal. Le 16 juin, Alibaba a dévoilé la suite Qwen-Robot, composée de trois modèles complémentaires : Qwen-RobotNav pour l'allocation d'attention visuelle en navigation mobile, Qwen-RobotManip qui standardise l'espace état-action pour la manipulation, et Qwen-RobotWorld, doté d'une interface en langage naturel pour prédire la dynamique du monde. CasiaHand a lancé Brain-Si 0.5, présenté comme le premier modèle de manipulation dextre humanoïde, avec une architecture à trois niveaux allant de la planification VLA jusqu'à des modèles physiquement interprétables. GalaxyBot a de son côté publié AstraBrain-WBC 0.5, un modèle de contrôle corps entier entraîné sur environ 2 milliards d'images issues de mouvements humains, pour 80 millions de paramètres. RoboScience, Current Robotics et BoundlessPower ont complété la liste avec respectivement l'architecture Visics, le modèle Curl-0 et le modèle du monde MWA. Cette accélération marque un basculement net dans l'industrie de la robotique embarquée : la compétition ne se joue plus sur les capacités matérielles des robots, mais sur l'intelligence logicielle qui les pilote. Signe le plus révélateur, la posture d'Alibaba tranche avec l'approche dominante du "plus de données, plus de robots" : le groupe affirme que l'hétérogénéité du monde physique ne peut pas être résolue par le seul passage à l'échelle et nécessite un alignement au niveau du modèle lui-même. Pour les intégrateurs et décideurs industriels, le signal est important : les équipes ne cherchent plus seulement à démontrer ce que les robots savent faire, mais à expliquer pourquoi ils échouent encore sur certaines tâches, chacune identifiant un goulot d'étranglement différent, retour tactile, coordination corps entier, transfert simulation-réel ou planification à long horizon. Ce foisonnement s'inscrit dans la course engagée depuis 2024-2025 entre laboratoires chinois et occidentaux (Figure, Physical Intelligence avec Pi-0, NVIDIA avec GR00T) autour des modèles vision-langage-action. La France et l'Europe restent absentes de cette vague spécifique de publications, la dynamique se concentrant pour l'instant sur les acteurs chinois (BAAI, Alibaba, CasiaHand, GalaxyBot) et américains. Les prochaines étapes attendues concernent la validation de ces architectures sur des déploiements réels au-delà des démonstrations en laboratoire, un point sur lequel la prudence reste de mise tant les métriques annoncées, notamment le nombre de paramètres ou de frames d'entraînement, restent difficiles à comparer d'un laboratoire à l'autre sans benchmarks communs.

Chine/AsieOpinion
1 source