Aller au contenu principal
La Chine ouvre plus de 70 sites d'entraînement pour l'IA incarnée, une norme de jeux de données attendue le 1er novembre
Chine/AsiePandaily 

La Chine ouvre plus de 70 sites d'entraînement pour l'IA incarnée, une norme de jeux de données attendue le 1er novembre

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La Chine a ouvert plus de 70 sites d'entrainement pour l'IA incarnée (embodied AI) a fin juin 2026, avec plus de 40 sites supplémentaires en construction ou en planification, selon un rapport de l'Academie chinoise des technologies de l'information et des communications (CAICT) cite par Economic Information Daily et relaye en anglais par Xinhua le 22 septembre. Ces installations, parfois surnommées "écoles de robots", se concentrent dans le delta du Yangtze, la région Pekin-Tianjin-Hebei et le delta de la rivière des Perles: le Zhejiang arrive en tête avec 14 sites, suivi du Jiangsu, de Pekin, du Guangdong et du Shandong avec huit chacun. La Chine compte plus de 140 fabricants de robots humanoïdes et a livre environ 14 400 unités en 2025, soit environ huit livraisons mondiales sur dix selon Xinhua. Sur ces sites, des opérateurs en capture de mouvement génèrent des trajectoires annotées a partir de taches répétitives comme saisir des bouteilles, charger des plateaux ou scanner des colis. Dans le Guangdong, le site provincial sert aussi de plateforme de mise en relation entre fabricants de robots et utilisateurs des secteurs santé et énergie, tandis que la base pilote nationale de Hangzhou se positionne comme connecteur mutualise entre entreprises publiques, groupes technologiques et partenaires applicatifs, avec des porteurs de projet qui évoquent des économies importantes par rapport a la constitution de jeux de données propriétaires.

Cette annonce révèle un gouffre persistant entre le volume de déploiement de robots humanoïdes et leur fiabilité réelle en usage quotidien: malgré une production de masse, les fabricants chinois restent freines par la raretee de données d'interaction en conditions réelles, ce qui confirme que le "sim-to-real gap" n'est pas résolu par le seul volume de simulation. Pour les intégrateurs et décideurs B2B du secteur robotique, le signal est celui d'une infrastructure nationale de collecte de données plutôt que d'un produit ou d'un modèle fini a l'américaine (a comparer aux approches Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, davantage centrées sur les modèles VLA). Cette approche par volume de terrains d'entrainement, combinée a une normalisation imminente de la qualité des jeux de données, pourrait accélérer la maturité opérationnelle des flottes chinoises et redistribuer la compétition mondiale, jusqu'ici dominée par le narratif américain autour des VLA (vision-language-action).

Cette dynamique s'inscrit dans la continuité d'une politique industrielle déjà engagée: en juin 2026, le ministère de l'Industrie et des Technologies de l'information (MIIT) et la Commission de supervision et d'administration des actifs publics (SASAC) ont lance une action spéciale demandant a chaque région provinciale d'identifier au moins 20 scenarios prioritaires et de créer des espaces d'entrainement et de test nécessitant un aménagement minimal. Parallelement, une norme industrielle sur la qualité des jeux de données d'IA incarnée, rédigée par le CAICT avec plus de 40 organisations, doit entrer en vigueur le 1er novembre 2026, avec l'objectif de faire passer le secteur d'une logique de collecte massive a une logique de qualité et d'évaluation. Des opérateurs testent aussi des modèles économiques allant au-delà de la simple vente de données brutes, comme le "training-as-a-service" combinant collecte, entrainement de modèles et validation applicative. Aucun acteur français ou européen (Wandercraft, Exotec, Pollen Robotics, Enchanted Tools) n'est mentionne dans cette annonce, qui reste centrée sur l'écosystème chinois et ses partenaires industriels domestiques.

Impact France/UE

Aucun acteur français ou européen n'est impliqué, mais l'avance chinoise en volume de données d'entraînement terrain pourrait creuser l'écart de maturité opérationnelle face aux fabricants de robots humanoïdes européens.

À lire aussi

La Chine dispose de plus de 70 terrains d'entraînement à l'IA incarnée opérationnels, selon un rapport
1TechNode 

La Chine dispose de plus de 70 terrains d'entraînement à l'IA incarnée opérationnels, selon un rapport

Plus de 70 sites d'entraînement pour l'IA incarnée (embodied AI) étaient opérationnels en Chine à fin juin 2026, selon un rapport de la China Academy of Information and Communications Technology (CAICT), centre de recherche rattaché au ministère chinois de l'Industrie et des Technologies de l'information. 46 installations supplémentaires sont en construction ou en planification, portant le total à plus de 100 sites répartis dans plus de la moitié des provinces et régions administratives chinoises. Ces installations servent à collecter des données en conditions réelles, entraîner des modèles et tester des systèmes robotiques avant déploiement. L'industrie manufacturière domine largement les usages recensés, présente dans 86% des sites, concentrés dans trois zones: le delta du Yangtze, la région Pékin-Tianjin-Hebei et le delta de la rivière des Perles. Ce volume traduit l'ampleur de l'investissement public chinois dans les infrastructures physiques d'entraînement robotique, à un moment où des acteurs occidentaux comme Figure AI, Tesla avec Optimus, Physical Intelligence avec Pi-0 ou NVIDIA avec GR00T s'appuient surtout sur la simulation et des flottes pilotes restreintes pour générer leurs données. Pour les intégrateurs et décideurs industriels, cette mutualisation étatique vise à lever le principal goulot d'étranglement cité pour faire progresser les modèles vision-langage-action (VLA): le manque de données réelles à grande échelle. Le rapport ne précise toutefois ni le taux d'utilisation effectif de ces sites ni les volumes de données réellement produits, ce qui en fait avant tout un indicateur de capacité installée plutôt qu'un résultat vérifié. Cette annonce s'inscrit dans la politique industrielle chinoise de soutien à la robotique humanoïde, engagée depuis 2023 face à la concurrence américaine et, plus marginalement, européenne, où des acteurs comme Wandercraft, Pollen Robotics ou Enchanted Tools occupent un créneau différent, plus axé produit que sur les infrastructures d'entraînement. La CAICT publie régulièrement des rapports de référence sur les technologies numériques pour le compte de Pékin. Le document, relayé par le site chinois IT Home, ne fournit ni calendrier de pilotes ni objectifs chiffrés pour les 46 sites en projet, laissant ouverte la question du rythme auquel cette capacité se traduira en déploiements commerciaux effectifs.

UEAucun impact direct, mais l'ecart d'investissement en infrastructures de donnees chinoises souligne le positionnement different des acteurs europeens comme Wandercraft ou Pollen Robotics, centres sur le produit plutot que sur les sites d'entrainement.

Chine/AsieOpinion
1 source
Pénurie de données » : le véritable frein qui bride l'IA incarnée en Chine
2Pandaily 

Pénurie de données » : le véritable frein qui bride l'IA incarnée en Chine

Au World Robot Conference de Beijing cette année, l'attention s'est déplacée des démonstrations spectaculaires de robots vers des stands où des opérateurs humains, casque et gants de téléopération sur la tête et les mains, "enseignent" des gestes à des pinces robotiques dont chaque mouvement est enregistré comme donnée d'entraînement. Une nouvelle catégorie d'acteurs, qualifiés d'"infrastructure de données" ou de "fondation de données pour l'IA physique", s'est imposée en nombre, signe d'un basculement de la démonstration vers l'alimentation en données. Xia Hualin, qui dirige la base de données et d'entraînement du Beijing Humanoid Robotics Innovation Center, estime que l'IA incarnée réclame plusieurs ordres de grandeur de données de plus que la conduite autonome. La China Academy of Information and Communications Technology recense plus de 70 sites d'entraînement opérationnels fin juin, avec 46 autres planifiés ou en construction, un volume jugé encore très insuffisant. Une estimation du secteur chiffre à environ 500 000 heures les données réelles d'interaction physique conformes disponibles en Chine, alors que la commercialisation exigerait des dizaines de millions d'heures, soit un déficit de plus de 99 %. Le travail de collecte s'est complexifié : une simple tâche de tri de pièces a déjà généré entre 30 000 et 40 000 points de données, et le standard pour "porter un plateau" est passé d'un simple geste de saisie-déplacement-dépôt à un maintien de l'équilibre en marchant. Wang Chuang, associé chez AgiBot, situe la bascule entre l'ère de la démonstration en 2024 et la production de masse et le déploiement réel visés pour 2025-2026. En juin, le ministère de l'Industrie et des Technologies de l'information et le régulateur des actifs publics ont lancé un plan d'action 2026 ciblant plus de 100 scénarios d'usage à forte valeur et des dizaines de milliers d'unités déployées d'ici la fin de l'année. Ce constat déplace le vrai goulot d'étranglement de l'humanoïde chinois : ce n'est plus la mécanique ou l'algorithme qui bride le déploiement, mais l'approvisionnement en données physiques réelles, un problème que le texte ou les corpus de conduite autonome ne peuvent pas résoudre par transfert. Cela nuance directement le récit dominant d'un sim-to-real résolu ou de modèles vision-langage-action prêts à s'industrialiser à grande échelle : sans force, toucher distribué et couple moteur, la vidéo seule ne suffit pas à rendre une saisie fiable. Pour les intégrateurs et décideurs industriels, cela signifie que le calendrier de déploiement des humanoïdes dépend désormais autant d'une chaîne d'approvisionnement en données que du matériel lui-même. Ce virage s'inscrit dans la course chinoise à l'humanoïde portée par des acteurs comme AgiBot, UBTech ou Unitree, après deux années dominées par des vitrines technologiques. Les sites d'entraînement sont désormais conçus comme des "écoles complètes" couvrant la marche basique jusqu'aux opérations industrielles de précision, combinant téléopération en réalité virtuelle, capture de mouvement portable et collecte sur robots réels. Tant que ce déficit de données ne se résorbe pas, prévient Xia Hualin, les robots humanoïdes peineront à se défaire de leur image de jouets téléguidés.

Chine/AsieOpinion
1 source
Maniformer lance une plateforme de données d'IA physique tout-en-un pour préparer l'ère de l'AGI
3Pandaily 

Maniformer lance une plateforme de données d'IA physique tout-en-un pour préparer l'ère de l'AGI

Maniformer, startup chinoise spécialisée dans l'infrastructure de données pour l'IA physique, a officiellement lancé sa plateforme de services de données en un seul guichet, accompagnée de la gamme matérielle MEgo et du système de gouvernance MEgo Engine. La gamme MEgo comprend trois composants : le MEgo Gripper pour la capture de données de manipulation robotique, le MEgo View, un dispositif de collecte portable à tête montée, et le MEgo Engine pour le traitement et la gouvernance des données. Ces outils affichent une précision millimétrique, une synchronisation sub-milliseconde et une perception panoramique supérieure à 300 degrés. Le système est nativement compatible avec le robot G2 Air, garantissant la cohérence entre environnements simulés et réels. Selon Yao Maoqing, président-directeur général, l'entreprise vise une capacité de production de dizaines de millions d'heures de données d'ici 2026, puis des dizaines de milliards d'heures d'ici 2030. Le problème que Maniformer cherche à résoudre est structurel : les données d'interaction physique réelle disponibles pour l'IA incarnée représentent moins de 1/20 000 de ce qui existe pour les grands modèles de langage. Ce déficit, combiné à l'absence de standards, à des problèmes de qualité hétérogène et à des inadéquations entre offre et demande, freine concrètement la commercialisation des robots autonomes. En proposant une infrastructure full-stack couvrant la télé-opération réelle, la collecte sans robot dédié et la génération synthétique par simulation, Maniformer cherche à décorréler la production de données de la disponibilité des plateformes robotiques elles-mêmes, une approche qui, si elle tient ses promesses, pourrait accélérer significativement le cycle sim-to-real pour les intégrateurs et les équipes R&D. L'analogie revendiquée avec l'électricité ou l'eau comme utilities est ambitieuse ; elle reste à valider à l'échelle industrielle. L'entreprise s'inscrit dans un contexte de course mondiale aux données d'entraînement pour robots humanoïdes et manipulateurs, où des acteurs comme Physical Intelligence (Pi-0), Boston Dynamics, Figure AI ou Unitree investissent massivement dans leurs propres pipelines de données propriétaires. La stratégie de Maniformer est différente : se positionner en fournisseur tiers d'infrastructure, à la manière d'un AWS pour la donnée physique. L'initiative "Hive" annoncée vise à fédérer des partenaires mondiaux pour co-construire des standards sectoriels, une démarche de standardisation qui, si elle aboutit, pourrait bénéficier à l'ensemble de l'écosystème, y compris aux acteurs européens comme Enchanted Tools ou Wandercraft qui peinent à constituer des datasets suffisants. La prochaine étape annoncée est le déploiement d'un réseau global de collecte de données, sans calendrier précis communiqué au-delà de l'horizon 2026.

UESi l'initiative 'Hive' de standardisation aboutit, les acteurs européens comme Enchanted Tools ou Wandercraft pourraient bénéficier d'une infrastructure de données partagée pour accélérer leurs pipelines sim-to-real.

Chine/AsieActu
1 source
DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale
4Pandaily 

DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale

DeepMotor, une startup pékinoise fondée par Chen Kai au début 2025, développe une approche d'intelligence artificielle incarnée (embodied AGI) basée sur l'entraînement à partir de vidéos en première personne capturées par des humains. Au lancement, la thèse de l'entreprise n'a convaincu ni les investisseurs domestiques ni la majorité du secteur : pourquoi parier sur une méthode que même les géants américains n'avaient pas encore validée ? La startup a levé plusieurs centaines de millions de RMB et poursuit aujourd'hui un déploiement accéléré. La chronologie des validations industrielles donne la mesure de son avance : en mai 2025, Tesla a annoncé réorienter l'entraînement d'Optimus vers des données vidéo humaines. En juin 2025, GeneralistAI a présenté une démo d'apprentissage imitatif robotique, puis a confirmé les lois de mise à l'échelle avec 270 000 heures de données humaines réelles collectées sur le terrain. FigureAI a de son côté annoncé des partenariats avec des opérateurs immobiliers commerciaux pour collecter des flux en première personne. En février 2026, NVIDIA a publié EgoScale, un modèle pré-entraîné sur 20 000 heures de vidéo première personne destiné à la manipulation dextre. L'importance de cette séquence dépasse le simple calendrier. Elle valide l'hypothèse centrale de DeepMotor : la vidéo en vue égocentrique est le signal d'apprentissage le plus dense pour combler le sim-to-real gap en robotique généraliste. Chaque acteur majeur converge vers cette approche non par choix idéologique, mais parce que les benchmarks internes le forcent. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que la prochaine génération de robots manipulateurs ne sera pas entraînée dans des simulateurs mais sur des flux de travail humains réels, ce qui redéfinit les exigences en matière de collecte de données et de gouvernance des contenus vidéo. DeepMotor s'inscrit dans un écosystème robotique chinois en forte accélération, concurrent direct d'Unitree, d'Agibot et des branches robotique de Baidu et Tencent, mais avec une orientation plus fondamentale sur la couche de données brutes plutôt que sur le hardware. La startup a devancé d'environ un an le consensus industriel mondial sur l'approche egocentric data, ce qui lui confère une position de référence potentielle si elle parvient à publier ses propres scaling laws ou à ouvrir un dataset. Les prochaines étapes probables incluent la publication de résultats comparatifs et des partenariats avec des fabricants de robots humanoides pour valider le transfert de politique sur des plateformes tiers. La source originale (Waves/暗涌) reste un media chinois spécialisé, et les chiffres de levée ne sont pas précisément détaillés.

UELe basculement de l'industrie vers les données vidéo égocentristes comme signal d'entraînement de référence redéfinira les exigences de collecte de données et de gouvernance vidéo pour les intégrateurs et fabricants de robots européens, sans acteur français ou européen directement impliqué à ce stade.

Chine/AsieOpinion
1 source