Aller au contenu principal
Pénurie de données » : le véritable frein qui bride l'IA incarnée en Chine
Chine/AsiePandaily 

Pénurie de données » : le véritable frein qui bride l'IA incarnée en Chine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Au World Robot Conference de Beijing cette année, l'attention s'est déplacée des démonstrations spectaculaires de robots vers des stands où des opérateurs humains, casque et gants de téléopération sur la tête et les mains, "enseignent" des gestes à des pinces robotiques dont chaque mouvement est enregistré comme donnée d'entraînement. Une nouvelle catégorie d'acteurs, qualifiés d'"infrastructure de données" ou de "fondation de données pour l'IA physique", s'est imposée en nombre, signe d'un basculement de la démonstration vers l'alimentation en données. Xia Hualin, qui dirige la base de données et d'entraînement du Beijing Humanoid Robotics Innovation Center, estime que l'IA incarnée réclame plusieurs ordres de grandeur de données de plus que la conduite autonome. La China Academy of Information and Communications Technology recense plus de 70 sites d'entraînement opérationnels fin juin, avec 46 autres planifiés ou en construction, un volume jugé encore très insuffisant. Une estimation du secteur chiffre à environ 500 000 heures les données réelles d'interaction physique conformes disponibles en Chine, alors que la commercialisation exigerait des dizaines de millions d'heures, soit un déficit de plus de 99 %. Le travail de collecte s'est complexifié : une simple tâche de tri de pièces a déjà généré entre 30 000 et 40 000 points de données, et le standard pour "porter un plateau" est passé d'un simple geste de saisie-déplacement-dépôt à un maintien de l'équilibre en marchant. Wang Chuang, associé chez AgiBot, situe la bascule entre l'ère de la démonstration en 2024 et la production de masse et le déploiement réel visés pour 2025-2026. En juin, le ministère de l'Industrie et des Technologies de l'information et le régulateur des actifs publics ont lancé un plan d'action 2026 ciblant plus de 100 scénarios d'usage à forte valeur et des dizaines de milliers d'unités déployées d'ici la fin de l'année.

Ce constat déplace le vrai goulot d'étranglement de l'humanoïde chinois : ce n'est plus la mécanique ou l'algorithme qui bride le déploiement, mais l'approvisionnement en données physiques réelles, un problème que le texte ou les corpus de conduite autonome ne peuvent pas résoudre par transfert. Cela nuance directement le récit dominant d'un sim-to-real résolu ou de modèles vision-langage-action prêts à s'industrialiser à grande échelle : sans force, toucher distribué et couple moteur, la vidéo seule ne suffit pas à rendre une saisie fiable. Pour les intégrateurs et décideurs industriels, cela signifie que le calendrier de déploiement des humanoïdes dépend désormais autant d'une chaîne d'approvisionnement en données que du matériel lui-même.

Ce virage s'inscrit dans la course chinoise à l'humanoïde portée par des acteurs comme AgiBot, UBTech ou Unitree, après deux années dominées par des vitrines technologiques. Les sites d'entraînement sont désormais conçus comme des "écoles complètes" couvrant la marche basique jusqu'aux opérations industrielles de précision, combinant téléopération en réalité virtuelle, capture de mouvement portable et collecte sur robots réels. Tant que ce déficit de données ne se résorbe pas, prévient Xia Hualin, les robots humanoïdes peineront à se défaire de leur image de jouets téléguidés.

À lire aussi

La Chine ouvre plus de 70 sites d'entraînement pour l'IA incarnée, une norme de jeux de données attendue le 1er novembre
1Pandaily 

La Chine ouvre plus de 70 sites d'entraînement pour l'IA incarnée, une norme de jeux de données attendue le 1er novembre

La Chine a ouvert plus de 70 sites d'entrainement pour l'IA incarnée (embodied AI) a fin juin 2026, avec plus de 40 sites supplémentaires en construction ou en planification, selon un rapport de l'Academie chinoise des technologies de l'information et des communications (CAICT) cite par Economic Information Daily et relaye en anglais par Xinhua le 22 septembre. Ces installations, parfois surnommées "écoles de robots", se concentrent dans le delta du Yangtze, la région Pekin-Tianjin-Hebei et le delta de la rivière des Perles: le Zhejiang arrive en tête avec 14 sites, suivi du Jiangsu, de Pekin, du Guangdong et du Shandong avec huit chacun. La Chine compte plus de 140 fabricants de robots humanoïdes et a livre environ 14 400 unités en 2025, soit environ huit livraisons mondiales sur dix selon Xinhua. Sur ces sites, des opérateurs en capture de mouvement génèrent des trajectoires annotées a partir de taches répétitives comme saisir des bouteilles, charger des plateaux ou scanner des colis. Dans le Guangdong, le site provincial sert aussi de plateforme de mise en relation entre fabricants de robots et utilisateurs des secteurs santé et énergie, tandis que la base pilote nationale de Hangzhou se positionne comme connecteur mutualise entre entreprises publiques, groupes technologiques et partenaires applicatifs, avec des porteurs de projet qui évoquent des économies importantes par rapport a la constitution de jeux de données propriétaires. Cette annonce révèle un gouffre persistant entre le volume de déploiement de robots humanoïdes et leur fiabilité réelle en usage quotidien: malgré une production de masse, les fabricants chinois restent freines par la raretee de données d'interaction en conditions réelles, ce qui confirme que le "sim-to-real gap" n'est pas résolu par le seul volume de simulation. Pour les intégrateurs et décideurs B2B du secteur robotique, le signal est celui d'une infrastructure nationale de collecte de données plutôt que d'un produit ou d'un modèle fini a l'américaine (a comparer aux approches Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, davantage centrées sur les modèles VLA). Cette approche par volume de terrains d'entrainement, combinée a une normalisation imminente de la qualité des jeux de données, pourrait accélérer la maturité opérationnelle des flottes chinoises et redistribuer la compétition mondiale, jusqu'ici dominée par le narratif américain autour des VLA (vision-language-action). Cette dynamique s'inscrit dans la continuité d'une politique industrielle déjà engagée: en juin 2026, le ministère de l'Industrie et des Technologies de l'information (MIIT) et la Commission de supervision et d'administration des actifs publics (SASAC) ont lance une action spéciale demandant a chaque région provinciale d'identifier au moins 20 scenarios prioritaires et de créer des espaces d'entrainement et de test nécessitant un aménagement minimal. Parallelement, une norme industrielle sur la qualité des jeux de données d'IA incarnée, rédigée par le CAICT avec plus de 40 organisations, doit entrer en vigueur le 1er novembre 2026, avec l'objectif de faire passer le secteur d'une logique de collecte massive a une logique de qualité et d'évaluation. Des opérateurs testent aussi des modèles économiques allant au-delà de la simple vente de données brutes, comme le "training-as-a-service" combinant collecte, entrainement de modèles et validation applicative. Aucun acteur français ou européen (Wandercraft, Exotec, Pollen Robotics, Enchanted Tools) n'est mentionne dans cette annonce, qui reste centrée sur l'écosystème chinois et ses partenaires industriels domestiques.

UEAucun acteur français ou européen n'est impliqué, mais l'avance chinoise en volume de données d'entraînement terrain pourrait creuser l'écart de maturité opérationnelle face aux fabricants de robots humanoïdes européens.

Chine/AsieActu
1 source
DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale
2Pandaily 

DeepMotor : une startup de Pékin mise sur les données en première personne pour une IA incarnée générale

DeepMotor, une startup pékinoise fondée par Chen Kai au début 2025, développe une approche d'intelligence artificielle incarnée (embodied AGI) basée sur l'entraînement à partir de vidéos en première personne capturées par des humains. Au lancement, la thèse de l'entreprise n'a convaincu ni les investisseurs domestiques ni la majorité du secteur : pourquoi parier sur une méthode que même les géants américains n'avaient pas encore validée ? La startup a levé plusieurs centaines de millions de RMB et poursuit aujourd'hui un déploiement accéléré. La chronologie des validations industrielles donne la mesure de son avance : en mai 2025, Tesla a annoncé réorienter l'entraînement d'Optimus vers des données vidéo humaines. En juin 2025, GeneralistAI a présenté une démo d'apprentissage imitatif robotique, puis a confirmé les lois de mise à l'échelle avec 270 000 heures de données humaines réelles collectées sur le terrain. FigureAI a de son côté annoncé des partenariats avec des opérateurs immobiliers commerciaux pour collecter des flux en première personne. En février 2026, NVIDIA a publié EgoScale, un modèle pré-entraîné sur 20 000 heures de vidéo première personne destiné à la manipulation dextre. L'importance de cette séquence dépasse le simple calendrier. Elle valide l'hypothèse centrale de DeepMotor : la vidéo en vue égocentrique est le signal d'apprentissage le plus dense pour combler le sim-to-real gap en robotique généraliste. Chaque acteur majeur converge vers cette approche non par choix idéologique, mais parce que les benchmarks internes le forcent. Pour les intégrateurs industriels et les décideurs B2B, cela signifie que la prochaine génération de robots manipulateurs ne sera pas entraînée dans des simulateurs mais sur des flux de travail humains réels, ce qui redéfinit les exigences en matière de collecte de données et de gouvernance des contenus vidéo. DeepMotor s'inscrit dans un écosystème robotique chinois en forte accélération, concurrent direct d'Unitree, d'Agibot et des branches robotique de Baidu et Tencent, mais avec une orientation plus fondamentale sur la couche de données brutes plutôt que sur le hardware. La startup a devancé d'environ un an le consensus industriel mondial sur l'approche egocentric data, ce qui lui confère une position de référence potentielle si elle parvient à publier ses propres scaling laws ou à ouvrir un dataset. Les prochaines étapes probables incluent la publication de résultats comparatifs et des partenariats avec des fabricants de robots humanoides pour valider le transfert de politique sur des plateformes tiers. La source originale (Waves/暗涌) reste un media chinois spécialisé, et les chiffres de levée ne sont pas précisément détaillés.

UELe basculement de l'industrie vers les données vidéo égocentristes comme signal d'entraînement de référence redéfinira les exigences de collecte de données et de gouvernance vidéo pour les intégrateurs et fabricants de robots européens, sans acteur français ou européen directement impliqué à ce stade.

Chine/AsieOpinion
1 source
TARS lève 455 millions de dollars en pré-série A, un record dans l'IA incarnée en Chine
3Pandaily 

TARS lève 455 millions de dollars en pré-série A, un record dans l'IA incarnée en Chine

La start-up chinoise TARS, spécialisée en IA incarnée et robotique humanoïde, a bouclé un tour Pre-A de 455 millions de dollars (environ 3,3 milliards de yuans), record absolu pour un tour de table unique dans le secteur de l'IA incarnée en Chine. Largement sursouscrit, il a été codirigé par Hillhouse Ventures, HSG (ex-Sequoia China) et Meituan Strategic Investment, cornerstone stratégique, avec la participation de CICC Capital, Qiming Venture Partners, BlueRun Ventures, TCL Capital et Shoucheng Holdings (0697.HK, Hong Kong). Fait notable, le Beijing Robotics Industry Development Investment Fund et le Shanghai Guotou Pioneer Fund y participent, une première pour des fonds publics chinois dans ce secteur. Un an plus tôt, au deuxième trimestre 2025, TARS avait déjà levé 242 millions de dollars (1,75 milliard de yuans) en amorçage, alors plus gros "angel round" jamais réalisé en Chine dans l'IA incarnée. Ce doublé de records en douze mois illustre l'intensité de la course aux capitaux qui s'engage en Chine autour de la robotique humanoïde, les investisseurs concentrant leurs paris sur une poignée d'acteurs jugés capables de passer de la démonstration à des déploiements industriels réels. La diversité des souscripteurs, fonds financiers, corporate venture (Meituan, TCL), capital industriel et désormais capitaux publics, traduit une consolidation autour de quelques champions plutôt qu'une dispersion sur de nombreuses start-up. L'entrée de fonds liés au plan quinquennal chinois pour la robotique confirme que Pékin traite l'IA incarnée comme une priorité stratégique nationale, ce qui pourrait faciliter l'accès de TARS à des contrats publics et des sites d'essai. L'article ne fournit toutefois aucune métrique produit ni preuve de traction commerciale : à ce stade, c'est un signal financier fort, pas un déploiement vérifié. TARS s'inscrit dans la vague de jeunes pousses chinoises de robotique humanoïde apparue depuis 2024, aux côtés d'Unitree, d'AgiBot (Zhiyuan Robotics) ou d'UBTech, dans un marché où Pékin, Shanghai et Shenzhen rivalisent pour le statut de pôle national. Le communiqué, relayé par IPOzaozhidao, ne précise ni feuille de route produit ni calendrier de déploiement ou de prochain tour, laissant la conversion de ce capital en contrats industriels vérifiables comme prochaine étape à observer.

Chine/AsieOpinion
1 source
WRC 2026 : 90 usines de données, mais pas assez pour nourrir un seul cerveau d'IA incarnée
4Pandaily 

WRC 2026 : 90 usines de données, mais pas assez pour nourrir un seul cerveau d'IA incarnée

Au World Robot Conference (WRC) 2026, organisé à Pékin dans le district de Yizhuang, l'attention s'est déplacée des performances physiques des robots vers la capacité à collecter des données d'entraînement. Selon une étude d'Interact Analysis, au moins 90 centres de collecte et d'entraînement de données pour robots humanoïdes sont déjà opérationnels ou en construction en Chine. Lightwheel AI a dévoilé EgoSuite-Open100k, présenté comme le plus grand jeu de données incarnées en accès ouvert à ce jour, avec 100 000 heures réparties sur plus de 15 000 scénarios. ORBBEC a montré une gamme de capteurs sans corps robotique, dont des dispositifs de capture à la première personne et portables à la main, tandis que BrainCo a exposé des gants de capture couplés à des mains dextres tactiles sur toute la paume. GigaDevice a présenté des microcontrôleurs, mémoires et composants analogiques dédiés à l'intelligence incarnée. Tian Feng, chercheur à l'Intelligent Industries Research Institute de SenseTime, a détaillé six paradigmes de collecte en parallèle, de la téléopération et la capture de mouvement aux données synthétiques et à la collecte réelle sur ligne de production, la méthode sans corps robotique progressant le plus vite avec un coût annoncé environ cinq fois inférieur à la collecte via robot physique. Ce basculement traduit un doute croissant sur la transposition à la robotique des lois d'échelle qui ont fonctionné pour les grands modèles de langage. Une expérience de Generalist AI menée en novembre 2025 montre que les modèles de petite taille peinent à absorber des données sensorimotrices complexes, avec un seuil situé autour de sept milliards de paramètres, phénomène que les auteurs qualifient d'« ossification du modèle ». Tian Feng tempère lui-même l'engouement pour la capture sans corps robotique : elle sacrifie des informations dynamiques comme le couple articulaire et la force de contact, risquant de nuire aux tâches d'assemblage fin, et des échantillons collectés par des opérateurs plutôt que de vrais ouvriers introduisent un biais systématique. La fragmentation du matériel robotique aggrave le problème, rendant les données d'un corps difficilement réutilisables sur un autre. Pour les intégrateurs et décideurs B2B, le signal est clair : multiplier les usines à données ne garantit pas un gain de performance réel, et le goulot d'étranglement du secteur tient peut-être moins à la rareté des données qu'à leur standardisation et à leur valorisation commerciale. Les analystes mettent en garde contre une boucle comptable qui combine financements publics, achats groupés de robots et rachats de données par les mêmes acteurs, gonflant les statistiques sans valider de demande réelle. Les chiffres d'IDC pour 2025 le confirment : les scénarios de démonstration, de recherche et de collecte de données représentent encore 78,4 % des livraisons de robots humanoïdes, contre une part marginale en ligne de production. Le WRC 2026 illustre un secteur toujours concentré sur l'entraînement des modèles d'intelligence incarnée (VLA) plutôt que sur le déploiement industriel, la convergence entre volume de données, standardisation matérielle et revenus commerciaux devant déterminer si cette vague d'investissement produit des robots réellement opérationnels.

Chine/AsieOpinion
1 source