Aller au contenu principal
Zhang Yaqin : l'IA n'est pas une bulle, mais les entreprises d'IA si
Chine/Asie36Kr 

Zhang Yaqin : l'IA n'est pas une bulle, mais les entreprises d'IA si

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Zhang Yaqin, académicien de l'Académie chinoise d'ingénierie et ancien vice-président de Microsoft Research, dirige depuis cinq ans le AIR (Institut de recherche en industrie intelligente de l'Université Tsinghua), qu'il a fondé à Pékin. L'institut a incubé dix entreprises cumulant environ 15 milliards de yuans de levées de fonds et une valorisation totale de 150 milliards de yuans, parmi lesquelles les licornes Huashen Zhiyao (IA pharmaceutique) et Tashi Zhihang. Dans un entretien accordé lors du forum Taihu Dialogue 2026 organisé à Wuxi, Zhang a livré une analyse structurée de l'état réel du marché IA chinois. Sa position centrale : l'IA en tant que technologie ne constitue pas une bulle, mais les valorisations des entreprises IA en sont une. Il situe le secteur à l'équivalent de 1998-1999 pour l'internet, période de déploiement massif d'infrastructures (électricité, calcul, algorithmes), où des acteurs alors dominants comme Yahoo ont disparu tandis que les véritables géants n'étaient pas encore identifiables. Sur le segment robotique, il estime que des centaines d'entreprises sont actuellement en lice, mais que trois à quatre ans suffiront pour n'en retenir qu'une vingtaine ; les grands modèles de langage chinois se consolideront de leur côté en trois à quatre acteurs.

L'analyse de Zhang sur la dynamique d'investissement constitue un signal d'alerte direct pour les décideurs. Il observe que lever des capitaux excessifs sans modèle économique consolidé aboutit dans la plupart des cas à brûler la trésorerie sans convertir en revenus, un schéma qu'il juge structurellement identique à la bulle internet. Il distingue néanmoins une différence qualitative avec 2000 : OpenAI et Anthropic affichent des courbes de revenus sans précédent historique, ce qui justifie partiellement la confiance actuelle du marché. Mais il soulève une question non résolue : les investissements massifs des géants technologiques mondiaux dans les datacenters et les puces pourront-ils se convertir en commandes et revenus réels ? Il fixe une fenêtre d'observation de deux à trois ans comme test décisif. Sur la robotique physique, Zhang maintient son estimation que les robots domestiques généralistes nécessitent encore dix ans ou plus, faute de percées théoriques et algorithmiques suffisantes dans l'interaction homme-machine en environnement ouvert. Les robots industriels et spécialisés, eux, progresseront significativement plus vite.

L'AIR positionne ses travaux à l'intersection de ces limites. L'approche RSR (Real-to-Sim-to-Real), développée par le professeur Zhou Guyue depuis plusieurs années, vise à fermer la boucle entre environnements simulés et monde physique, un problème central du transfert sim-to-real qui freine tout le secteur. Zhang identifie trois manières de pallier le déficit de données physiques : collecte en vue subjective à partir d'interactions humain-environnement, acquisition autonome par les robots eux-mêmes, et génération de données en simulation. Sur l'entrepreneuriat académique, il préconise le modèle professeur-cofondateur ou chief scientist associé à un CEO commercial distinct, plutôt que le professeur PDG à plein temps, jugeant le taux d'échec de ce dernier schéma structurellement élevé aussi bien en Chine qu'aux États-Unis. L'AIR n'est pas un incubateur au sens financier : il produit une à deux entreprises par an, toutes en phase de validation de leur capacité d'exécution commerciale.

À lire aussi

Wang Zhongyuan (BAAI) : les VLA ne mourront pas, mais les modèles du monde sont l'avenir
136Kr 

Wang Zhongyuan (BAAI) : les VLA ne mourront pas, mais les modèles du monde sont l'avenir

Wang Zhongyuan, directeur du Beijing Academy of Artificial Intelligence (BAAI, 北京智源人工智能研究院), institution de recherche non lucrative chinoise, a accordé une interview approfondie au média spécialisé 硬氪 en marge de la conférence annuelle de l'académie, consacrée cette année aux modèles du monde (World Models) et aux agents intelligents. Il y cartographie quatre grandes familles de world models en compétition : les modèles centrés sur le langage comme les VLA et VLM (dont Gemini 3), qui prédisent le prochain token sans comprendre les conséquences physiques ; les modèles centrés sur les pixels comme Sora ou Seedance, efficaces pour la génération vidéo mais aveugles à la causalité physique ; les modèles centrés sur la structure 3D, dont Marble de World Labs (l'équipe de Li Feifei), qui reconstruisent l'espace géométrique sans en modéliser les états physiques ; et les modèles centrés sur la représentation visuelle, comme la série V-JEPA de Yann LeCun, dont l'évolution des embeddings ne correspond pas à l'évolution des lois physiques. BAAI explore une cinquième voie : fusionner représentations linguistiques et visuelles dans un espace latent unifié (latent space), depuis lequel des décodeurs distincts restituent langage, actions et vision selon le besoin, via des systèmes déjà déployables comme Physis et RoboBrain Orca. L'enjeu central, selon Wang, est de substituer au paradigme "Next Token Prediction" des LLM un paradigme "Next Physical State Prediction", soit la prédiction du prochain état physique du monde. Cette bascule est directement liée aux limites exposées par l'IA incarnée (embodied AI) : les robots actuels, qu'ils s'appuient sur des VLA ou des architectures plus simples, restent des exécutants passifs, cantonnés à des tâches mono-scène avec des données très spécifiques. Ils ne généralisent pas. Un robot VLA peut attraper un colis sur une chaîne logistique, mais il est incapable de prédire ce qui se passe si une bouteille ouverte tombe à côté. Wang rejette catégoriquement l'équivalence entre génération vidéo et world model, qui s'est répandue depuis qu'OpenAI a qualifié Sora de "World Simulator" : produire une vidéo physiquement plausible n'est pas modéliser le monde. Un vrai world model doit être physiquement correct (gravité, optique, fluides), doté d'une causalité action-résultat explicite, cohérent sur de longues séquences temporelles, et généralisable à des tâches multiples. Quant au débat "VLA is dead", Wang le tranche sans ambiguïté : les VLA restent utiles aujourd'hui et le resteront à court terme, mais les world models représentent l'étape suivante. BAAI a construit cette position en couches successives depuis le LLM Wudao (悟道), premier grand modèle chinois public, jusqu'aux architectures multimodales natives Emu3 et Emu3.5, avant d'amorcer en 2024 la transition vers la "Next State Prediction". L'académie est aussi un vivier : les fondateurs de Zhipu AI (Tang Jie), Moonshot AI (Yang Zhilin), iFlytek Research (Liu Zhiyuan) et Galactic General Robotics (Wang He) y ont tous conduit des recherches. Côté compétition internationale, BAAI se positionne face à World Labs (Marble), OpenAI (Sora), DeepMind (Genie 2) et au programme V-JEPA de LeCun chez Meta. Wang situe l'état actuel des world models à l'équivalent du deep learning vers 2012 : données fragmentées, benchmarks divergents, pas encore de "moment ChatGPT". Il estime qu'un véritable cerveau robotique à base de world model est un horizon de trois ans minimum, avec des applications prioritaires dans la robotique industrielle, la simulation physique et l'IA for Science.

Chine/AsieOpinion
1 source
Table ronde : tout le monde voit la bulle, mais quand les robots entreront-ils dans des usages réels ?
236Kr 

Table ronde : tout le monde voit la bulle, mais quand les robots entreront-ils dans des usages réels ?

Lors de la conférence WAVES 2026 organisée par 36Kr à Guangzhou fin juin, une table ronde sur la robotique incarnée (具身智能) a réuni six acteurs du secteur : les fondateurs de Shenpu Intelligence et Qiongming Intelligence côté constructeurs, le CEO de Qingtian Rent pour la commercialisation, et trois investisseurs de BV Baidu Ventures, Kailiane Capital et Yunshi Capital. La toile de fond est parlante : la startup Shizhi Hang vient de lever 242 millions de dollars en tour d'amorçage, mais Goldman Sachs a sondé neuf fournisseurs de la chaîne d'approvisionnement robotique chinoise, sans qu'aucun ne rapporte de gros contrat ferme. BV Baidu Ventures, entrée dès 2022 avant la vague spéculative, confirme continuer à investir et à renforcer ses positions existantes. La discussion cartographie ce qui génère concrètement des revenus aujourd'hui. La location courte durée de robots, à quelques milliers de yuans par jour pour cinq à dix unités (comparable à la location d'une Rolls-Royce selon un investisseur du panel), constitue la niche la plus rentable à court terme. La sous-traitance humaine déguisée en collecte de données d'entraînement représente un deuxième flux, tout comme les ventes dans le marché geek/maker et les robots compagnons à forte dimension IP. Qingtian Rent affirme que l'intégralité de ses contrats est rentable en se concentrant sur les tâches "sous le plafond" des capacités actuelles. Les participants reconnaissent unanimement le triangle impossible des robots domestiques : bon marché, fonctionnel et sûr, trois critères impossibles à satisfaire simultanément à ce stade. Les modèles grand public à moins de 10 000 yuans existent, mais restent cantonnés à l'accompagnement ; dès que l'on exige des tâches ménagères réelles, le coût monte immédiatement. Cui Kedi de BV Baidu Ventures cite les combats de robots développés par Zhongqing comme scénario haute intensité utile pour valider les capacités dynamiques, tout en estimant que le secteur reste sous-financé par rapport aux grands laboratoires d'IA générative. BV Baidu Ventures a commencé à investir dans l'intelligence incarnée dès mi-2022, en partant du débordement technologique de la conduite autonome. Li Xiaofei de Shenpu compare l'état actuel au marché de l'autonomie routière en 2017-2018 : la preuve de concept est établie, mais la commercialisation de masse s'inscrit sur un horizon de cinq à dix ans. Sa stratégie dite "1+2+N" (un modèle de base, deux pipelines de données réelles, N scénarios progressifs) privilégie d'abord les environnements structurés comme les hôtels et les établissements de soins avant de viser les foyers. Ce gradualisme rejoint le constat de Wang Zixuan de Yunshi Capital : les robots qui font déjà de l'argent opèrent souvent dans des espaces invisibles, chantiers navals, usines lourdes périphériques, fonds marins, là où l'équation économique est claire avant même que la généralisation soit résolue.

Chine/AsieOpinion
1 source
L'entreprise Ant Group robotique Lingbo adopte une nouvelle approche pour construire les cerveaux des robots
3Pandaily 

L'entreprise Ant Group robotique Lingbo adopte une nouvelle approche pour construire les cerveaux des robots

Ant Group, la maison mère d'Alipay, développe via sa filiale Lingbo une approche inhabituelle pour concevoir des cerveaux de robots, en s'appuyant sur l'immense infrastructure de données et d'intelligence artificielle issue de son écosystème de paiement. Plutôt que de partir du matériel comme la plupart des startups d'IA incarnée, Lingbo privilégie d'abord la couche cognitive. L'entreprise mobilise l'expertise d'Ant Group en traitement transactionnel à haute fréquence, en prise de décision en temps réel dans l'incertitude et en inférence distribuée à grande échelle, des compétences accumulées sur plusieurs années à traiter des milliards de transactions quotidiennes via Alipay (détection de fraude, évaluation de risque, recommandation personnalisée). Lingbo entend transposer cette infrastructure vers la robotique pour bâtir un cerveau robotique capable de gérer la complexité et l'incertitude du monde physique avec la même fiabilité que le traitement financier. L'unité bénéficie d'une autonomie importante au sein d'Ant Group et attire des talents issus à la fois de la recherche en IA et de l'industrie robotique. Aucun produit concret ni calendrier commercial n'a été rendu public à ce stade. Cette stratégie illustre un mouvement plus large : des acteurs de la tech et de la finance entrent dans la course à l'IA incarnée en misant sur leurs atouts logiciels et data plutôt que sur la fabrication de matériel. Pour Lingbo, la partie la plus valorisable de la chaîne robotique ne serait pas la mécanique mais la couche d'intelligence, un pari qui, s'il se confirme, redistribuerait les cartes face aux spécialistes du hardware comme les fabricants d'humanoïdes. Pour les intégrateurs et décideurs industriels, ce positionnement pose une question stratégique : la donnée comportementale et transactionnelle à l'échelle d'Alipay, plusieurs centaines de millions d'utilisateurs, peut-elle vraiment se transférer à la compréhension d'un environnement physique et à la décision robotique ? Rien dans les éléments communiqués ne le démontre encore, et l'annonce reste à ce stade programmatique plutôt que prouvée par un produit déployé. Elle mérite néanmoins d'être suivie car elle traduit un changement de doctrine : dans un paysage chinois où les plateformes matérielles se banalisent, l'avantage compétitif se déplacerait vers le logiciel, la donnée et l'infrastructure de déploiement. Ant Group a construit ses capacités d'IA sur plusieurs années, d'abord pour la détection de fraude et la gestion des risques sur Alipay, avant d'intégrer des assistants IA à l'échelle de son écosystème, utilisés par des centaines de millions de personnes. Lingbo s'inscrit dans le prolongement naturel de cette expansion technologique vers le monde physique, dans un contexte où la Chine voit fleurir de multiples acteurs robotiques, qu'il s'agisse de fabricants d'humanoïdes ou de laboratoires développant des modèles généralistes de type VLA (vision-language-action), comparables aux Pi-0 ou GR00T N2 développés aux États-Unis. Contrairement à des concurrents qui présentent déjà des démonstrateurs matériels, Lingbo n'a pour l'instant communiqué ni prototype ni partenariat industriel identifié, ce qui place la démarche au stade de la déclaration d'intention stratégique. Les prochaines étapes à surveiller seront la première présentation publique d'un système intégré, d'éventuels partenariats avec des fabricants de plateformes robotiques, et la manière dont Ant Group articulera cette activité avec ses autres investissements en IA générative.

Chine/AsieOpinion
1 source
Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution
436Kr 

Marché de l'IA physique encore ouvert : une entreprise chinoise propose l'approche 'edge-native' comme nouvelle solution

Au premier trimestre 2026, les investissements mondiaux dans le Physical AI ont dépassé 6,4 milliards de dollars, avec des levées emblématiques : AMI Labs (1,03 milliard de dollars en seed), World Labs (1 milliard) et le chinois Qianxun Intelligence (4,5 milliards de yuans en quatre tours en mars). C'est dans ce contexte qu'Om AI, une startup chinoise, a présenté du 27 au 29 juin 2026 une suite de trois modèles, VLX-Flow, VLX-Seek et VLX-Go, positionnée non pas sur la manipulation dextère ni la planification longue portée, mais sur la perception visuelle continue, la localisation spatiale précise et la navigation autonome. VLX-Flow utilise une attention linéaire (Linear Attention) couplée à une double mémoire (cache visuel et carryover textuel) pour ingérer le flux vidéo en continu, à la différence du paradigme classique qui traite des images isolées. VLX-Seek substitue la génération de coordonnées par une référence de région, fournissant des ancres spatiales à précision millimétrique. VLX-Go produit directement des trajectoires de waypoints exécutables via prédiction court-terme, apprentissage hors-ligne et optimisation RL en ligne. L'approche d'Om AI soulève un angle mort que les architectures VLA et world model dominantes n'ont pas encore résolu : dans les VLA mainstream, le tronc LLM absorbe plus de 90 % des ressources de calcul et des données, reléguant la tête d'action en composant chroniquement sous-entraîné. Les world models, censés combler ce déficit via la simulation physique, butent sur la rareté des données haute qualité à l'échelle requise. Or, la majorité des terminaux physiques déployés, drones en environnement GPS-dégradé, robots quadrupèdes, lunettes AR, terminaux d'inspection industrielle, n'ont pas besoin de mains dextères : ils ont besoin de localisation fiable et de perception continue. En repositionnant le problème sur la vision edge-native plutôt que sur la génération d'actions complexes, Om AI cible un segment plus large et potentiellement plus rapidement déployable que les humanoïdes, à condition que ses benchmarks se confirment hors des vidéos de démonstration sélectionnées. NVIDIA a présenté au GTC 2026 Alpamayo (VLA propriétaire) et Isaac GR00T N1.6 (VLA open-source pour humanoïdes) ; Xiaopeng a dévoilé X-Foresight au CVPR 2026 ; Google DeepMind avait publié Genie 3 en août 2025. La Beijing Academy of AI (BAAI) recense quatre routes de world models sans consensus industriel : centrée langage (Gemini 3), pixel (Sora), 3D (World Labs Marble de Fei-Fei Li) et représentation visuelle (V-JEPA de Yann LeCun). Les projections de marché divergent fortement : Future Markets table sur 383 milliards de dollars en 2026 croissant à 32 600 milliards en 2040, tandis que Coatue Management anticipe au moins 6 000 milliards, soit 50 % de plus que le digital AI. Om AI n'a pas encore communiqué de clients industriels nommés ni de volumes de déploiement pour sa suite VLX, ce qui reste la prochaine étape déterminante.

Chine/AsieOpinion
1 source