Aller au contenu principal
L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique
Chine/Asie36Kr 

L'ex-directeur du laboratoire robotique et véhicules autonomes de Baidu lève des dizaines de millions pour créer un modèle du monde universel pour la robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Nüwa Robotics (纽娲机器人), startup chinoise fondée en février 2026 par le Dr Yang Ruigang, vient de boucler un tour angel de 50 millions de yuans (environ 6,9 millions d'euros), mené par Bluerun Ventures, avec la participation de Butong Capital et de Gongqingcheng Puyi Investment. C'est le deuxième financement en moins de deux mois : un seed round avait été conduit par Plug and Play Chine peu avant. Yang Ruigang est une figure connue de l'écosystème autonomie chinois : il a dirigé le laboratoire de conduite autonome et de robotique de Baidu, puis exercé comme CTO d'Inceptio Technology (嬴彻科技), où il a piloté la mise en production de camions autonomes de niveau L3. Aujourd'hui professeur associé à l'Université Jiao Tong de Shanghai, il oriente Nüwa vers un objectif précis : la construction d'un "World Traversal Model" (WTM), un modèle de navigation destiné à des robots de toute morphologie, humanoïdes, quadrupèdes, AGV ou véhicules de livraison.

Le pari de Nüwa repose sur un constat que le secteur commence à intérioriser : la mobilité dans les environnements humains reste un verrou sous-estimé de la robotique incarnée. Là où la majorité des acteurs se concentrent sur la manipulation ou les architectures VLA (Vision-Language-Action), Nüwa cible la couche locomotion-navigation avec une ambition de déploiement sans carte ou à partir de plans génériques (Gaode, Baidu Maps). Leur moteur de simulation maison, SimWeaver, affiche selon la société des performances 3x supérieures à NVIDIA ISAAC Sim en vitesse de génération de données, une réduction de 20 % de l'erreur sim-to-real, et un taux de succès en zero-shot de 91 % sur des tâches de manipulation d'objets flexibles. Ces chiffres sont auto-déclarés et non vérifiés par des tiers. En locomotion, le système parvient à franchir des escaliers creux inclinés à 55 degrés en combinant vision et proprioception, là où d'autres solutions procèdent en aveugle. Nüwa intègre également un module de "conformité sociale" : le modèle est entraîné à respecter des règles comportementales implicites comme laisser sortir avant d'entrer dans un ascenseur ou céder le passage en espace public.

Nüwa s'inscrit dans un paysage compétitif où les grandes architectures sont déjà définies : chez Figure, le modèle Helix (System 0/1/2) sépare planification lente et contrôle rapide ; NVIDIA GR00T N1 suit une logique similaire ; en Chine, Zhiyuan (智元) découpe locomotion, manipulation et interaction, tandis que Tencent RoboticsX structure son architecture SLAP en quatre couches. Nüwa choisit une entrée différente : transférer les acquis de l'autonomie véhiculaire vers des environnements beaucoup plus denses (ascenseurs, couloirs, centres commerciaux), en capitalisant sur la maîtrise de la simulation physique 3D de l'équipe. Le fondateur reconnaît que la brique manipulation reste à construire from scratch, sans analogue dans la conduite autonome. La feuille de route prévoit un premier déploiement du WTM dans un à deux scénarios réels en 2026, logistique et tourisme en priorité, avant une montée en puissance vers la production de robots propres à Nüwa et l'ouverture de la plateforme à des intégrateurs tiers. Aucun client ni partenaire industriel nommé n'a été annoncé à ce stade.

Impact France/UE

L'émergence de Nüwa illustre la compétition croissante de l'écosystème robotique chinois sur la couche navigation-locomotion, un segment encore peu occupé par les acteurs européens, sans impact opérationnel immédiat pour la France/UE.

À lire aussi

L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée
136Kr 

L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée

AtomBite.AI (元节智能), startup chinoise d'intelligence incarnée, vient de boucler un tour d'amorçage de plusieurs dizaines de millions de yuans mené par le fonds Yinno Innovation, avec la participation du Shuimu Tsinghua Alumni Seed Fund. La société cible un terrain peu médiatisé mais à forte récurrence : la cuisine professionnelle de restauration et la chaîne d'exécution des commandes de livraison de repas. Son équipe fondatrice porte l'ADN de Meituan : Wang Dong (CEO, docteur en informatique) y dirigeait l'ingénierie de Meituan Waimai, supervisant mille ingénieurs et des algorithmes traitant des dizaines de millions de commandes quotidiennes ; Li Tao pilotait les systèmes algorithmiques et data de la même division ; Li Haozhe, troisième co-fondateur, est un entrepreneur en série à dimension internationale. La technologie centrale est un "World Action Model" (WAM) dédié à la restauration, décliné en architecture VT-WAM combinant vision et retour tactile, en rupture explicite avec l'approche VLA (Vision-Language-Action) dominante dans le secteur. Un premier déploiement pilote en cuisine professionnelle est attendu d'ici fin 2026, avec plusieurs lettres d'intention déjà signées avec des opérateurs nationaux et internationaux. Le choix de la restauration résulte d'un audit de plusieurs mois conduit en Amérique du Nord et à Singapour. Wang Dong y a identifié un triptyque rare : besoin universel (même problématique en Chine, aux États-Unis et en Asie du Sud-Est), ROI mesurable pour le restaurateur (réduction des erreurs de commande, gains à l'emballage, allègement de la masse salariale) et cycle de décision court chez les PME, contrairement aux scénarios domestiques ou médico-sociaux. L'industrie est structurellement sous pression : hausse soutenue des salaires horaires en Amérique du Nord, turnover chronique et difficultés de recrutement persistantes en Chine. Sur le plan technique, AtomBite.AI conteste le paradigme VLA en affirmant que le contrôle moteur réel ne passe pas par le langage mais par la compréhension visuelle et physique. L'approche VT-WAM fusionne ces deux modalités dans un espace latent pour prédire les conséquences de contact avant exécution : inférer si un gobelet est plein ou chaud modifie les forces de friction et le centre de gravité lors de la saisie, ce que la vision seule ne permet pas de capturer. AtomBite.AI prend le contre-pied de la stratégie "modèle universel d'abord" adoptée par la plupart de ses concurrents. Les opérations répétitives de la cuisine, emballage, tri et transfert de commandes, génèrent un flux naturel de données d'interaction physique difficile à reproduire en simulation, alimentant un cycle d'amélioration continue du modèle depuis le terrain réel. L'architecture se décompose en trois couches : modèle monde incarné pour la perception et la planification d'actions, moteur d'orchestration des tâches, et couche matérielle combinant composants propriétaires et hardware standard. Les gestes récurrents s'exécutent en local sur des modèles légers pour limiter la latence ; le cloud gère les exceptions comme un ingrédient manquant ou un objet détecté hors place. Sur ce segment, Miso Robotics aux États-Unis et Keenon Robotics en Chine sont déjà présents, sur des périmètres différents (friture automatisée, service en salle). La feuille de route prévoit une extension progressive vers le tri, la logistique interne de restaurant, et à terme la cuisine domestique.

Chine/AsieActu
1 source
Jing Yue Dongli lève des dizaines de millions de yuans auprès de Xinghaitu pour développer un Robo Labor clé en main
236Kr 

Jing Yue Dongli lève des dizaines de millions de yuans auprès de Xinghaitu pour développer un Robo Labor clé en main

Jingyue Dynamics (鲸跃动力), fondée début 2026 en Chine, vient de boucler un tour de table seed de plusieurs dizaines de millions de yuans, mené exclusivement par le fonds spécialisé Xinghaitu (星海图), avec Shendu Capital comme conseiller financier exclusif. La startup développe ce qu'elle désigne sous le terme "Robo Labor" : une force de travail robotique conçue sur le modèle de l'infrastructure cloud - abonnable, élastiquement scalable, opérationnelle dès la livraison. L'ambition est de mécaniser les tâches dites "4D" (Deadly, Difficult, Dirty, Duplicate) en commençant par la manutention de matériaux (material handling) dans les secteurs de la logistique et de l'industrie manufacturière. La startup indique avoir noué des partenariats avec plusieurs grands comptes dans ces secteurs, sans les nommer. Les fonds seront alloués au recrutement, à la livraison en production, au développement de compétences spécialisées et aux opérations de collecte de données terrain. La proposition technique de Jingyue repose sur une boucle fermée "données + modèle + effecteur terminal", délibérément en rupture avec la course aux très grands modèles. Son fondateur Li Guangyu défend qu'un modèle scénarisé, alimenté par des données réelles de qualité, suffit à une mise en production rapide. La startup a conçu un système de collecte propriétaire Ego-centric + UMI (Universal Manipulation Interface) offrant une localisation de pose sub-millimétrique et une synchronisation multi-source sub-milliseconde sur les signaux visuels, de force et de position. Un pipeline interne traite jusqu'à un million d'heures de données, couplé à une approche Human-in-the-Loop permettant des corrections en temps réel et une opérabilité garantie dès le "Day 1". Leur modèle 3D du monde intègre la compréhension physique - gravité, friction, déformation - pour franchir le saut de la simple "perception-exécution" vers un régime "cognition-prédiction-adaptation". Pour les intégrateurs B2B, le modèle d'accès est présenté comme direct : connexion hardware, interfaçage des capteurs, puis appel de "skills" prépackagés - une architecture plus proche d'une API robotique que d'un projet d'intégration sur mesure, ce qui reste à vérifier en conditions industrielles réelles. Li Guangyu est docteur en génie électrique de l'USC (University of Southern California) ; il a dirigé les équipes de manipulation dextre et de collecte de données au Beijing Humanoid Robot Innovation Center, pilotant notamment le dataset multimodal RoboMIND et l'agent embodied "慧思开物". Auparavant chez DiDi et Qingzhou Zhihang (autonomie routière), il a construit des pipelines de données à l'échelle du million de séquences. L'équipe fondatrice intègre des vétérans de Geek+ (robots AMR), Neolix, Li Auto, Xiaomi et DiDi, formés à l'USC, Tsinghua, Zhejiang et l'USTC. Sur le plan concurrentiel, le paradigme "data-first" pour l'intelligence embodied a été validé à l'international par Sunday, Generalist AI et Genesis AI, qui ont tous convergé vers l'approche Ego-centric + UMI que Jingyue a adoptée. La startup se positionne explicitement comme une plateforme de skills ouverts, transversale aux intégrateurs hardware, plutôt que comme un constructeur de plateforme humanoide - un pari sur l'hypothèse que la qualité et l'efficacité des données seront le vrai différenciateur dans la prochaine phase de scaling de la robotique embodied.

UESignal concurrentiel indirect : l'émergence en Chine de plateformes de 'skills' robotiques open-hardware (modèle API) pourrait accélérer la pression sur les intégrateurs européens dans la logistique et le manufacturing, mais aucun déploiement en Europe n'est annoncé.

Chine/AsieActu
1 source
Exclusif : une startup issue de Tsinghua lève plusieurs centaines de millions de yuans, sans vouloir de l'étiquette « modèle du monde »
336Kr 

Exclusif : une startup issue de Tsinghua lève plusieurs centaines de millions de yuans, sans vouloir de l'étiquette « modèle du monde »

La startup chinoise Liqing Zhineng (厘清智能, "Clarity Intelligence"), fondée en avril 2026 à Pékin, a bouclé un tour d'amorçage de plusieurs centaines de millions de yuans (soit plusieurs dizaines de millions d'euros), révélé début juillet par le média chinois Zhinen Yongxian. Le tour réunit Shunwei Capital, Sequoia Chine, Hillhouse Ventures, FreeS Fund, Xinglian Capital, le fonds d'amorçage des alumni de Tsinghua, SEE Fund, ainsi que des investisseurs industriels comme AgiBot (智元机器人), Linker Hand (灵心巧手) et Century Golden Resources. L'équipe, adossée au laboratoire de Li Yiming, professeur assistant à l'école d'intelligence artificielle de Tsinghua et ancien chercheur Vision & Robotics chez Nvidia (bourse Nvidia 2024, dix lauréats dans le monde), compte une cinquantaine de membres d'une moyenne d'âge de 23 ans. Le produit central est une infrastructure baptisée "Physical AI Infra", construite autour de deux briques maison : un pipeline de collecte de données visant à passer de la centaine de milliers d'heures habituelle du secteur à plusieurs millions, voire dizaines de millions d'heures, via notamment des gants tactiles propriétaires dont le coût unitaire est ramené du niveau du dollar à celui du yuan ; et un moteur physique différentiable permettant une boucle "réel vers simulation vers réel", capable de modéliser des matériaux complexes (fluides, corps mous, déformations élastoplastiques). L'ensemble cible des gestes fins comme couper, visser, brancher, mélanger, presser ou enfiler, avec un objectif de portabilité entre différentes mains articulées et bras robotiques, pour des usages en usine, retail, hôtellerie, restauration et assistance médicale. Le positionnement de Li Yiming tranche avec l'engouement actuel pour les "world models" (modèles du monde), qu'il juge être la notion la plus galvaudée de 2026, tant les acteurs vidéo, 3D ou VLA (vision-langage-action) s'en réclament dès qu'ils touchent à la simulation physique. Sa thèse : le modèle du monde n'est qu'un composant technique parmi d'autres, sans valeur isolé du reste de la chaîne (données, matériel, déploiement) ; ce qui compte, c'est un système capable de généraliser à travers robots et scénarios. Il affirme ainsi pouvoir entraîner des politiques avec environ 1% du volume de données réelles habituellement nécessaire, en calibrant les transitions d'état du modèle de monde sur un petit échantillon de données réelles puis en laissant le robot s'entraîner par renforcement en simulation, l'exemple cité étant l'apprentissage de la découpe d'une pomme sans détruire des centaines d'exemplaires. Ces chiffres, avancés par le fondateur lui-même sans validation indépendante, restent à confirmer sur des déploiements réels plutôt que sur des démonstrations internes. Le parcours de Li Yiming inclut un doctorat à NYU avec des travaux co-signés avec Saining Xie (cofondateur et chercheur en chef d'AMI Labs), ainsi que plusieurs publications distinguées à CVPR et NeurIPS en collaboration avec Nvidia. La feuille de route affichée prévoit la sortie d'un modèle du monde généralisable à plusieurs scénarios B2B d'ici fin 2026, puis un passage à l'échelle commerciale visé pour 2028, avec pour ambition de livrer aux clients une solution matériel-logiciel intégrée plutôt qu'un simple modèle. Ce pari sur une intégration verticale complète, de la collecte de données au moteur physique en passant par le matériel de capture, reste rare en Chine où la plupart des équipes de robotique physique se concentrent sur un seul maillon de la chaîne ; il positionne Liqing Zhineng en concurrence indirecte avec les autres poids lourds chinois de l'IA incarnée comme AgiBot, qui figure aussi parmi ses investisseurs.

Chine/AsieActu
1 source
Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique
436Kr 

Yisheng Technology, fondée par un professeur de HKU, lève des centaines de millions pour un système mémoriel robotique

La startup chinoise TranscEngram (忆生科技), fondée en septembre 2023 par le professeur Yi Ma, doyen fondateur de la faculté d'informatique et de science des données de l'Université de Hong Kong, avec ses cofondateurs Gao Shenghua et Yang Yanchao, vient de boucler un tour d'amorçage de plusieurs centaines de millions de yuans. Parmi les investisseurs figurent Sino Biopharmaceutical (filiale du groupe CP), Pudong Chuangtou, Zhangjiang Kechuang, Zhangjiang Hi-Tech, Hongxin Electronics, Yunhui Capital, Volcan Capital et Jinduo Capital. Les fonds financeront un modèle de contrôle incarné explicable, un modèle du monde physique, un pipeline de données de mouvement humanoïde multimodal, ainsi que des centres de R&D et de production à Qianhai (Shenzhen) et Zhangjiang (Shanghai). L'architecture maison, baptisée "cerveau plus cervelet", combine une mémoire visuelle pour la perception spatiale et une mémoire musculaire pour le contrôle moteur haute fréquence, déclinée en quatre produits : EngramTeleOp pour la téléopération (latence inférieure à 10 ms, prise en main en cinq minutes, essais longue distance entre Shanghai et Shenzhen), EngramEgo pour la capture de mouvement à la première personne via des capteurs portables légers, EngramControl pour la mémoire de mouvement réutilisable, et EngramNav pour la navigation et la mémoire d'environnement. Selon l'entreprise, cette approche générative dépasserait de plus de trois fois les modèles VLA classiques sur des tâches multiples (préparation de café, pliage de linge, préparation de thé), avec plus de 95% de réussite pour un modèle unique. TranscEngram a déjà testé ses briques avec les groupes AgiBot, Fourier, Galbot et Robotera, et cible désormais l'hôtellerie haut de gamme ainsi que l'assemblage flexible dans l'aérospatial, notamment avec un fabricant de pièces d'avion d'origine Airbus. Cette levée illustre une bataille de fond dans la robotique humanoïde : dépasser les modèles vision-langage-action (VLA) actuels, jugés trop rigides face à un changement de tâche ou d'outil, au profit de systèmes capables de transférer une compétence d'un corps à un autre (pince, main habile, bras de longueurs différentes) sans réentraînement lourd. Yi Ma justifie ce pari par une critique frontale des grands modèles de langage en vogue, qu'il compare à des encyclopédies statiques incapables de s'auto-corriger au contact du monde physique, d'où leurs hallucinations selon lui. Les chiffres de performance avancés, un gain de trois fois et un taux de réussite de 95%, restent toutefois des mesures internes non vérifiées de façon indépendante, portant sur un nombre de tâches limité probablement choisi par l'entreprise ; ils relèvent davantage de la promesse que du produit éprouvé en environnement industriel réel. Le pari, s'il tient, viserait un vrai point de friction du secteur : le coût du redéploiement à chaque nouvelle tâche ou changement de gamme, un problème particulièrement sensible dans l'assemblage aérospatial où les lignes changent fréquemment de configuration. TranscEngram s'inscrit dans la vague de financements de l'IA incarnée en Chine, aux côtés d'acteurs comme AgiBot, Fourier, Galbot ou UBTech, et fait écho aux ambitions affichées par les Américains Physical Intelligence avec Pi-0, NVIDIA avec GR00T ou Figure avec Helix sur les modèles de fondation pour la robotique. Yi Ma, lauréat du prix Marr et fellow IEEE, ACM et SIAM, revendique des collaborations avec Emmanuel Candès et Yann LeCun pour asseoir la crédibilité scientifique du projet. La suite proche passe par deux pilotes commerciaux, l'hôtellerie haut de gamme (blanchisserie, fabrication de cartes, service en chambre) et l'assemblage flexible dans l'aérospatial avec ce fabricant lié à Airbus, tandis qu'un centre de données dédié dans le Sichuan doit accélérer la collecte de données tactiles pour les mains habiles. Aucun calendrier de déploiement commercial précis n'a pour l'instant été communiqué.

Chine/AsieOpinion
1 source