Aller au contenu principal
Chine/AsiePandaily 

Ant Group dévoile sa stratégie duale VLA et modèles d'action du monde pour l'IA physique, écosystème open source et défi des données

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Ant Group a fondé en décembre 2024 Ant LingBot, filiale à 100 % basée à Shanghai et bras armé du groupe dans l'IA physique, où plus de 90 % des effectifs sont titulaires d'un master ou d'un doctorat. Dirigée par le PDG Zhu Xing et le scientifique en chef Shen Yujun, l'entreprise a présenté six modèles d'IA incarnée en open source lors du WAIC 2026, couvrant vision, vidéo, perception spatiale, manipulation, modèles du monde et modèles d'action du monde. Sa stratégie technologique repose sur deux voies parallèles. La première, VLA (vision language action), incarnée par LingBot-VLA 2.0, suit l'architecture dominante du secteur, celle qu'utilisent aussi Figure ou la série RT de Google DeepMind. La seconde, portée par LingBot-VA 2.0, prédit l'évolution du monde avant de générer une action ; présenté comme le premier modèle d'action du monde nativement incarné du secteur, il est entraîné from scratch sur une architecture autorégressive atteignant 150 Hz d'inférence temps réel sur un seul GPU, avec tokenisation sémantique visuelle-action, pré-entraînement causal strict, architecture MoE et inférence asynchrone permettant au robot de prédire ses états futurs tout en exécutant l'action en cours, avec un temps de réponse de 6,7 millisecondes, contre 300 à 400 millisecondes pour un clignement d'œil humain. Plus d'une dizaine de fabricants ont noué des partenariats, dont Unitree Robotics, Xinghaitu et Leju Robotics, dont le KUAVO 4 Pro a été adapté à LingBot-VLA sur 95 scénarios de manipulation réels. LingBot commercialise aussi son propre robot de service, le Robbyant R1, destiné aux usages domestiques, à la santé et aux personnes âgées, mais dont les volumes livrés restent limités.

Ce choix d'ouvrir intégralement poids, code, outils de post-entraînement et benchmarks d'évaluation, à un moment où les standards techniques de l'IA incarnée restent instables, vise à faire de LingBot une base logicielle partagée entre plateformes matérielles hétérogènes. Mais la principale contrainte du secteur demeure la donnée : contrairement aux LLM entraînés sur des billions de tokens textuels, les données d'interaction physique ne s'accumulent que par l'exploitation réelle de robots. LingBot compense en s'appuyant sur les données de ses partenaires (Unitree, Leju, Xinghaitu) plutôt qu'en opérant sa propre flotte, une dépendance qui fragilise sa position à mesure que ces mêmes partenaires développent leurs propres capacités IA.

Cette approche intégrale, du modèle cerveau au modèle du monde jusqu'au déploiement matériel, distingue LingBot des autres géants technologiques chinois. Alibaba, Tencent, Huawei, JD.com et Meituan privilégient tous des stratégies plus ciblées, et Ant Group entre en outre en concurrence avec d'autres initiatives affiliées à Alibaba. LingBot constitue ainsi un test grandeur nature : une entreprise de la fintech peut-elle incuber une activité robotique viable, et l'open source combiné à l'emprunt de données suffira-t-il à surmonter les limites structurelles de l'IA incarnée ?

Dans nos dossiers

À lire aussi

GigaAI dévoile son système « Dual Pyramid » d'IA générale physique pour surmonter le mur du passage à l'échelle de l'IA incarnée
1Pandaily 

GigaAI dévoile son système « Dual Pyramid » d'IA générale physique pour surmonter le mur du passage à l'échelle de l'IA incarnée

Le 20 mai 2026, lors d'un événement de lancement dans l'Optical Valley de Wuhan, la startup chinoise GigaAI a dévoilé ce qu'elle appelle une architecture "Dual Pyramid" pour l'intelligence physique générale. Le système repose sur deux couches parallèles : une couche données qui fusionne dans un seul pipeline d'entraînement des données issues de robots réels (pour la physique de référence), de vidéos internet (pour la diversité situationnelle à grande échelle) et de simulation (pour la couverture synthétique illimitée) ; et une couche algorithmique qui empile des world models et des modèles VLA (Vision-Language-Action) comme piliers complémentaires. En parallèle, GigaAI a lancé SeeLight, une sous-marque dédiée aux environnements domestiques, ainsi que le SeeLight S1, son premier robot humanoïde polyvalent pour la maison. Une flotte de 100 unités est déjà déployée dans des foyers réels à Wuhan, avec un passage en opérations à grande échelle prévu pour le troisième trimestre 2026. La feuille de route sur 12 mois prévoit trois releases successives de modèles de base, GigaBrain-1, GigaBrain-2 et GigaBrain-3, que la société positionne comme l'équivalent du "moment GPT-3" pour la robotique physique généraliste. L'enjeu stratégique de cette annonce dépasse la présentation d'un nouveau robot : GigaAI s'attaque frontalement au débat qui structure le champ depuis deux ans. Le camp des world models, représenté par NVIDIA Cosmos et Google Genie, défend l'idée que des modèles vidéo génératifs peuvent fournir de la donnée d'entraînement à l'échelle industrielle. Le camp des modèles d'action, incarné par Physical Intelligence avec sa série pi-0 et les chercheurs en Diffusion Policy, argue que seules les données collectées sur robots réels permettent de généraliser les compétences de manipulation. En proposant une architecture hybride qui refuse ce choix binaire, GigaAI parie que world models et VLA ne sont pas concurrents mais codépendants. Si le déploiement des 100 unités en conditions réelles se confirme au-delà des vidéos de démonstration sélectionnées, cela constituerait une preuve sérieuse du sim-to-real scaling sur des tâches domestiques non structurées. La revendication d'un "GPT-3 moment" reste un signal marketing à surveiller avec prudence, mais l'architecture elle-même est techniquement cohérente avec les travaux récents sur les données hybrides. GigaAI s'inscrit dans une vague de startups chinoises en robotique humanoïde qui ont accéléré leurs sorties produit depuis 2024, en réponse directe aux annonces d'Agility Robotics (Digit), Figure (Figure 02), et Tesla (Optimus Gen 2). L'Optical Valley de Wuhan est devenu un pôle de référence pour la robotique en Chine, au même titre que Shenzhen pour le hardware grand public. La prochaine étape observable sera la publication de métriques de performance des unités SeeLight S1 dans des conditions d'utilisation domestique réelle, ainsi que le lancement de GigaBrain-1 selon le calendrier annoncé. Aucun acteur européen n'est directement impliqué dans cette annonce, mais les intégrateurs industriels et les décideurs robotique suivront de près la montée en échelle du Q3 2026 comme premier test de vérité.

UELa montée en échelle du SeeLight S1 prévue en Q3 2026 constituera un indicateur de compétitivité chinoise en robotique domestique que les acteurs industriels et décideurs européens devront intégrer dans leur veille stratégique.

Chine/AsieOpinion
1 source
De la perception de l'environnement à la transformation du monde : opportunités, voies et pratiques de l'IA physique
236Kr 

De la perception de l'environnement à la transformation du monde : opportunités, voies et pratiques de l'IA physique

À la conférence AI+ de Beijing Yizhuang en mai 2026, Chen Long, directeur technique "foundation models" de Jiangxing Intelligence (江行智能), a présenté l'architecture d'IA physique industrielle JX-Phi, déjà déployée dans des centrales photovoltaïques et des réseaux électriques au Guizhou et en Mongolie intérieure. Le système couvre plus de 1 000 stations d'inspection avec une précision algorithmique annoncée à 99 %. L'architecture se décompose en trois couches : une infrastructure de données (JX-Phi World), un modèle central en cours d'évolution vers un World Action Model (JX-Phi Brain, intégrant des modèles Vision-Language-Action longue durée, dits LT-VLA), et une couche applicative (JX-Phi Agent) qui orchestre drones, chiens robotiques, robots à roues et bras mécaniques via un contrôleur global de 100 milliards de paramètres. Indicateur structurant : une simple tâche d'inspection d'équipement se décompose en 100 à 200 sous-tâches dans un contexte industriel, contre quelques dizaines en usage grand public. Ce chiffre illustre une bascule dans la compétition autour de l'IA : l'enjeu n'est plus le nombre de paramètres des modèles de base, mais la capacité à déployer des systèmes stables et contrôlés dans des environnements physiques contraignants. La densité des scénarios industriels chinois constitue un avantage structurel difficile à répliquer : le parc de robots industriels installés en Chine représente 8,6 fois celui des États-Unis et a crû d'un facteur 12 en dix ans, alimentant un volant de données continu sans équivalent mondial. L'approche sim-to-real de Jiangxing repose sur un moteur de simulation 3D génératif (AutoWorld) qui produit des scénarios rares, pannes atypiques ou conditions météo extrêmes, avant tout déploiement terrain, réduisant significativement les risques dans des secteurs où l'erreur en conditions réelles n'est pas tolérable, comme l'énergie ou la pétrochimie. Jiangxing capitalise sur cinq couches d'infrastructure que la Chine a constituées : densité de scénarios industriels, modèles open source compétitifs (DeepSeek, Qwen, Kimi) en rattrapage rapide sur les niveaux de performance mondiaux, 4,48 millions de stations 5G représentant plus de 60 % du parc mondial, capacité électrique environ deux fois supérieure à celle des États-Unis, et une co-optimisation logiciel-matériel stimulée en partie par les restrictions d'accès aux puces d'entraînement haut de gamme. Sur le plan concurrentiel, la société se positionne comme fournisseur de système complet face à des acteurs comme Unitree ou Boston Dynamics côté plateformes robotiques, et Physical Intelligence (Pi-0) côté modèles généralistes. Les prochaines étapes visent une extension aux secteurs minier et chimique, où la criticité des tâches et la rareté des données d'incidents justifient précisément l'approche simulation-to-real développée par la société.

UELes avantages structurels de la Chine en IA physique industrielle (parc robotique 8,6x supérieur aux États-Unis, 60 % des stations 5G mondiales, capacité électrique double) représentent un écart compétitif croissant que les industriels européens devront intégrer dans leur stratégie d'automatisation à horizon 5 ans.

Chine/AsieOpinion
1 source
Fortsense développe des caméras spatiales RGBD monocomposant pour la perception de l'IA physique
3Pandaily 

Fortsense développe des caméras spatiales RGBD monocomposant pour la perception de l'IA physique

Fortsense Technologies, startup chinoise spécialisée dans la conception de puces pour la vision 3D, développe des caméras spatiales RGBD mono-puce destinées à la perception des systèmes d'IA physique. La société affirme être la seule entreprise en Chine à maîtriser la chaîne complète SPAD (Single-Photon Avalanche Diode), de la conception du composant à la production en série au niveau automotive. Sa technologie de balayage optique omnidirectionnel atteint 80 % d'efficacité d'utilisation laser, permettant un LiDAR solid-state longue portée de 200 mètres à coût réduit. Depuis le démarrage en série au quatrième trimestre 2025, plusieurs dizaines de milliers de puces SPAD-SoC ont été livrées, avec Zeekr (modèle 9X) parmi les premiers clients identifiés. La feuille de route prévoit une transition d'une architecture bi-puce vers une intégration mono-puce d'ici 2027, fusionnant imagerie RGB et mesure dToF (direct Time-of-Flight) dans un seul composant. La résolution actuelle de 300 000 à 400 000 pixels pour les applications robotiques doit progresser vers des solutions 4 mégapixels automotive à la même échéance. L'enjeu est fondamentalement architectural : les caméras 2D classiques infèrent la profondeur de façon probabiliste, méthode que le président Mo Lianghua juge insuffisante pour des applications où une erreur de perception unique peut avoir des conséquences critiques, qu'il s'agisse de conduite autonome ou de navigation robotique en environnement partagé. Une puce RGBD mono-puce fusionnerait nativement couleur et profondeur, réduisant latence, coût et empreinte matérielle par rapport aux configurations actuelles combinant une caméra RGB et un LiDAR séparés. Pour les intégrateurs de robots humanoïdes, de systèmes cobots ou d'ADAS, cela représenterait une simplification concrète des pipelines de fusion de capteurs. La production effective depuis fin 2025 distingue cette annonce d'un simple prototype de laboratoire, bien que les volumes restent contenus à l'échelle de l'industrie automobile. Fortsense s'inscrit dans un marché de la perception 3D déjà dense, où Luminar, Hesai, Robosense et Innoviz dominent le segment LiDAR, tandis que STMicroelectronics, Sony et OmniVision tiennent le segment imagerie. La différenciation revendiquée repose sur l'intégration verticale de la puce SPAD et un brevet de scanning omnidirectionnel exclusif. En Chine, les politiques d'approvisionnement local et les restrictions à l'export sur les composants américains créent une fenêtre d'opportunité structurelle pour des fournisseurs nationaux comme Fortsense. Les prochaines étapes annoncées incluent les solutions 4MP automotive et l'intégration mono-puce complète, toutes deux visées pour 2027. Aucun acteur européen n'est impliqué dans cette annonce, mais la dynamique illustre l'accélération de l'écosystème chinois dans les composants de perception critiques, un segment qu'adressent également des acteurs comme Prophesee (France, vision événementielle) avec des approches technologiques distinctes.

UEL'accélération de l'écosystème chinois dans les composants de perception RGBD constitue une pression compétitive indirecte sur des acteurs européens du segment comme Prophesee (France, vision événementielle), sans impact direct immédiat.

Chine/AsieOpinion
1 source
X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique
4Pandaily 

X Square Robot boucle quatre levées consécutives et atteint 2,8 milliards de dollars de valorisation grâce à ses modèles fondation d'IA physique

X Square Robot, startup pékinoise fondée en 2023 et spécialisée dans l'IA incarnée pour environnements réels, vient de boucler quatre tours de financement consécutifs dont une Série C portant sa valorisation à 2,8 milliards de dollars (20 milliards de yuans). IDG Capital a participé à la Série C, tandis que HongShan et Xiaomi ont soutenu l'entreprise sur plusieurs tours antérieurs. Surtout, Meituan, Alibaba et ByteDance ont chacun conduit un tour précédent, faisant de X Square Robot la seule société d'IA incarnée en Chine à avoir obtenu un lead investment des quatre plus grands groupes tech nationaux. En avril 2026, la société a dévoilé WALL-B, un modèle fondation basé sur son architecture "World Unified Model" (WUM) : contrairement aux approches VLA modulaires qui assemblent des composants vision, langage et action distincts, WALL-B entraîne l'ensemble perception-langage-action-prédiction physique dans un réseau unique. Deux modèles complémentaires ont été mis en open source : WALL-OSS-0.5, qui atteint plus de 80 % de complétion autonome sur 4 des 17 tâches testées en conditions réelles sans fine-tuning post-entraînement, et WALL-WM, un modèle de prédiction monde alignant données langagières, visuelles et gestuelles autour d'événements physiques significatifs. Sur le terrain, X Square Robot a déployé ses robots en partenariat avec 58.com pour un service de nettoyage assisté par IA à Shenzhen et Pékin, les machines opérant aux côtés d'agents humains dans des immeubles résidentiels réels. Depuis mai 2026, un programme "X Family Member" place des robots en foyers volontaires jusqu'à un mois en tant qu'assistants domestiques. La valorisation à 2,8 milliards de dollars positionne X Square Robot parmi les startups d'IA incarnée les mieux capitalisées de Chine, dans une course mondiale où Figure AI, Physical Intelligence et Agility Robotics mobilisent des montants comparables aux États-Unis. L'architecture unifiée de WALL-B constitue un pari architectural distinct des approches modulaires dominantes comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA. Le score de 80 % sur 4 tâches sélectionnées parmi 17 sans post-training est encourageant, mais l'échantillon invite à la prudence : les 13 tâches restantes ne sont pas documentées, ce qui laisse le demo-to-reality gap partiellement ouvert. Les déploiements effectifs chez 58.com et en appartements résidentiels donnent néanmoins plus de crédit à ces métriques que les démonstrations habituelles en laboratoire contrôlé. Fondée en 2023, X Square Robot s'inscrit dans un écosystème chinois de robotique humanoïde incluant Unitree Robotics, Fourier Intelligence et AgiBot, face aux acteurs américains Figure AI (valorisé 2,6 Md$ fin 2024), Boston Dynamics et Physical Intelligence. La présence simultanée de Meituan, Alibaba et ByteDance au capital signale des débouchés ciblés dans la logistique, la livraison et les services à domicile, secteurs que ces groupes cherchent activement à automatiser. La mise en open source de WALL-OSS-0.5 et WALL-WM suit une stratégie classique d'adoption académique et industrielle avant commercialisation. Les fonds levés seront alloués au développement technologique core et à la recherche fondamentale en intelligence incarnée, avec pour horizon déclaré des systèmes robotiques polyvalents capables d'opérer dans des environnements non structurés du quotidien.

UELes modèles WALL-OSS-0.5 et WALL-WM étant open source, les équipes R&D européennes peuvent les évaluer directement ; la montée en puissance de l'écosystème chinois (Alibaba, ByteDance, Meituan comme investisseurs lead simultanés) intensifie la pression concurrentielle sur les acteurs européens de l'IA incarnée.

Chine/AsieOpinion
1 source