Aller au contenu principal
IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots
Chine/AsieInteresting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots
▶ Voir sur YouTube

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo.

Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante.

Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

À lire aussi

Fortsense développe des caméras spatiales RGBD monocomposant pour la perception de l'IA physique
1Pandaily 

Fortsense développe des caméras spatiales RGBD monocomposant pour la perception de l'IA physique

Fortsense Technologies, startup chinoise spécialisée dans la conception de puces pour la vision 3D, développe des caméras spatiales RGBD mono-puce destinées à la perception des systèmes d'IA physique. La société affirme être la seule entreprise en Chine à maîtriser la chaîne complète SPAD (Single-Photon Avalanche Diode), de la conception du composant à la production en série au niveau automotive. Sa technologie de balayage optique omnidirectionnel atteint 80 % d'efficacité d'utilisation laser, permettant un LiDAR solid-state longue portée de 200 mètres à coût réduit. Depuis le démarrage en série au quatrième trimestre 2025, plusieurs dizaines de milliers de puces SPAD-SoC ont été livrées, avec Zeekr (modèle 9X) parmi les premiers clients identifiés. La feuille de route prévoit une transition d'une architecture bi-puce vers une intégration mono-puce d'ici 2027, fusionnant imagerie RGB et mesure dToF (direct Time-of-Flight) dans un seul composant. La résolution actuelle de 300 000 à 400 000 pixels pour les applications robotiques doit progresser vers des solutions 4 mégapixels automotive à la même échéance. L'enjeu est fondamentalement architectural : les caméras 2D classiques infèrent la profondeur de façon probabiliste, méthode que le président Mo Lianghua juge insuffisante pour des applications où une erreur de perception unique peut avoir des conséquences critiques, qu'il s'agisse de conduite autonome ou de navigation robotique en environnement partagé. Une puce RGBD mono-puce fusionnerait nativement couleur et profondeur, réduisant latence, coût et empreinte matérielle par rapport aux configurations actuelles combinant une caméra RGB et un LiDAR séparés. Pour les intégrateurs de robots humanoïdes, de systèmes cobots ou d'ADAS, cela représenterait une simplification concrète des pipelines de fusion de capteurs. La production effective depuis fin 2025 distingue cette annonce d'un simple prototype de laboratoire, bien que les volumes restent contenus à l'échelle de l'industrie automobile. Fortsense s'inscrit dans un marché de la perception 3D déjà dense, où Luminar, Hesai, Robosense et Innoviz dominent le segment LiDAR, tandis que STMicroelectronics, Sony et OmniVision tiennent le segment imagerie. La différenciation revendiquée repose sur l'intégration verticale de la puce SPAD et un brevet de scanning omnidirectionnel exclusif. En Chine, les politiques d'approvisionnement local et les restrictions à l'export sur les composants américains créent une fenêtre d'opportunité structurelle pour des fournisseurs nationaux comme Fortsense. Les prochaines étapes annoncées incluent les solutions 4MP automotive et l'intégration mono-puce complète, toutes deux visées pour 2027. Aucun acteur européen n'est impliqué dans cette annonce, mais la dynamique illustre l'accélération de l'écosystème chinois dans les composants de perception critiques, un segment qu'adressent également des acteurs comme Prophesee (France, vision événementielle) avec des approches technologiques distinctes.

UEL'accélération de l'écosystème chinois dans les composants de perception RGBD constitue une pression compétitive indirecte sur des acteurs européens du segment comme Prophesee (France, vision événementielle), sans impact direct immédiat.

Chine/AsieOpinion
1 source
Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés
2Robotics & Automation News 

Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés

Robbyant, filiale d'IA incarnée du groupe Ant Group (maison mère d'Alipay), a annoncé la mise à jour et la publication en open source de LingBot-VLA 2.0, un modèle vision-langage-action (VLA) destiné aux robots humanoïdes et autres plateformes incarnées. Ce nouveau modèle s'appuie directement sur LingBot-VLA 1.0, sorti en janvier 2026, et apporte des progrès notables sur trois axes techniques majeurs : la généralisation morphologique (capacité à piloter des corps de robots différents sans réentraînement complet), le support d'un nombre accru de degrés de liberté (DoF), et l'efficacité de déploiement. Robbyant présente LingBot-VLA 2.0 comme un "cerveau universel" capable de s'adapter à des architectures robotiques variées plutôt qu'à une seule plateforme propriétaire. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la stratégie d'ouverture : en publiant son modèle en open source, Ant Group cherche à s'imposer comme fournisseur de la couche logicielle "cerveau" pour un écosystème de fabricants de robots humanoïdes, plutôt que de vendre du matériel propre. Pour les intégrateurs et décideurs industriels, cela signifie potentiellement un modèle VLA gratuit et personnalisable, à intégrer sur des plateformes tierces, ce qui pourrait accélérer l'adoption face aux modèles propriétaires fermés comme Helix (Figure AI) ou GR00T N2 (NVIDIA). Cela renforce aussi l'hypothèse selon laquelle la généralisation cross-embodiment (un même modèle pilotant plusieurs morphologies de robots) devient un axe de compétition central, au-delà de la simple démonstration ponctuelle. Cette annonce s'inscrit dans la stratégie plus large d'Ant Group de se positionner sur l'IA incarnée, un an après le lancement de la première version de LingBot-VLA. Le secteur des modèles VLA reste dominé par des acteurs américains (Physical Intelligence avec Pi-0, NVIDIA avec GR00T, Figure AI avec Helix) et chinois (Unitree, AgiBot), avec une bascule progressive vers l'open source comme arme concurrentielle, à l'image de ce que Meta a fait avec Llama face à OpenAI. Les détails précis sur les benchmarks, les partenaires de déploiement et le calendrier de disponibilité du modèle n'étaient pas encore complètement communiqués au moment de l'annonce, ce qui invite à distinguer la publication du code de sa validation réelle sur du matériel tiers.

Chine/AsieActu
1 source
AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert
3Pandaily 

AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert

AgiBot a présenté AGILE 2.0, pour AGIBOT Generative Intelligent Locomotion Engine, un modèle de perception-contrôle qui fusionne en une seule boucle de bout en bout la perception visuelle, la compréhension du terrain, le raisonnement sur les espaces franchissables, la motion du corps entier et le contact fin des effecteurs. Cette version succède à AGILE 1.0, qui reliait déjà perception et motion pour faire tourner navigation et manipulation en parallèle, mais sans dynamique unifiée capable de gérer un équilibre poussé, des interactions à grande vitesse et des changements précis de contact. AGILE 2.0 supprime les découpages en étapes intermédiaires: les caméras pilotent en continu la planification et le contrôle, ce qui évite qu'une vision en retard ne perturbe des actionneurs cadencés à la milliseconde en plein pas. Sur la plateforme humanoïde Lingxi X2, AgiBot a diffusé des démonstrations mettant en scène des sauts à travers des cerceaux enflammés, du jeu de diabolo, des sessions de corde à sauter longue à plusieurs robots, de l'empilement coopératif de boîtes et, présenté comme une première pour un humanoïde bipède, un équilibre maintenu en faisant rouler le robot sur un gros ballon. Ce déploiement logiciel reste distinct de l'exploitation du parc d'attractions Chimelong et des placements commerciaux du robot A3 Ultra, et il complète, sans le recouvrir, les travaux publiés séparément sous le nom GE-Act 2.0, consacrés au pré-entraînement de la manipulation par mise à l'échelle world-action. AgiBot n'a publié ni taux de réussite mesurés, ni budget de latence, ni reproduction indépendante pour accompagner l'annonce d'AGILE 2.0: les vidéos spectaculaires relèvent donc pour l'instant du marketing tant que des métriques de terrain ne sont pas produites. Au-delà de la démonstration, l'entreprise met en avant des comportements pensés pour un déploiement réel: boucles visuelles fermées en temps réel face à des obstacles changeants, partage d'état entre robots pour des tâches multi-agents, et récupération sécurisée lorsqu'une personne pénètre dans l'espace de travail. L'argument commercial vise les sites non structurés, où les trajectoires scriptées par points de passage cassent dès que l'éclairage, le sol ou la présence d'humains changent, et où une approche perception-action unifiée promet de réduire l'ingénierie sur mesure propre à chaque site. Pour les intégrateurs et décideurs industriels, l'enjeu est de savoir si cette locomotion à yeux ouverts tient réellement hors des plateaux de tournage, ce qui reste à ce stade une question ouverte plutôt qu'une preuve déjà apportée. AGILE 2.0 s'inscrit dans une feuille de route plus large chez AgiBot, qui avance sur plusieurs fronts en parallèle: déploiement au parc Chimelong, commercialisation du A3 Ultra, et désormais une architecture logicielle à deux couches associant ce moteur de locomotion sensé-control à GE-Act 2.0 pour la manipulation. Cette séparation entre une couche dédiée à l'équilibre et au déplacement et une couche dédiée à la manipulation par apprentissage world-action illustre une stratégie construite brique par brique plutôt qu'un modèle unique tout-en-un. Aucune date de disponibilité commerciale, aucun partenaire pilote ni calendrier de déploiement n'ont été précisés pour AGILE 2.0 lui-même, et la validation de ce moteur dépendra désormais de sa capacité à démontrer, en conditions réelles et hors environnements préparés, un équilibre dynamique fiable que la génération AGILE 1.0 ne parvenait pas encore à garantir.

Chine/AsieOpinion
1 source
Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée
4Robotics & Automation News 

Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée

Robbyant, filiale d'IA incarnée d'Ant Group (maison mère d'Alipay), a dévoilé LingBot-Depth 2.0, un modèle de nouvelle génération dédié à la perception spatiale robotique, accompagné de LingBot-Vision, son modèle visuel fondation. Ces deux briques logicielles visent à doter les robots d'une compréhension fine de l'espace physique qui les entoure, condition préalable à une navigation autonome fiable. LingBot-Depth 2.0 succède à une première version dont Robbyant revendique le succès, sans toutefois détailler publiquement les métriques précises de précision de profondeur, la latence de traitement ou le matériel de référence compatible, éléments qui restent à confirmer par des tests indépendants. Cette annonce s'inscrit dans une course technologique où la perception spatiale constitue l'un des verrous majeurs freinant le déploiement des robots humanoïdes et des AMR en environnement réel : sans estimation de profondeur robuste, la manipulation fine et l'évitement d'obstacles restent fragiles hors laboratoire. En misant sur un modèle de vision fondation couplé à un module de profondeur dédié, Robbyant cherche à se positionner sur le segment logiciel de la pile robotique, plutôt que sur le hardware, un pari que suivent aussi des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). Robbyant s'appuie sur les ressources cloud et IA d'Ant Group, groupe technologique chinois pesant lourd dans la fintech et l'IA, ce qui lui donne une capacité de calcul et de distribution significative face aux start-ups occidentales du secteur. Les prochaines étapes, notamment une éventuelle ouverture à des partenaires industriels ou une intégration dans des plateformes robotiques tierces, restent à préciser.

Chine/AsieActu
1 source