Aller au contenu principal
Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée
Chine/AsieRobotics & Automation News 

Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Robbyant, filiale d'IA incarnée d'Ant Group (maison mère d'Alipay), a dévoilé LingBot-Depth 2.0, un modèle de nouvelle génération dédié à la perception spatiale robotique, accompagné de LingBot-Vision, son modèle visuel fondation. Ces deux briques logicielles visent à doter les robots d'une compréhension fine de l'espace physique qui les entoure, condition préalable à une navigation autonome fiable. LingBot-Depth 2.0 succède à une première version dont Robbyant revendique le succès, sans toutefois détailler publiquement les métriques précises de précision de profondeur, la latence de traitement ou le matériel de référence compatible, éléments qui restent à confirmer par des tests indépendants.

Cette annonce s'inscrit dans une course technologique où la perception spatiale constitue l'un des verrous majeurs freinant le déploiement des robots humanoïdes et des AMR en environnement réel : sans estimation de profondeur robuste, la manipulation fine et l'évitement d'obstacles restent fragiles hors laboratoire. En misant sur un modèle de vision fondation couplé à un module de profondeur dédié, Robbyant cherche à se positionner sur le segment logiciel de la pile robotique, plutôt que sur le hardware, un pari que suivent aussi des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2).

Robbyant s'appuie sur les ressources cloud et IA d'Ant Group, groupe technologique chinois pesant lourd dans la fintech et l'IA, ce qui lui donne une capacité de calcul et de distribution significative face aux start-ups occidentales du secteur. Les prochaines étapes, notamment une éventuelle ouverture à des partenaires industriels ou une intégration dans des plateformes robotiques tierces, restent à préciser.

À lire aussi

Baisse des collisions contre le verre ? La division IA incarnée d'Ant Group revendique une avancée en perception robotique
1SCMP Tech 

Baisse des collisions contre le verre ? La division IA incarnée d'Ant Group revendique une avancée en perception robotique

Ant Group a présenté mardi, via sa filiale d'IA incarnée Robbyant, basée à Hangzhou, deux nouveaux modèles de perception visuelle pour robots : LingBot-Depth 2.0, un modèle de perception spatiale de nouvelle génération, et LingBot-Vision, un modèle visuel fondationnel. L'entreprise affirme que ces modèles permettent de résoudre un problème persistant en robotique : la détection fiable du verre, des miroirs et des objets transparents, des surfaces qui perturbent traditionnellement les capteurs de profondeur (LiDAR, stéréovision, temps de vol). Aucune métrique de précision, benchmark ou comparaison chiffrée n'a toutefois été communiquée dans l'annonce, ce qui invite à la prudence sur l'ampleur réelle de l'avancée revendiquée. La perception des matériaux transparents et réfléchissants reste un angle mort connu des systèmes de navigation robotique : portes vitrées, baies, miroirs faussent les mesures de distance et provoquent collisions ou arrêts d'urgence intempestifs. Un progrès réel sur ce point intéresserait directement les opérateurs d'AMR en entrepôt comme les concepteurs de robots humanoïdes destinés à évoluer en environnement de bureau, hôpital ou magasin. L'annonce confirme surtout l'entrée d'un nouvel acteur chinois, non spécialisé matériel, sur la brique logicielle de perception de la pile robotique, aux côtés d'entreprises déjà positionnées comme Unitree ou UBTech. Ant Group, connu pour Alipay et ses activités fintech, diversifie ainsi son portefeuille IA vers la robotique incarnée, dans la continuité du mouvement engagé par plusieurs géants technologiques chinois depuis 2024-2025. À l'international, la course reste dominée par des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, ou les plateformes propriétaires de Figure AI (Figure 03) et Tesla (Optimus Gen 3). Robbyant n'a pas précisé si LingBot-Depth 2.0 et LingBot-Vision seront ouverts, licenciés à des fabricants tiers, ou réservés à des projets internes, ni communiqué de calendrier de déploiement.

UEAucun acteur ou réglementation européenne n'est concerne directement, mais une percée réelle sur la détection du verre et des surfaces réfléchissantes intéresserait indirectement les opérateurs européens d'AMR en entrepôt et les concepteurs de robots humanoïdes destines aux environnements de bureau ou de santé.

Chine/AsieActu
1 source
Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés
2Robotics & Automation News 

Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés

Robbyant, filiale d'IA incarnée du groupe Ant Group (maison mère d'Alipay), a annoncé la mise à jour et la publication en open source de LingBot-VLA 2.0, un modèle vision-langage-action (VLA) destiné aux robots humanoïdes et autres plateformes incarnées. Ce nouveau modèle s'appuie directement sur LingBot-VLA 1.0, sorti en janvier 2026, et apporte des progrès notables sur trois axes techniques majeurs : la généralisation morphologique (capacité à piloter des corps de robots différents sans réentraînement complet), le support d'un nombre accru de degrés de liberté (DoF), et l'efficacité de déploiement. Robbyant présente LingBot-VLA 2.0 comme un "cerveau universel" capable de s'adapter à des architectures robotiques variées plutôt qu'à une seule plateforme propriétaire. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la stratégie d'ouverture : en publiant son modèle en open source, Ant Group cherche à s'imposer comme fournisseur de la couche logicielle "cerveau" pour un écosystème de fabricants de robots humanoïdes, plutôt que de vendre du matériel propre. Pour les intégrateurs et décideurs industriels, cela signifie potentiellement un modèle VLA gratuit et personnalisable, à intégrer sur des plateformes tierces, ce qui pourrait accélérer l'adoption face aux modèles propriétaires fermés comme Helix (Figure AI) ou GR00T N2 (NVIDIA). Cela renforce aussi l'hypothèse selon laquelle la généralisation cross-embodiment (un même modèle pilotant plusieurs morphologies de robots) devient un axe de compétition central, au-delà de la simple démonstration ponctuelle. Cette annonce s'inscrit dans la stratégie plus large d'Ant Group de se positionner sur l'IA incarnée, un an après le lancement de la première version de LingBot-VLA. Le secteur des modèles VLA reste dominé par des acteurs américains (Physical Intelligence avec Pi-0, NVIDIA avec GR00T, Figure AI avec Helix) et chinois (Unitree, AgiBot), avec une bascule progressive vers l'open source comme arme concurrentielle, à l'image de ce que Meta a fait avec Llama face à OpenAI. Les détails précis sur les benchmarks, les partenaires de déploiement et le calendrier de disponibilité du modèle n'étaient pas encore complètement communiqués au moment de l'annonce, ce qui invite à distinguer la publication du code de sa validation réelle sur du matériel tiers.

Chine/AsieActu
1 source
IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots
3Interesting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo. Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante. Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

Chine/AsieActu
1 source
AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert
4Pandaily 

AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert

AgiBot a présenté AGILE 2.0, pour AGIBOT Generative Intelligent Locomotion Engine, un modèle de perception-contrôle qui fusionne en une seule boucle de bout en bout la perception visuelle, la compréhension du terrain, le raisonnement sur les espaces franchissables, la motion du corps entier et le contact fin des effecteurs. Cette version succède à AGILE 1.0, qui reliait déjà perception et motion pour faire tourner navigation et manipulation en parallèle, mais sans dynamique unifiée capable de gérer un équilibre poussé, des interactions à grande vitesse et des changements précis de contact. AGILE 2.0 supprime les découpages en étapes intermédiaires: les caméras pilotent en continu la planification et le contrôle, ce qui évite qu'une vision en retard ne perturbe des actionneurs cadencés à la milliseconde en plein pas. Sur la plateforme humanoïde Lingxi X2, AgiBot a diffusé des démonstrations mettant en scène des sauts à travers des cerceaux enflammés, du jeu de diabolo, des sessions de corde à sauter longue à plusieurs robots, de l'empilement coopératif de boîtes et, présenté comme une première pour un humanoïde bipède, un équilibre maintenu en faisant rouler le robot sur un gros ballon. Ce déploiement logiciel reste distinct de l'exploitation du parc d'attractions Chimelong et des placements commerciaux du robot A3 Ultra, et il complète, sans le recouvrir, les travaux publiés séparément sous le nom GE-Act 2.0, consacrés au pré-entraînement de la manipulation par mise à l'échelle world-action. AgiBot n'a publié ni taux de réussite mesurés, ni budget de latence, ni reproduction indépendante pour accompagner l'annonce d'AGILE 2.0: les vidéos spectaculaires relèvent donc pour l'instant du marketing tant que des métriques de terrain ne sont pas produites. Au-delà de la démonstration, l'entreprise met en avant des comportements pensés pour un déploiement réel: boucles visuelles fermées en temps réel face à des obstacles changeants, partage d'état entre robots pour des tâches multi-agents, et récupération sécurisée lorsqu'une personne pénètre dans l'espace de travail. L'argument commercial vise les sites non structurés, où les trajectoires scriptées par points de passage cassent dès que l'éclairage, le sol ou la présence d'humains changent, et où une approche perception-action unifiée promet de réduire l'ingénierie sur mesure propre à chaque site. Pour les intégrateurs et décideurs industriels, l'enjeu est de savoir si cette locomotion à yeux ouverts tient réellement hors des plateaux de tournage, ce qui reste à ce stade une question ouverte plutôt qu'une preuve déjà apportée. AGILE 2.0 s'inscrit dans une feuille de route plus large chez AgiBot, qui avance sur plusieurs fronts en parallèle: déploiement au parc Chimelong, commercialisation du A3 Ultra, et désormais une architecture logicielle à deux couches associant ce moteur de locomotion sensé-control à GE-Act 2.0 pour la manipulation. Cette séparation entre une couche dédiée à l'équilibre et au déplacement et une couche dédiée à la manipulation par apprentissage world-action illustre une stratégie construite brique par brique plutôt qu'un modèle unique tout-en-un. Aucune date de disponibilité commerciale, aucun partenaire pilote ni calendrier de déploiement n'ont été précisés pour AGILE 2.0 lui-même, et la validation de ce moteur dépendra désormais de sa capacité à démontrer, en conditions réelles et hors environnements préparés, un équilibre dynamique fiable que la génération AGILE 1.0 ne parvenait pas encore à garantir.

Chine/AsieOpinion
1 source