Aller au contenu principal
AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert
Chine/AsiePandaily 

AgiBot déploie AGILE 2.0, un modèle de perception-contrôle pour la locomotion en monde ouvert

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

AgiBot a présenté AGILE 2.0, pour AGIBOT Generative Intelligent Locomotion Engine, un modèle de perception-contrôle qui fusionne en une seule boucle de bout en bout la perception visuelle, la compréhension du terrain, le raisonnement sur les espaces franchissables, la motion du corps entier et le contact fin des effecteurs. Cette version succède à AGILE 1.0, qui reliait déjà perception et motion pour faire tourner navigation et manipulation en parallèle, mais sans dynamique unifiée capable de gérer un équilibre poussé, des interactions à grande vitesse et des changements précis de contact. AGILE 2.0 supprime les découpages en étapes intermédiaires: les caméras pilotent en continu la planification et le contrôle, ce qui évite qu'une vision en retard ne perturbe des actionneurs cadencés à la milliseconde en plein pas. Sur la plateforme humanoïde Lingxi X2, AgiBot a diffusé des démonstrations mettant en scène des sauts à travers des cerceaux enflammés, du jeu de diabolo, des sessions de corde à sauter longue à plusieurs robots, de l'empilement coopératif de boîtes et, présenté comme une première pour un humanoïde bipède, un équilibre maintenu en faisant rouler le robot sur un gros ballon. Ce déploiement logiciel reste distinct de l'exploitation du parc d'attractions Chimelong et des placements commerciaux du robot A3 Ultra, et il complète, sans le recouvrir, les travaux publiés séparément sous le nom GE-Act 2.0, consacrés au pré-entraînement de la manipulation par mise à l'échelle world-action.

AgiBot n'a publié ni taux de réussite mesurés, ni budget de latence, ni reproduction indépendante pour accompagner l'annonce d'AGILE 2.0: les vidéos spectaculaires relèvent donc pour l'instant du marketing tant que des métriques de terrain ne sont pas produites. Au-delà de la démonstration, l'entreprise met en avant des comportements pensés pour un déploiement réel: boucles visuelles fermées en temps réel face à des obstacles changeants, partage d'état entre robots pour des tâches multi-agents, et récupération sécurisée lorsqu'une personne pénètre dans l'espace de travail. L'argument commercial vise les sites non structurés, où les trajectoires scriptées par points de passage cassent dès que l'éclairage, le sol ou la présence d'humains changent, et où une approche perception-action unifiée promet de réduire l'ingénierie sur mesure propre à chaque site. Pour les intégrateurs et décideurs industriels, l'enjeu est de savoir si cette locomotion à yeux ouverts tient réellement hors des plateaux de tournage, ce qui reste à ce stade une question ouverte plutôt qu'une preuve déjà apportée.

AGILE 2.0 s'inscrit dans une feuille de route plus large chez AgiBot, qui avance sur plusieurs fronts en parallèle: déploiement au parc Chimelong, commercialisation du A3 Ultra, et désormais une architecture logicielle à deux couches associant ce moteur de locomotion sensé-control à GE-Act 2.0 pour la manipulation. Cette séparation entre une couche dédiée à l'équilibre et au déplacement et une couche dédiée à la manipulation par apprentissage world-action illustre une stratégie construite brique par brique plutôt qu'un modèle unique tout-en-un. Aucune date de disponibilité commerciale, aucun partenaire pilote ni calendrier de déploiement n'ont été précisés pour AGILE 2.0 lui-même, et la validation de ce moteur dépendra désormais de sa capacité à démontrer, en conditions réelles et hors environnements préparés, un équilibre dynamique fiable que la génération AGILE 1.0 ne parvenait pas encore à garantir.

Dans nos dossiers

À lire aussi

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots
1Interesting Engineering 

IA chinoise dévoile de nouveaux modèles de perception spatiale pour robots

La société chinoise Robbyant a dévoilé LingBot-Depth 2.0, une nouvelle génération de modèles de perception spatiale pour robots, accompagnée d'un modèle de vision associé baptisé LingBot-Vision. LingBot-Depth 2.0 s'appuie sur la version précédente, qui avait introduit la technique de Masked Depth Modeling (MDM) pour améliorer la détection de profondeur sur les surfaces transparentes et réfléchissantes. Entraîné sur 150 millions d'échantillons, le nouveau modèle obtient les meilleurs résultats sur 12 des 16 benchmarks de complétion de profondeur testés. Dans les scénarios de perte de profondeur sévère, l'erreur est divisée par plus de deux par rapport au modèle précédent, le score RMSE passant de 0,132 à 0,062. Le modèle progresse aussi sur la détection des surfaces vitrées et des miroirs, un point faible classique des caméras de profondeur. LingBot-Vision, entraîné sur 160 millions d'images (un jeu de données plus restreint que ceux des modèles concurrents), utilise pour la première fois la "structure de bordure" comme objectif de pré-entraînement, permettant une localisation des contours au niveau sub-pixel et un suivi stable des arêtes d'objets sur des séquences vidéo. Pour l'industrie robotique, cette annonce illustre la poursuite de la course aux modèles de perception spatiale comme brique fondamentale des systèmes d'IA incarnée, aux côtés des modèles d'action type VLA (vision-langage-action) tels que Pi-0 ou GR00T N2. Une perception de profondeur fiable sur verre et surfaces réfléchissantes reste un obstacle concret pour la navigation en environnement intérieur (entrepôts, bureaux, hôpitaux), là où les caméras stéréo et LiDAR classiques échouent régulièrement. La certification obtenue auprès du Depth Vision Laboratory d'Orbbec, avec des tests sur les caméras stéréo 3D Gemini 330, apporte une validation industrielle plus tangible qu'une simple annonce marketing, même si les chiffres de benchmark restent ceux communiqués par Robbyant lui-même et mériteraient une vérification indépendante. Le partenariat avec Orbbec, fabricant reconnu de capteurs 3D, va au-delà de la validation logicielle : il s'étend au matériel, avec l'intégration d'une version personnalisée de LingBot-Depth dans le dispositif RGB-D EGO de la nouvelle plateforme de collecte de données "Robot-Free" d'Orbbec, conçue pour capturer des données d'entraînement sans mobiliser de robot physique. Robbyant annonce qu'une version commerciale avancée du modèle sera intégrée à cette plateforme dans de futures mises à jour, avec pour objectif de fournir une base de données plus précise et stable pour l'entraînement des systèmes d'IA incarnée. Le mouvement s'inscrit dans une dynamique plus large de fournisseurs chinois de modèles de fondation pour la robotique cherchant à s'imposer comme briques de perception standard, à un moment où la course humanoïde et logistique internationale accélère la demande de systèmes de perception robustes et bon marché.

Chine/AsieActu
1 source
Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée
2Robotics & Automation News 

Robbyant lance LingBot-Depth 2.0 et LingBot-Vision pour une perception spatiale robotique avancée

Robbyant, filiale d'IA incarnée d'Ant Group (maison mère d'Alipay), a dévoilé LingBot-Depth 2.0, un modèle de nouvelle génération dédié à la perception spatiale robotique, accompagné de LingBot-Vision, son modèle visuel fondation. Ces deux briques logicielles visent à doter les robots d'une compréhension fine de l'espace physique qui les entoure, condition préalable à une navigation autonome fiable. LingBot-Depth 2.0 succède à une première version dont Robbyant revendique le succès, sans toutefois détailler publiquement les métriques précises de précision de profondeur, la latence de traitement ou le matériel de référence compatible, éléments qui restent à confirmer par des tests indépendants. Cette annonce s'inscrit dans une course technologique où la perception spatiale constitue l'un des verrous majeurs freinant le déploiement des robots humanoïdes et des AMR en environnement réel : sans estimation de profondeur robuste, la manipulation fine et l'évitement d'obstacles restent fragiles hors laboratoire. En misant sur un modèle de vision fondation couplé à un module de profondeur dédié, Robbyant cherche à se positionner sur le segment logiciel de la pile robotique, plutôt que sur le hardware, un pari que suivent aussi des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T N2). Robbyant s'appuie sur les ressources cloud et IA d'Ant Group, groupe technologique chinois pesant lourd dans la fintech et l'IA, ce qui lui donne une capacité de calcul et de distribution significative face aux start-ups occidentales du secteur. Les prochaines étapes, notamment une éventuelle ouverture à des partenaires industriels ou une intégration dans des plateformes robotiques tierces, restent à préciser.

Chine/AsieActu
1 source
Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés
3Robotics & Automation News 

Robbyant dévoile LingBot-VLA 2.0, modèle IA universel pour robots incarnés

Robbyant, filiale d'IA incarnée du groupe Ant Group (maison mère d'Alipay), a annoncé la mise à jour et la publication en open source de LingBot-VLA 2.0, un modèle vision-langage-action (VLA) destiné aux robots humanoïdes et autres plateformes incarnées. Ce nouveau modèle s'appuie directement sur LingBot-VLA 1.0, sorti en janvier 2026, et apporte des progrès notables sur trois axes techniques majeurs : la généralisation morphologique (capacité à piloter des corps de robots différents sans réentraînement complet), le support d'un nombre accru de degrés de liberté (DoF), et l'efficacité de déploiement. Robbyant présente LingBot-VLA 2.0 comme un "cerveau universel" capable de s'adapter à des architectures robotiques variées plutôt qu'à une seule plateforme propriétaire. L'enjeu pour l'industrie robotique tient moins à la performance brute qu'à la stratégie d'ouverture : en publiant son modèle en open source, Ant Group cherche à s'imposer comme fournisseur de la couche logicielle "cerveau" pour un écosystème de fabricants de robots humanoïdes, plutôt que de vendre du matériel propre. Pour les intégrateurs et décideurs industriels, cela signifie potentiellement un modèle VLA gratuit et personnalisable, à intégrer sur des plateformes tierces, ce qui pourrait accélérer l'adoption face aux modèles propriétaires fermés comme Helix (Figure AI) ou GR00T N2 (NVIDIA). Cela renforce aussi l'hypothèse selon laquelle la généralisation cross-embodiment (un même modèle pilotant plusieurs morphologies de robots) devient un axe de compétition central, au-delà de la simple démonstration ponctuelle. Cette annonce s'inscrit dans la stratégie plus large d'Ant Group de se positionner sur l'IA incarnée, un an après le lancement de la première version de LingBot-VLA. Le secteur des modèles VLA reste dominé par des acteurs américains (Physical Intelligence avec Pi-0, NVIDIA avec GR00T, Figure AI avec Helix) et chinois (Unitree, AgiBot), avec une bascule progressive vers l'open source comme arme concurrentielle, à l'image de ce que Meta a fait avec Llama face à OpenAI. Les détails précis sur les benchmarks, les partenaires de déploiement et le calendrier de disponibilité du modèle n'étaient pas encore complètement communiqués au moment de l'annonce, ce qui invite à distinguer la publication du code de sa validation réelle sur du matériel tiers.

Chine/AsieActu
1 source
L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée
436Kr 

L'ex-directeur tech de Meituan crée un modèle du monde pour la restauration à l'ère de l'IA incarnée

AtomBite.AI (元节智能), startup chinoise d'intelligence incarnée, vient de boucler un tour d'amorçage de plusieurs dizaines de millions de yuans mené par le fonds Yinno Innovation, avec la participation du Shuimu Tsinghua Alumni Seed Fund. La société cible un terrain peu médiatisé mais à forte récurrence : la cuisine professionnelle de restauration et la chaîne d'exécution des commandes de livraison de repas. Son équipe fondatrice porte l'ADN de Meituan : Wang Dong (CEO, docteur en informatique) y dirigeait l'ingénierie de Meituan Waimai, supervisant mille ingénieurs et des algorithmes traitant des dizaines de millions de commandes quotidiennes ; Li Tao pilotait les systèmes algorithmiques et data de la même division ; Li Haozhe, troisième co-fondateur, est un entrepreneur en série à dimension internationale. La technologie centrale est un "World Action Model" (WAM) dédié à la restauration, décliné en architecture VT-WAM combinant vision et retour tactile, en rupture explicite avec l'approche VLA (Vision-Language-Action) dominante dans le secteur. Un premier déploiement pilote en cuisine professionnelle est attendu d'ici fin 2026, avec plusieurs lettres d'intention déjà signées avec des opérateurs nationaux et internationaux. Le choix de la restauration résulte d'un audit de plusieurs mois conduit en Amérique du Nord et à Singapour. Wang Dong y a identifié un triptyque rare : besoin universel (même problématique en Chine, aux États-Unis et en Asie du Sud-Est), ROI mesurable pour le restaurateur (réduction des erreurs de commande, gains à l'emballage, allègement de la masse salariale) et cycle de décision court chez les PME, contrairement aux scénarios domestiques ou médico-sociaux. L'industrie est structurellement sous pression : hausse soutenue des salaires horaires en Amérique du Nord, turnover chronique et difficultés de recrutement persistantes en Chine. Sur le plan technique, AtomBite.AI conteste le paradigme VLA en affirmant que le contrôle moteur réel ne passe pas par le langage mais par la compréhension visuelle et physique. L'approche VT-WAM fusionne ces deux modalités dans un espace latent pour prédire les conséquences de contact avant exécution : inférer si un gobelet est plein ou chaud modifie les forces de friction et le centre de gravité lors de la saisie, ce que la vision seule ne permet pas de capturer. AtomBite.AI prend le contre-pied de la stratégie "modèle universel d'abord" adoptée par la plupart de ses concurrents. Les opérations répétitives de la cuisine, emballage, tri et transfert de commandes, génèrent un flux naturel de données d'interaction physique difficile à reproduire en simulation, alimentant un cycle d'amélioration continue du modèle depuis le terrain réel. L'architecture se décompose en trois couches : modèle monde incarné pour la perception et la planification d'actions, moteur d'orchestration des tâches, et couche matérielle combinant composants propriétaires et hardware standard. Les gestes récurrents s'exécutent en local sur des modèles légers pour limiter la latence ; le cloud gère les exceptions comme un ingrédient manquant ou un objet détecté hors place. Sur ce segment, Miso Robotics aux États-Unis et Keenon Robotics en Chine sont déjà présents, sur des périmètres différents (friture automatisée, service en salle). La feuille de route prévoit une extension progressive vers le tri, la logistique interne de restaurant, et à terme la cuisine domestique.

Chine/AsieActu
1 source