Aller au contenu principal
Li Auto dévoile sa trilogie incarnée : ME-Brain-1.0, ME-U0 (WAM unifié) et ME-VLM embarqué
IA physiquePandaily 

Li Auto dévoile sa trilogie incarnée : ME-Brain-1.0, ME-U0 (WAM unifié) et ME-VLM embarqué

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le 22 septembre, l'équipe Foundation Model de Li Auto (marque MachEmbodied) a dévoilé trois modèles d'IA incarnée : ME-Brain-1.0, un système cognitif complet ; ME-U0, un modèle monde-action unifiant compréhension et génération ; et ME-VLM, une famille de modèles cognitifs déployables en périphérie. ME-Brain-1.0 combine une mémoire évolutive, un "Cognitive Core" et un modèle d'action événementiel dans une boucle exécution, capture d'expérience et mise à jour des compétences. Ce Cognitive Core existe en version MoE 35B-A3B (35 milliards de paramètres, 3 milliards actifs) et en version embarquée de 4 milliards de paramètres, avec respectivement 70,9 et 72,5 points en moyenne sur les suites d'évaluation incarnées et agent de l'entreprise, la version 4B se classant juste derrière dans ces comparaisons internes. Sur le SoC embarqué M100 de Li Auto, la latence de prefill de ME-VLM passerait de 400 ms à 188 ms grâce à la compression de tokens et à une quantification W4A8. ME-U0, pré-entraîné sur environ 4200 heures de données filtrées à partir de corpus robotiques et de vidéos à la première personne, obtient 99,1% de réussite sur le benchmark standard LIBERO, 81,8% sur LIBERO-Plus sans adaptation dédiée, et un score de process de 17,66 sur RoboDojo-Sim parmi les modèles monde-action participants.

Cette annonce illustre, dans la robotique humanoïde, le passage d'une simple démonstration matérielle à un empilement logiciel complet mémoire-cognition-action, avec un chemin de déploiement embarqué documenté plutôt qu'un simple prototype de laboratoire. Pour les intégrateurs, le signal clé est la promesse d'un modèle monde-action généraliste, transférable entre tâches de manipulation sans réentraînement lourd, et les gains de latence obtenus par quantification W4A8 intéressent directement les industriels qui cherchent à faire tourner des modèles vision-langage-action sur puce, sans dépendre du cloud. Ces chiffres restent toutefois auto-rapportés par Li Auto et n'ont pas été reproduits par des tiers. Des observateurs indépendants, dont Robot Forward repris par Phoenix Tech, relèvent dans les vidéos de démonstration des pauses de pince visibles, des erreurs de préhension occasionnelles et des tâches ouvertes inachevées, même quand les scènes scriptées réussissent, rappelant l'écart habituel entre démonstration et réalité du secteur.

Li Auto reste avant tout un constructeur automobile chinois coté à Hong Kong et au Nasdaq, connu pour ses véhicules électriques à autonomie étendue ; cette trilogie marque une diversification de son équipe Foundation Model vers l'IA incarnée, dans la lignée d'autres constructeurs automobiles qui réinvestissent leurs compétences en conduite autonome et en edge computing dans la robotique. Elle se positionne face à un paysage déjà dense de modèles monde-action, dont Pi-0 de Physical Intelligence, GR00T N2 de Nvidia, Helix de Figure AI, ou les piles logicielles associées à des plateformes comme Figure 03 et Optimus Gen 3 de Tesla. Aucun acteur français ou européen (Wandercraft, Exotec, Pollen Robotics, Enchanted Tools) n'apparaît dans cette annonce, circonscrite aux écosystèmes chinois et américain. Il s'agit pour l'instant d'une publication technique accompagnée de benchmarks internes, sans déploiement commercial ni calendrier de pilotes annoncé ; la validation par des évaluations indépendantes déterminera la portée réelle de cette architecture mémoire-cognition-action.

À lire aussi

ME-Brain-1.0 : mémoire, cognition et action pour une intelligence incarnée évolutive
1arXiv cs.RO 

ME-Brain-1.0 : mémoire, cognition et action pour une intelligence incarnée évolutive

Un preprint publié sur arXiv en septembre 2026 présente ME-Brain 1.0 (MachEmbodied-Brain), un système d'intelligence incarnée organisé en boucle fermée : exécution d'actions, acquisition d'expérience, évolution de l'expérience, exécution améliorée. Il combine une Mémoire Évolutive qui consolide des trajectoires multimodales en expérience hiérarchique réutilisable, un Noyau Cognitif qui convertit l'expérience physique en compétences transférables, et un Modèle d'Action fondé sur des images-clés événementielles, une prédiction locale nommée EventCell et une modulation mémorielle conditionnée par l'action. Sur les benchmarks, le Noyau Cognitif dépasse le meilleur modèle comparé de 8,2 et 9,6 points ; le Modèle d'Action atteint 47,88 % de réussite sur RoboMME (+3,26 points), un score de 21,51 et 16,03 % de réussite sur RoboDojo, devançant Pi-0.5 de 10,10 et 9,12 points, et 69,5 de score moyen avec 66,7 % de réussite sur les six tâches de ME-RealBench, contre un modèle DM0.5 dépassé de 12,8 et 11,7 points. L'enjeu revendiqué est le passage d'un paradigme où l'on entraîne puis fige le modèle à une logique de déploiement évolutif sans réentraînement, alors que la plupart des systèmes robotiques actuels, y compris les modèles vision-langage-action pour humanoïdes, restent figés une fois livrés et n'apprennent rien de leurs interactions physiques réelles. Si ces gains se confirment au-delà des benchmarks internes du papier, l'approche intéresserait les intégrateurs et exploitants de flottes confrontés au coût des cycles de réentraînement à chaque nouvelle tâche, et répondrait à la critique récurrente d'un écart entre démonstrations soignées et performance réelle sur le terrain. Ces résultats restent toutefois issus d'un preprint non encore revu par les pairs et évalués en partie sur des benchmarks propres aux auteurs, ce qui appelle une lecture prudente. Le système s'inscrit dans la course aux modèles vision-langage-action qui structure la robotique humanoïde depuis Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, face auxquels ME-Brain revendique l'apprentissage continu post-déploiement comme axe de différenciation, comparaisons à l'appui (Pi-0.5, DM0.5). L'abstract ne précise ni la plateforme robotique utilisée, ni le laboratoire ou l'entreprise porteuse au-delà du nom du système, ni de calendrier de pilote annoncé. À ce stade, il s'agit d'une publication de recherche assortie de résultats de benchmark, non d'un produit commercialisé ni d'un déploiement réel chez un client.

IA physiqueOpinion
1 source
MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée
2arXiv cs.RO 

MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée

Publié le 23 septembre 2026 sur arXiv (2609.25627v1), MachEmbodied-U0 (ME-U0) est un modèle fondation unifié pour la robotique incarnée, combinant compréhension et génération via une architecture Mixture-of-Transformers : prédiction de sous-tâches et ancrage d'affordance guident une génération conjointe de dynamique visuelle et d'actions par flow matching. La dynamique visuelle future couvre RGB, profondeur, normales de surface et flux optique, alignés aux commandes fines par un encodage de position rotatif multi-fréquence (MRPE). Le modèle a été pré-entraîné sur environ 4 200 heures de démonstrations issues de jeux de données robotiques et de vidéos égocentriques humaines. En simulation, avec la seule supervision native de chaque benchmark, ME-U0 atteint un score moyen de 17,66 sur RoboDojo, une échelle propre à ce simulateur et donc difficile à comparer à d'autres benchmarks, ainsi que des taux de réussite de 99,0% sur LIBERO et 82,5% sur LIBERO-Plus. Les auteurs rapportent aussi des validations sur des tâches de manipulation robotique réelle. Le résultat central tient à l'unification : les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2 offrent de solides priors sémantiques sans modéliser explicitement l'évolution de la scène, tandis que les modèles monde-action prédisent la dynamique visuelle sans exposer la structure sémantique et spatiale nécessaire à une manipulation fine ; ME-U0 couple les deux pour combler cet écart. Pour les intégrateurs et chercheurs, le point notable est la capacité en zero-shot : sans supervision dédiée, le modèle prédit sous-tâches, affordances et dynamique visuelle sur des observations inédites, simulées ou réelles, un signe de transférabilité au-delà du seul benchmark d'entraînement. ME-U0 s'inscrit dans la vague de modèles fondation pour la robotique généraliste, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), qui unifient tous perception, raisonnement et contrôle moteur dans un seul réseau entraîné sur des corpus massifs de démonstrations et de vidéos humaines. Le travail reste à ce stade une publication de recherche arXiv, sans partenaire industriel ni calendrier de commercialisation annoncés ; les auteurs le présentent comme une preuve de concept, la suite logique étant l'extension des essais réels sur davantage de plateformes robotiques.

IA physiqueOpinion
1 source
Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action
3arXiv cs.RO 

Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action

Une équipe de recherche a publié Pelican-Unified 1.0 (arXiv 2605.15153), un modèle de fondation incarné qui intègre dans un seul checkpoint quatre capacités habituellement confiées à des modules distincts : compréhension visuelle, raisonnement, imagination et génération d'actions robotiques. L'architecture repose sur un unique VLM (Vision-Language Model) qui encode scènes, instructions et historiques d'actions dans un espace sémantique partagé. Ce même VLM génère en un seul forward pass des chaînes de pensée orientées tâche, projetées dans une variable latente dense. Un module baptisé Unified Future Generator (UFG) conditionne ensuite sur cette latente pour produire simultanément vidéos futures et séquences d'actions via deux têtes de sortie dans le même processus de débruitage (denoising). Les performances annoncées : 64,7 sur huit benchmarks VLM standards (meilleur parmi les modèles de taille comparable), 66,03 sur WorldArena (premier rang) et 93,5 sur RoboTwin (deuxième meilleure moyenne parmi les méthodes comparées). L'article est déposé en preprint, sans validation par les pairs à ce stade. L'enjeu architectural est direct : les systèmes robotiques avancés actuels reposent quasi universellement sur des experts spécialisés distincts pour percevoir, raisonner, planifier et exécuter. Ce papier cherche à démontrer qu'un modèle unique, optimisé conjointement sur des pertes de langage, vidéo et action, peut égaler ces spécialistes sans compromis de performance. Si ces résultats se confirment hors simulation, l'impact pour les intégrateurs est double : un seul checkpoint à maintenir et une meilleure généralisation inter-tâches. Le couplage imagination-action dans le même processus de débruitage rappelle l'approche de Physical Intelligence avec Pi-0.5, mais l'intégration du raisonnement textuel dans la même passe constitue un degré d'unification plus poussé. Le score sur RoboTwin reste néanmoins un indicateur sim-to-real à valider en conditions réelles. La course aux modèles VLA (Vision-Language-Action) s'est accélérée en 2024-2025 avec Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, et les modèles RT-X de Google DeepMind, chacun maintenant des composants partiellement séparés pour la planification et la génération motrice. Pelican-Unified 1.0 se positionne comme une alternative radicalement unifiée, mais reste au stade académique : aucun déploiement, aucun partenariat industriel annoncé, et l'équipe auteure n'est pas identifiée dans le résumé public, ce qui limite l'évaluation de la crédibilité institutionnelle. La revendication de "premier modèle unifié" mérite d'être nuancée, plusieurs architectures combinant déjà compréhension et action. Les prochaines étapes naturelles passent par une validation sur des benchmarks en conditions réelles et une soumission à CoRL ou ICRA.

IA physiqueOpinion
1 source
Le mur de l'IA embarquée : pourquoi l'IA incarnée exige de nouvelles mathématiques
4Robotics Business Review 

Le mur de l'IA embarquée : pourquoi l'IA incarnée exige de nouvelles mathématiques

Wandercraft, Exotec, Pollen ou Enchanted Tools ne sont pas mentionnés dans cet article, il s'agit d'un texte d'opinion technique et non d'une annonce produit. Dans un article publié sur The Robot Report, l'ingénieur Zhengis Tileubay développe le concept du "mur de l'IA embarquée" (edge AI wall), une limite qu'il juge propre à l'ensemble des systèmes d'IA physique. Ce texte prolonge une précédente publication, "Phase stability regulator based on two dynamic parameters for autonomous mobile robots", consacrée à l'instabilité computationnelle des robots mobiles autonomes (AMR) évoluant dans des environnements complexes et changeants. Son constat initial : même lorsque capteurs, actionneurs et logiciels fonctionnent normalement, la qualité de décision d'un robot se dégrade quand son planificateur doit évaluer en temps réel un nombre croissant de trajectoires alternatives, un phénomène de surcharge informationnelle plutôt qu'une panne matérielle. Tileubay affirme désormais que ce problème, observé localement dans la navigation, traverse toute la pile technologique de l'IA incarnée (embodied AI), qu'il s'agisse d'assistants robotiques humanoïdes, de systèmes de livraison autonome ou de véhicules autonomes. Il pointe une hypothèse largement partagée dans l'industrie, celle d'une loi d'échelle linéaire : si l'augmentation de la puissance de calcul et des volumes de données a permis les progrès de l'IA dans le cloud, la même stratégie devrait fonctionner pour le contrôle de corps physiques. L'article ne présente ni produit ni déploiement chiffré, c'est une réflexion prospective relayée par un média spécialisé qui organise par ailleurs une session dédiée à l'IA physique lors de RoboBusiness 2026, les 20 et 21 octobre à Santa Clara, en Californie. Cette mise en garde vise directement les intégrateurs et décideurs qui misent sur la simple augmentation de puissance de calcul embarquée pour faire progresser leurs robots. Contrairement au cloud, où un manque de mémoire ou de puissance se compense en ajoutant des serveurs et où une latence de quelques secondes reste tolérable, l'IA physique subit des contraintes matérielles rigides : chaque watt supplémentaire consommé par un ordinateur embarqué impose une batterie plus grosse et plus lourde, et la chaleur générée complique le refroidissement. Dans les systèmes temps réel, la latence de décision devient critique à la milliseconde : un robot qui ne traite pas la scène assez vite réagit à un état obsolète de son environnement, ce qui provoque instabilité, oscillations comportementales et risques d'accident. L'argument remet en question l'hypothèse dominante selon laquelle le scaling qui a fonctionné pour les grands modèles de langage se transposerait sans adaptation au contrôle physique. Pour Tileubay, plus les tâches confiées aux robots deviennent complexes, plus l'explosion combinatoire des espaces de solutions à évaluer se manifestera fréquemment, posant une question architecturale de fond : existe-t-il un seuil au-delà duquel ajouter de la puissance de calcul embarquée cesse d'être une stratégie viable, physiquement et économiquement, pour faire progresser l'IA incarnée. Cette réflexion prolonge les travaux antérieurs de l'auteur sur la stabilité de phase des robots mobiles autonomes, initialement perçus comme un problème circonscrit à la navigation locale. L'accélération de l'IA générative au cours de l'année écoulée, portée par les grands modèles de langage et les modèles fondation multimodaux, a poussé une vague de projets ambitieux, robots humanoïdes polyvalents, systèmes de livraison de nouvelle génération, véhicules autonomes, à transposer directement ces architectures lourdes dans le monde physique. C'est cette généralisation rapide que Tileubay interroge, sans citer de plateforme ou de laboratoire en particulier, préférant une critique de fond de l'hypothèse de scaling à une comparaison entre acteurs. L'article ne fournit ni pilote annoncé ni calendrier de déploiement, il fonctionne comme un signal d'alerte académique destiné à la communauté robotique, publié en amont de RoboBusiness 2026, où l'IA physique fera l'objet d'un parcours de sessions dédié les 20 et 21 octobre à Santa Clara.

IA physiquePaper
1 source