Aller au contenu principal
IA physiquearXiv cs.RO 

ME-Brain-1.0 : mémoire, cognition et action pour une intelligence incarnée évolutive

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint publié sur arXiv en septembre 2026 présente ME-Brain 1.0 (MachEmbodied-Brain), un système d'intelligence incarnée organisé en boucle fermée : exécution d'actions, acquisition d'expérience, évolution de l'expérience, exécution améliorée. Il combine une Mémoire Évolutive qui consolide des trajectoires multimodales en expérience hiérarchique réutilisable, un Noyau Cognitif qui convertit l'expérience physique en compétences transférables, et un Modèle d'Action fondé sur des images-clés événementielles, une prédiction locale nommée EventCell et une modulation mémorielle conditionnée par l'action. Sur les benchmarks, le Noyau Cognitif dépasse le meilleur modèle comparé de 8,2 et 9,6 points ; le Modèle d'Action atteint 47,88 % de réussite sur RoboMME (+3,26 points), un score de 21,51 et 16,03 % de réussite sur RoboDojo, devançant Pi-0.5 de 10,10 et 9,12 points, et 69,5 de score moyen avec 66,7 % de réussite sur les six tâches de ME-RealBench, contre un modèle DM0.5 dépassé de 12,8 et 11,7 points.

L'enjeu revendiqué est le passage d'un paradigme où l'on entraîne puis fige le modèle à une logique de déploiement évolutif sans réentraînement, alors que la plupart des systèmes robotiques actuels, y compris les modèles vision-langage-action pour humanoïdes, restent figés une fois livrés et n'apprennent rien de leurs interactions physiques réelles. Si ces gains se confirment au-delà des benchmarks internes du papier, l'approche intéresserait les intégrateurs et exploitants de flottes confrontés au coût des cycles de réentraînement à chaque nouvelle tâche, et répondrait à la critique récurrente d'un écart entre démonstrations soignées et performance réelle sur le terrain. Ces résultats restent toutefois issus d'un preprint non encore revu par les pairs et évalués en partie sur des benchmarks propres aux auteurs, ce qui appelle une lecture prudente.

Le système s'inscrit dans la course aux modèles vision-langage-action qui structure la robotique humanoïde depuis Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, face auxquels ME-Brain revendique l'apprentissage continu post-déploiement comme axe de différenciation, comparaisons à l'appui (Pi-0.5, DM0.5). L'abstract ne précise ni la plateforme robotique utilisée, ni le laboratoire ou l'entreprise porteuse au-delà du nom du système, ni de calendrier de pilote annoncé. À ce stade, il s'agit d'une publication de recherche assortie de résultats de benchmark, non d'un produit commercialisé ni d'un déploiement réel chez un client.

À lire aussi

L'échographie ouvre une voie évolutive vers l'intelligence tactile pour l'IA physique
1Robotics Business Review 

L'échographie ouvre une voie évolutive vers l'intelligence tactile pour l'IA physique

UltraSense publie un argumentaire technique lié à RoboBusiness 2026, conférence qui se tiendra les 20 et 21 octobre à Santa Clara, en Californie, pour sa 20e édition, avec le « physical AI » comme l'un des thèmes de session. L'entreprise défend une architecture de détection tactile à ultrasons positionnée sous la surface des doigts et pinces robotiques, plutôt que les « peaux électroniques » actuelles intégrées près du point de contact, à base de capteurs capacitifs, piézorésistifs, piézoélectriques, triboélectriques ou à impédance, montés dans des élastomères ou des films multicouches. Selon UltraSense, ce positionnement en surface expose ces capteurs à l'environnement mécanique le plus sévère du robot : compression, abrasion, contamination, humidité, variations de température et vieillissement des matériaux, ce qui provoque sur des millions de cycles de contact de l'usure, une dérive de calibration, de la délamination et du fluage. La publication ne cite aucun produit commercial chiffré, aucun client ni donnée de déploiement : il s'agit d'un positionnement conceptuel, pas d'une annonce de produit. Pour les fabricants de mains humanoïdes, de pinces dextres et de robots de logistique ou de service, l'argument touche un point sensible : la fiabilité du toucher dans la durée, plutôt que sa performance en démonstration, conditionne la viabilité commerciale à grande échelle. Un capteur qui fonctionne au premier jour en laboratoire n'a pas de valeur industrielle s'il dérive après quelques mois d'usage intensif. Le texte souligne aussi que le secteur ne peut plus se contenter d'un contact binaire ou d'une seule valeur de force, et doit capter force, cisaillement, glissement et nature du matériau, ce qui complique encore la question de la durabilité des capteurs existants. UltraSense ne fournit toutefois aucune donnée de test comparatif ni mesure de durée de vie chiffrée : l'argument reste une prise de position face aux fournisseurs établis de peaux électroniques, sans preuve vérifiable indépendante à l'appui. Cette publication s'inscrit dans une tendance où le physical AI quitte le raisonnement purement numérique pour affronter l'interaction physique réelle : la vision, la navigation et la planification des robots ont déjà beaucoup progressé, mais la manipulation fine reste freinée par la fiabilité du toucher, ce qui ouvre un espace à des spécialistes comme UltraSense face aux fournisseurs établis de capteurs capacitifs, piézorésistifs ou piézoélectriques intégrés en surface. Aucun partenaire, robot ou calendrier de déploiement n'est cité dans le texte, qui sert surtout à préparer le terrain avant RoboBusiness 2026, où UltraSense et d'autres acteurs du secteur devraient détailler leurs approches de la détection tactile dans le cadre du parcours consacré au physical AI. La prochaine étape attendue reste une démonstration concrète de cette architecture sous-surface sur des mains ou pinces réelles soumises à un usage prolongé, seul test capable de confirmer l'avantage de durée de vie annoncé.

IA physiquePaper
1 source
IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation
2arXiv cs.RO 

IA incarnée en évolution : Embodied-R1.5 améliore l'intelligence physique grâce aux modèles fondation

Une équipe de chercheurs a publié sur arXiv Embodied-R1.5, un modèle de fondation incarné (EFM pour Embodied Foundation Model) de 8 milliards de paramètres intégrant cognition incarnée, planification, auto-correction et pointage d'affordances dans une architecture unifiée, entraîné sur un corpus dépassant 15 milliards de tokens construit via trois pipelines automatisés. Le cadre Planner-Grounder-Corrector (PGC) en boucle fermée permet l'exécution autonome et l'auto-correction sur des tâches longues, soutenu par une recette d'apprentissage par renforcement multi-tâches équilibré pour atténuer les conflits entre sous-domaines hétérogènes. Sur les benchmarks standardisés, Embodied-R1.5 atteint l'état de l'art sur 16 des 24 benchmarks de VLM incarnés, devançant Gemini-Robotics-ER-1.5 de Google DeepMind et GPT-5.4 d'OpenAI. Adapté en VLA (Vision-Language-Action) avec peu de données de fine-tuning, il surpasse pi-0.5 de Physical Intelligence sur quatre suites de benchmarks de manipulation. Des tests zero-shot sur robot réel valident les performances en suivi d'instructions, ancrage d'affordances, manipulation d'objets articulés et tâches longues, les poids, le code d'entraînement et EmbodiedEvalKit, un framework d'évaluation dédié, étant publiés en open source. Qu'un modèle de 8 milliards de paramètres surpasse des systèmes adossés aux ressources de Google et d'OpenAI est un signal notable pour les intégrateurs industriels, car la compacité ouvre la voie à un déploiement embarqué sur plateformes contraintes. L'auto-correction en boucle fermée du PGC répond directement au demo-to-reality gap qui freine la commercialisation des robots polyvalents, tandis que la capacité à fine-tuner en VLA avec peu de données cible le goulot d'étranglement central de la collecte de données de manipulation étiquetées. L'open source complet facilite la comparaison reproductible et devrait accélérer les itérations communautaires, à condition que les performances zero-shot annoncées soient confirmées dans des configurations adversariales que le papier ne documente pas. Embodied-R1.5 s'inscrit dans la vague des modèles de fondation robotiques généraux densifiée depuis RT-2 de Google et OpenVLA, avec pour concurrents directs Physical Intelligence (pi-0, pi-0.5) et Google DeepMind (Gemini Robotics). L'absence d'acteurs européens parmi les concurrents benchmarkés reflète le retard du continent, où des acteurs comme Wandercraft ou Enchanted Tools restent cantonnés à des niches spécialisées. L'approche open source total distingue ce travail des modèles propriétaires de Figure AI (Figure 03) ou de 1X Technologies, positionnant potentiellement Embodied-R1.5 comme base de référence pour les laboratoires et industriels souhaitant spécialiser un EFM sur leurs propres flux de manipulation.

UELes poids et le code d'Embodied-R1.5 publiés en open source constituent une base de référence accessible pour les laboratoires européens (CEA-List, INRIA) souhaitant spécialiser un EFM sur leurs propres flux de manipulation sans dépendre des modèles propriétaires de Google ou OpenAI.

💬 8 milliards de paramètres qui coiffent Gemini Robotics et GPT-5.4 sur leurs propres benchmarks, en open source total, c'est inattendu. L'auto-correction en boucle fermée s'attaque directement au fossé entre la démo en labo et le robot qui tient la route en prod, ce qui est le vrai mur depuis RT-2. Bon, le papier esquive les configurations difficiles, donc on verra ce que ça donne quand la communauté s'en empare.

IA physiqueOpinion
1 source
Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action
3arXiv cs.RO 

Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action

Une équipe de recherche a publié Pelican-Unified 1.0 (arXiv 2605.15153), un modèle de fondation incarné qui intègre dans un seul checkpoint quatre capacités habituellement confiées à des modules distincts : compréhension visuelle, raisonnement, imagination et génération d'actions robotiques. L'architecture repose sur un unique VLM (Vision-Language Model) qui encode scènes, instructions et historiques d'actions dans un espace sémantique partagé. Ce même VLM génère en un seul forward pass des chaînes de pensée orientées tâche, projetées dans une variable latente dense. Un module baptisé Unified Future Generator (UFG) conditionne ensuite sur cette latente pour produire simultanément vidéos futures et séquences d'actions via deux têtes de sortie dans le même processus de débruitage (denoising). Les performances annoncées : 64,7 sur huit benchmarks VLM standards (meilleur parmi les modèles de taille comparable), 66,03 sur WorldArena (premier rang) et 93,5 sur RoboTwin (deuxième meilleure moyenne parmi les méthodes comparées). L'article est déposé en preprint, sans validation par les pairs à ce stade. L'enjeu architectural est direct : les systèmes robotiques avancés actuels reposent quasi universellement sur des experts spécialisés distincts pour percevoir, raisonner, planifier et exécuter. Ce papier cherche à démontrer qu'un modèle unique, optimisé conjointement sur des pertes de langage, vidéo et action, peut égaler ces spécialistes sans compromis de performance. Si ces résultats se confirment hors simulation, l'impact pour les intégrateurs est double : un seul checkpoint à maintenir et une meilleure généralisation inter-tâches. Le couplage imagination-action dans le même processus de débruitage rappelle l'approche de Physical Intelligence avec Pi-0.5, mais l'intégration du raisonnement textuel dans la même passe constitue un degré d'unification plus poussé. Le score sur RoboTwin reste néanmoins un indicateur sim-to-real à valider en conditions réelles. La course aux modèles VLA (Vision-Language-Action) s'est accélérée en 2024-2025 avec Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, et les modèles RT-X de Google DeepMind, chacun maintenant des composants partiellement séparés pour la planification et la génération motrice. Pelican-Unified 1.0 se positionne comme une alternative radicalement unifiée, mais reste au stade académique : aucun déploiement, aucun partenariat industriel annoncé, et l'équipe auteure n'est pas identifiée dans le résumé public, ce qui limite l'évaluation de la crédibilité institutionnelle. La revendication de "premier modèle unifié" mérite d'être nuancée, plusieurs architectures combinant déjà compréhension et action. Les prochaines étapes naturelles passent par une validation sur des benchmarks en conditions réelles et une soumission à CoRL ou ICRA.

IA physiqueOpinion
1 source
LightNav-0 : révéler l'intelligence spatiale des VLM pour la navigation incarnée généraliste
4arXiv cs.RO 

LightNav-0 : révéler l'intelligence spatiale des VLM pour la navigation incarnée généraliste

Publié sur arXiv le 30 août 2026 (référence 2608.30935), LightNav-0 est un modèle compact et généraliste de navigation robotique qui exploite directement les capacités spatiales des modèles vision-langage pré-entraînés, sans tête de prédiction propre à chaque tâche. Il unifie suivi d'instructions, navigation vers un objet en vocabulaire ouvert et suivi visuel via un pointage spatial à double canal, converti en trajectoires par un tokenizer d'action à quantification vectorielle résiduelle propre à chaque robot. Entraîné sur plus de 2 000 scènes et 4 000 heures de données, via un pré-entraînement au raisonnement embarqué (checkpoint LightNav-ER), un fine-tuning supervisé puis du renforcement, il revendique la meilleure moyenne sur 8 benchmarks de raisonnement embarqué et des scores état de l'art en monoculaire sur les 10 environnements de simulation testés, avec généralisation zero-shot en conditions réelles sur plusieurs robots. Cette approche compte car elle traite la navigation comme une capacité transférable plutôt qu'un empilement de modules dédiés par tâche et par robot, une fragmentation qui limite aujourd'hui la portabilité entre plateformes. En s'appuyant sur un VLM générique, LightNav-0 rejoint la tendance des modèles vision-langage-action comme Pi-0 ou GR00T N2, qui visent à unifier perception, raisonnement et contrôle moteur. Pour les intégrateurs, l'intérêt tient à la promesse d'un backbone unique redéployable sur des robots variés sans réentraînement complet. Il s'agit toutefois à ce stade d'un résultat de recherche en preprint, mesuré sur benchmarks et en simulation, non d'un produit commercialisé. LightNav-0 s'inscrit dans la course aux modèles de fondation généralistes pour la robotique, aux côtés de systèmes VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), tous conçus pour transférer une même intelligence spatiale à plusieurs tâches et plateformes. L'article ne mentionne aucune affiliation industrielle, aucun partenaire de déploiement ni acteur français ou européen. Les auteurs présentent leurs résultats comme une preuve que des VLM compacts peuvent servir de socle transférable pour la navigation embarquée généraliste, sans annoncer de calendrier de déploiement commercial au-delà des essais réels décrits dans l'étude.

IA physiqueActu
1 source