Aller au contenu principal
MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée
IA physiquearXiv cs.RO 

MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié le 23 septembre 2026 sur arXiv (2609.25627v1), MachEmbodied-U0 (ME-U0) est un modèle fondation unifié pour la robotique incarnée, combinant compréhension et génération via une architecture Mixture-of-Transformers : prédiction de sous-tâches et ancrage d'affordance guident une génération conjointe de dynamique visuelle et d'actions par flow matching. La dynamique visuelle future couvre RGB, profondeur, normales de surface et flux optique, alignés aux commandes fines par un encodage de position rotatif multi-fréquence (MRPE). Le modèle a été pré-entraîné sur environ 4 200 heures de démonstrations issues de jeux de données robotiques et de vidéos égocentriques humaines. En simulation, avec la seule supervision native de chaque benchmark, ME-U0 atteint un score moyen de 17,66 sur RoboDojo, une échelle propre à ce simulateur et donc difficile à comparer à d'autres benchmarks, ainsi que des taux de réussite de 99,0% sur LIBERO et 82,5% sur LIBERO-Plus. Les auteurs rapportent aussi des validations sur des tâches de manipulation robotique réelle.

Le résultat central tient à l'unification : les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2 offrent de solides priors sémantiques sans modéliser explicitement l'évolution de la scène, tandis que les modèles monde-action prédisent la dynamique visuelle sans exposer la structure sémantique et spatiale nécessaire à une manipulation fine ; ME-U0 couple les deux pour combler cet écart. Pour les intégrateurs et chercheurs, le point notable est la capacité en zero-shot : sans supervision dédiée, le modèle prédit sous-tâches, affordances et dynamique visuelle sur des observations inédites, simulées ou réelles, un signe de transférabilité au-delà du seul benchmark d'entraînement.

ME-U0 s'inscrit dans la vague de modèles fondation pour la robotique généraliste, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), qui unifient tous perception, raisonnement et contrôle moteur dans un seul réseau entraîné sur des corpus massifs de démonstrations et de vidéos humaines. Le travail reste à ce stade une publication de recherche arXiv, sans partenaire industriel ni calendrier de commercialisation annoncés ; les auteurs le présentent comme une preuve de concept, la suite logique étant l'extension des essais réels sur davantage de plateformes robotiques.

À lire aussi

Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action
1arXiv cs.RO 

Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action

Une équipe de recherche a publié Pelican-Unified 1.0 (arXiv 2605.15153), un modèle de fondation incarné qui intègre dans un seul checkpoint quatre capacités habituellement confiées à des modules distincts : compréhension visuelle, raisonnement, imagination et génération d'actions robotiques. L'architecture repose sur un unique VLM (Vision-Language Model) qui encode scènes, instructions et historiques d'actions dans un espace sémantique partagé. Ce même VLM génère en un seul forward pass des chaînes de pensée orientées tâche, projetées dans une variable latente dense. Un module baptisé Unified Future Generator (UFG) conditionne ensuite sur cette latente pour produire simultanément vidéos futures et séquences d'actions via deux têtes de sortie dans le même processus de débruitage (denoising). Les performances annoncées : 64,7 sur huit benchmarks VLM standards (meilleur parmi les modèles de taille comparable), 66,03 sur WorldArena (premier rang) et 93,5 sur RoboTwin (deuxième meilleure moyenne parmi les méthodes comparées). L'article est déposé en preprint, sans validation par les pairs à ce stade. L'enjeu architectural est direct : les systèmes robotiques avancés actuels reposent quasi universellement sur des experts spécialisés distincts pour percevoir, raisonner, planifier et exécuter. Ce papier cherche à démontrer qu'un modèle unique, optimisé conjointement sur des pertes de langage, vidéo et action, peut égaler ces spécialistes sans compromis de performance. Si ces résultats se confirment hors simulation, l'impact pour les intégrateurs est double : un seul checkpoint à maintenir et une meilleure généralisation inter-tâches. Le couplage imagination-action dans le même processus de débruitage rappelle l'approche de Physical Intelligence avec Pi-0.5, mais l'intégration du raisonnement textuel dans la même passe constitue un degré d'unification plus poussé. Le score sur RoboTwin reste néanmoins un indicateur sim-to-real à valider en conditions réelles. La course aux modèles VLA (Vision-Language-Action) s'est accélérée en 2024-2025 avec Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, et les modèles RT-X de Google DeepMind, chacun maintenant des composants partiellement séparés pour la planification et la génération motrice. Pelican-Unified 1.0 se positionne comme une alternative radicalement unifiée, mais reste au stade académique : aucun déploiement, aucun partenariat industriel annoncé, et l'équipe auteure n'est pas identifiée dans le résumé public, ce qui limite l'évaluation de la crédibilité institutionnelle. La revendication de "premier modèle unifié" mérite d'être nuancée, plusieurs architectures combinant déjà compréhension et action. Les prochaines étapes naturelles passent par une validation sur des benchmarks en conditions réelles et une soumission à CoRL ou ICRA.

IA physiqueOpinion
1 source
InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle
2arXiv cs.RO 

InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle

Des chercheurs présentent InternVLA-A1.5, un modèle unifie de manipulation robotique qui embarque a la fois les capacités sémantiques d'un VLM preentraine et une prévision physique du futur, le tout dans une seule politique de contrôle. L'architecture conserve un backbone VLM natif qui continue de s'entrainer sur des taches de question-réponse visuelle et de prédiction de sous-taches, auquel est attache un expert léger dédié a la génération continue d'actions. L'innovation clé porte sur la prévision du futur, reformulée comme un problème de "latent-querying": un petit ensemble de jetons de prévision apprenables condense les éléments du futur pertinents pour la tache en un code latent compact, sous la supervision d'un modèle de génération vidéo preentraine et gelé, sans jamais apprendre de génération au niveau du pixel. La branche vidéo est abandonnee au moment de l'inférence, ce qui préservé le contrôle en temps réel. Preentraine sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur six benchmarks de simulation, et affiche en conditions réelles la généralisation compositionnelle la plus solide sur des combinaisons d'instructions inédites. Ce travail s'attaque a un problème récurrent des modèles VLA unifies: entrainer conjointement compréhension sémantique et prédiction d'action tend a dégrader les priors du VLM d'origine, créé des interférences entre objectifs hétérogènes, et oblige souvent a réapprendre la prévision visuelle depuis zero en espace pixel, sans exploiter les modèles de génération vidéo déjà entraines. En évitant cette dernière étape couteuse tout en gardant un contrôle temps réel, l'approche laisse entrevoir, pour les intégrateurs et les équipes de recherche en robotique, une voie pour combiner raisonnement de haut niveau et dynamique physique sans sacrifier la vitesse d'exécution ni la robustesse face a des consignes formulées différemment de celles vues a l'entrainement, un point sensible pour tout déploiement commercial au-delà de la démo. Le papier s'inscrit dans la vague des modèles vision-langage-action généralistes portée ces deux dernières années par des acteurs comme Physical Intelligence avec pi-0, Nvidia avec GR00T N2, ou Figure AI avec Helix, tous confrontes au même arbitrage entre sémantique préservée et dynamique apprise. InternVLA-A1.5 reste pour l'instant une contribution de recherche publiée sur arXiv, évaluée sur benchmarks de simulation et expériences réelles limitées, et non un produit déployé a grande échelle; la suite logique serait une validation sur des plateformes robotiques tierces et des taches manufacturières plus complexes pour confirmer que les gains de généralisation tiennent hors laboratoire.

IA physiqueActu
1 source
IA incarnée et interprétabilité causale : comprendre pour mieux généraliser dans les modèles VLA
3arXiv cs.RO 

IA incarnée et interprétabilité causale : comprendre pour mieux généraliser dans les modèles VLA

Une équipe de chercheurs a publié le 1er mai 2026 (arXiv:2605.00321) un travail introduisant deux outils de diagnostic pour les politiques de type Vision-Langage-Action (VLA) : l'Interventional Significance Score (ISS) et le Nuisance Mass Ratio (NMR). L'ISS est une procédure de masquage interventionnel qui estime l'influence causale de régions visuelles spécifiques sur les prédictions d'action d'un agent robotique. Le NMR est une métrique scalaire qui quantifie dans quelle mesure un modèle s'appuie sur des caractéristiques visuelles non pertinentes pour la tâche plutôt que sur des causes réelles. La méthode reformule l'attribution visuelle comme un problème d'estimation interventionnelle, au sens de la causalité de Pearl, et non comme une simple corrélation statistique. Des expériences sur des tâches de manipulation variées confirment que le NMR prédit le comportement de généralisation, et que l'ISS produit des attributions plus fidèles que les méthodes d'interprétabilité existantes. À noter : le preprint ne publie ni code ni benchmark public, et les métriques de performance sur tâches spécifiques restent peu détaillées dans l'abstract. L'enjeu est direct pour les intégrateurs et les décideurs industriels : les modèles VLA actuellement déployés, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Sanctuary AI, échouent régulièrement hors de leur distribution d'entraînement. Jusqu'ici, identifier pourquoi restait largement empirique. ISS et NMR offrent un test diagnostique pré-déploiement : un NMR élevé signale que le modèle prend ses décisions sur la base de corrélations visuelles parasites (couleur de fond, éclairage, texture du sol) plutôt que sur la structure causale de la tâche. C'est une avancée concrète vers l'analyse formelle du sim-to-real gap, l'un des verrous les plus cités par les équipes d'intégration robotique industrielle, et cela ouvre la voie à des critères de certification hors-distribution avant mise en production. Le problème de l'interprétabilité des politiques robotiques apprises restait largement ouvert. Les méthodes existantes, cartes de saillance par gradient ou rollout d'attention, reposent sur des observations corrélationnelles et ont tendance à surestimer l'importance de features visuelles non causales. Ce travail se positionne explicitement contre ces approches en adoptant un cadre interventionnel rigoureux. Aucune affiliation institutionnelle n'est mentionnée dans le preprint. Les suites naturelles incluent l'application systématique de ces métriques sur des architectures établies comme OpenVLA, Octo ou RoboVLMs, et potentiellement leur intégration comme signal de régularisation pendant l'entraînement. Le papier arrive au moment où Figure AI, 1X Technologies et Agility Robotics intensifient leurs déploiements en environnements industriels réels, rendant la robustesse hors-distribution critique pour la crédibilité commerciale du secteur.

UECes outils de diagnostic pourraient aider les intégrateurs industriels européens à évaluer la robustesse hors-distribution des modèles VLA avant déploiement, et à terme nourrir des critères de certification conformes à l'AI Act.

IA physiquePaper
1 source
AffordanceVLA : un modèle VLA qui améliore la génération d'actions grâce à la compréhension des affordances
4arXiv cs.RO 

AffordanceVLA : un modèle VLA qui améliore la génération d'actions grâce à la compréhension des affordances

Des chercheurs ont publié le 6 juin 2026 sur arXiv (réf. 2606.06155) un nouveau framework baptisé AffordanceVLA, conçu pour améliorer la manipulation robotique pilotée par des modèles vision-langage-action (VLA). Le coeur du système repose sur l'introduction de l'affordance comme représentation intermédiaire structurée entre la compréhension sémantique et la génération de commandes motrices. Concrètement, trois modules complémentaires décomposent la tâche : Which2Act identifie l'objet pertinent via une prédiction dans l'espace latent visuel pour filtrer les distracteurs ; Where2Act localise en 2D le point d'interaction via une carte d'affordance estimée ; How2Act raisonne en 3D sur la géométrie de la scène pour guider la politique de manipulation. Ces modules sont intégrés dans une architecture Mixture-of-Transformer (MoT) avec des experts spécialisés, entraînée selon un curriculum progressif en trois étapes. Pour pallier le manque de labels d'affordance denses dans les jeux de données robotiques existants, les auteurs ont développé un pipeline automatisé d'augmentation de données. Les résultats sont validés sur bancs de simulation et en conditions réelles, sans que les métriques quantitatives précises soient encore publiées à ce stade de preprint. Le problème que cible AffordanceVLA est bien documenté dans la communauté VLA : les modèles vision-langage préentraînés encodent une sémantique riche mais abstraite, structurellement incompatible avec les espaces de contrôle moteur continu. Combler ce fossé directement, sans représentation intermédiaire, produit des politiques fragiles face aux variations de scène. L'approche par affordance offre une solution élégante car elle reste géométriquement ancrée tout en restant conditionnée sémantiquement, ce qui facilite la généralisation sim-to-real. Pour les intégrateurs qui déploient des bras manipulateurs en environnement non structuré, ce type de robustesse perceptuelle est un critère clé souvent sacrifié dans les démos labo. Le paysage des VLA pour la manipulation est désormais très concurrentiel : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA issu de Stanford et Berkeley, ou encore RT-2 de Google DeepMind incarnent différentes approches du même défi. AffordanceVLA se distingue en positionnant explicitement l'affordance comme pont structurel, une direction également explorée par des travaux comme RoboAfford ou UniPI. Ce preprint reste une contribution de recherche, pas un produit commercialisé ; aucun déploiement industriel ni partenariat n'est annoncé. Les prochaines étapes naturelles seront une évaluation sur benchmarks standardisés comme LIBERO ou RLBench, et une confrontation aux modèles de référence avec métriques comparatives publiées.

IA physiqueOpinion
1 source