Aller au contenu principal
Nanyang Technological University, Peking University et BAAI dévoilent Omega-0, un modèle d'action corps entier qui réussit 81,8 % des tâches domestiques réelles
IA physiquePandaily 

Nanyang Technological University, Peking University et BAAI dévoilent Omega-0, un modèle d'action corps entier qui réussit 81,8 % des tâches domestiques réelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de l'Université technologique de Nanyang (NTU), de l'Université de Pékin, de HKUST Guangzhou et du Beijing Academy of Artificial Intelligence (BAAI) ont publié Omega-0, un modèle d'action corps entier pour robots humanoïdes. Sur 11 tâches domestiques réelles, il atteint 81,8% de réussite, devançant pi-0.5, EgoVLA, GR00T-N1.7 et psi-0. Plutôt que de prédire les pixels futurs, Omega-0 prédit des caractéristiques visuelles latentes, à partir desquelles un transformeur de diffusion génère les actions du corps entier. L'entraînement suit trois étapes: un modèle vision-langage-action pré-entraîné via un tokenizer "Whole-Body FAST" qui affine Qwen3-VL-2B-Instruct avec des tokens de point de vue première et troisième personne, un pré-entraînement latent humain-robot inspiré de V-JEPA fusionnant vision, langage et proprioception, puis un affinage sur données domestiques réelles avec chunking temps réel pour la continuité des gestes. L'équipe a bâti pour cela Omega-HOME: 40,3 heures de données réelles, 4827 trajectoires téléopérées et 24 types de tâches, dont la prise d'objets, le nettoyage de surfaces et l'usage d'appareils électroménagers.

Le résultat pèse moins que la méthodologie: pour éviter toute contamination, l'équipe a retiré les 11 tâches d'évaluation du jeu de pré-entraînement Omega-HOME, un souci de rigueur rare dans un secteur où les vidéos de démonstration sont souvent sélectionnées après coup. Pour les intégrateurs et décideurs industriels, Omega-0 illustre une approche qui couple prédiction de l'environnement futur et génération d'action corps entier dans un seul modèle, plutôt que de traiter perception, navigation et manipulation comme des sous-systèmes séparés. Le domicile reste la cible la plus difficile pour un humanoïde: il exige une perception continue combinée à une coordination motrice globale, contrairement à l'usine où tâches et environnement sont contrôlés. Un score de 81,8% sur tâches réelles, non simulées, réduit l'écart entre démonstration scénarisée et exécution robuste, sans le combler: les auteurs reconnaissent eux-mêmes que l'autonomie longue durée, l'interaction sécurisée et la généralisation à de nouvelles tâches restent non résolues.

Le nom minimaliste du modèle suggère qu'Omega-0 est le premier d'une série, dans la lignée des modèles vision-langage-action qui structurent la recherche humanoïde depuis pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI. Omega-0 se mesure directement à ces références ainsi qu'à EgoVLA et psi-0, avec un protocole pensé pour limiter les biais de benchmark répandus dans le secteur. Aucun calendrier de commercialisation, de partenariat industriel ou de déploiement pilote n'est communiqué à ce stade: il s'agit d'une publication de recherche académique, pas d'un produit livré ni d'un déploiement réel à grande échelle. Les suites attendues portent vraisemblablement sur l'extension du jeu de données Omega-HOME au-delà de la sphère domestique et sur la validation de l'architecture latente sur d'autres plateformes robotiques, alors que la course humanoïde oppose désormais un nombre croissant de laboratoires universitaires chinois aux groupes commerciaux occidentaux.

À lire aussi

MIT dévoile un modèle qui réduit les délais de réaction de 30 fois pour des mouvements robotiques plus rapides
1Interesting Engineering 

MIT dévoile un modèle qui réduit les délais de réaction de 30 fois pour des mouvements robotiques plus rapides

Des chercheurs du MIT ont développé une nouvelle méthode baptisée VLASH, qui permet aux robots pilotés par des modèles vision-langage-action (VLA) de planifier leur prochaine séquence de mouvements pendant qu'ils exécutent encore la précédente, en anticipant leur position future plutôt qu'en attendant la fin du geste en cours pour ré-observer l'environnement. Cette seule modification réduit le délai de réaction de plus de 30 fois en supprimant la pause habituelle entre deux blocs d'actions. Une technique complémentaire, la quantification d'action, regroupe des mouvements suivant une même trajectoire en blocs plus larges ; elle réduit légèrement la précision mais accélère l'exécution des tâches de deux à trois fois. L'équipe a aussi conçu une méthode d'augmentation des données d'entraînement qui réorganise les données existantes pour diviser par cinq le temps d'entraînement, sans surcoût de calcul. En simulation, VLASH produit systématiquement des mouvements plus rapides sans perte de précision de manœuvre. Sur robots physiques, les gains se confirment sur des tâches de prise-dépose, d'empilement et de tri : dans une démonstration, un robot triant des cubes colorés a été deux fois plus rapide que les systèmes de référence, avec 90% de précision, un score équivalent à la meilleure méthode conventionnelle testée. Le système gère aussi des activités très dynamiques comme le tennis de table ou le Whack-a-Mole. Cette avancée cible un goulot d'étranglement connu du déploiement des VLA, de plus en plus utilisés comme "cerveau" des robots pour interpréter leur environnement et générer des actions physiques : le coût de calcul de l'inférence introduit des délais qui rendent les robots lents et saccadés face aux changements de leur environnement, un frein concret pour les intégrateurs visant des environnements dynamiques. Doubler la vitesse d'exécution sans matériel supplémentaire ni entraînement plus long change la donne économique. C'est un signal utile pour la course actuelle aux VLA généralistes (Pi-0, GR00T N2, Helix, ou les modèles embarqués dans des humanoïdes comme Figure 03 ou Optimus) : la latence d'inférence reste un frein réel à la fluidité mise en avant dans les vidéos de démonstration, et des optimisations logicielles comme celle-ci pourraient compter autant que la taille des modèles. Les chercheurs évoquent aussi des applications en recherche et sauvetage, où la réactivité aux changements est critique. Le travail s'inscrit dans les recherches du MIT sur l'intégration des VLA en robotique physique, un domaine où les grands laboratoires (Physical Intelligence, NVIDIA, Figure AI, Tesla) misent surtout sur des modèles plus lourds pour gérer perception et planification. VLASH prend l'angle inverse : restructurer le cycle observation-planification-exécution plutôt que changer le modèle. Aucun acteur français ou européen n'est cité dans ces travaux, qui restent à ce stade un résultat académique validé en simulation et sur quelques démonstrations en laboratoire, sans partenariat industriel ni calendrier commercial annoncés. La prochaine étape pour l'équipe consiste à combiner VLASH avec des modèles de monde génératifs capables de prédire l'évolution de l'environnement, et non plus seulement l'état futur du robot.

IA physiqueActu
1 source
Qwen-VLA : un modèle vision-langage-action (VLA) unifié pour les tâches, environnements et morphologies de robots
2arXiv cs.RO 

Qwen-VLA : un modèle vision-langage-action (VLA) unifié pour les tâches, environnements et morphologies de robots

Qwen-VLA, présenté en préprint arXiv par l'équipe Qwen d'Alibaba (arXiv:2605.30280, mai 2026), est un modèle de fondation incarné qui unifie dans un seul système la manipulation robotique, la navigation vision-et-langage et la prédiction de trajectoires. L'architecture étend la pile vision-langage de Qwen par un décodeur d'action basé sur un Diffusion Transformer (DiT), permettant de générer des actions continues en plus du raisonnement perceptif. L'entraînement joint combine trajectoires de manipulation réelles, démonstrations égocentrées humaines, données de simulation synthétique et jeux de données de navigation. Sur les benchmarks publiés, Qwen-VLA-Instruct atteint 97,9 % sur LIBERO, 86,1 %/87,2 % sur RoboTwin-Easy/Hard, 73,7 % sur Simpler-WidowX, et 69,0 % de taux de succès d'objectif sur R2R en navigation. En conditions réelles sur plateforme ALOHA, le modèle affiche 76,9 % de succès moyen hors-distribution (OOD) et 26,6 % en zéro-shot sur DOMINO, une tâche de manipulation dynamique. La contribution principale est le "embodiment-aware prompt conditioning" : des descriptions textuelles propres à chaque robot spécifient morphologie et conventions de contrôle, permettant théoriquement à un seul jeu de poids de s'adapter à plusieurs plateformes sans réentraînement dédié. Pour les intégrateurs et les COO industriels, c'est directement le problème du cross-embodiment qui freine les déploiements à l'échelle. Les scores OOD sont pertinents mais méritent d'être nuancés : ils portent sur des environnements de laboratoire, et les 76,9 % sur ALOHA concernent une plateforme à deux bras en contexte contrôlé, pas un robot industriel en conditions de production. La sélection des séquences de démonstration dans les preprints arXiv est notoirement favorable aux cas réussis. Qwen-VLA s'inscrit dans la course aux VLA généralistes, aux côtés de pi-0 de Physical Intelligence (spécialisé manipulation, 400 M$ levés), GR00T N2 de NVIDIA (cross-embodiment annoncé en 2025) et OpenVLA d'UC Berkeley. Son décodeur DiT le rapproche des approches diffusion-based de pi-0, par opposition aux méthodes token-based. Qwen étant déjà un modèle ouvert d'Alibaba largement adopté dans des stacks vision-langage, son extension à l'action physique offre aux équipes de recherche et d'intégration un point d'entrée solide pour le fine-tuning multi-tâche multi-robot. Aucun déploiement commercial n'est annoncé à ce stade : c'est un travail de recherche, pas un produit lancé.

UELes équipes de recherche et d'intégration robotique européennes peuvent exploiter ce modèle ouvert Alibaba pour du fine-tuning multi-robot multi-tâche, mais aucun partenariat ni déploiement européen n'est annoncé.

IA physiqueOpinion
1 source
La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles
3Interesting Engineering 

La recherche NVIDIA montre que des robots entraînés en simulation peuvent accomplir des tâches réelles

NVIDIA a présenté huit travaux de recherche en robotique à l'International Conference on Robotics and Automation (ICRA) 2026, tous centrés sur la réduction du "sim-to-real gap" -- l'écart de performance entre un robot entraîné en simulation et ce même robot confronté au monde physique. Parmi les systèmes mis en avant, COMPASS entraîne des robots exclusivement dans Isaac Lab (le simulateur NVIDIA) avant de transférer les politiques apprises vers des corps physiques différents. Sur 20 essais réels impliquant des robots mobiles autonomes et des humanoïdes, le framework atteint un taux de succès de 80 % en navigation, soit 4,5 fois supérieur aux baselines par imitation learning. Le système Grasp-MPC, dédié à la préhension en environnement encombré, a été entraîné sur 2 millions de trajectoires simulées couvrant 8 000 objets distincts, et atteint 75 % de succès sur des objets inconnus contre 41 % pour les méthodes de référence. Le framework SPARR, appliqué à l'assemblage industriel, découpe la tâche en deux couches -- une politique apprise en sim, corrigée en temps réel sur le hardware réel -- et affiche 38 % de gain sur le taux de succès d'assemblage et 30 % de réduction du temps de cycle par rapport aux baselines zero-shot sim-to-real. Enfin, PEEK améliore l'attention visuelle des robots (filtrage du bruit visuel non pertinent), avec une précision multipliée jusqu'à 41 fois pour des politiques purement simulées. Une collaboration avec Carnegie Mellon, l'Université de l'Utah et l'Université de Sydney a produit SEAL, un framework qui contraint le robot à n'exécuter que les séquences d'actions cohérentes avec son raisonnement planifié. Ces résultats sont significatifs pour les intégrateurs et les décideurs industriels, car ils montrent que le sim-to-real gap -- longtemps considéré comme le verrou structurel de la robotique apprise -- commence à se refermer de façon mesurable, au moins en conditions de laboratoire. Le gain de 30 % sur le temps de cycle (SPARR) est un chiffre qui parle directement aux opérateurs de lignes d'assemblage. Il convient cependant de nuancer : les taux de succès rapportés (75-80 %) sont mesurés dans des protocoles contrôlés par les chercheurs eux-mêmes, sans déploiement industriel validé en production. Les vidéos sélectionnées pour illustrer ces travaux suivent les conventions habituelles des communications académiques, qui ne montrent pas les échecs. La progression reste réelle, mais le passage de 80 % à 99 % de fiabilité -- seuil requis pour la plupart des applications industrielles critiques -- reste un problème ouvert. NVIDIA positionne cette recherche comme la couche logicielle et de simulation de son écosystème robotique plus large, qui inclut Isaac Lab, Isaac GR00T X Embodiment Sim et Omniverse NuRec. La compagnie ne fabrique pas de robots mais ambitionne de devenir l'infrastructure sur laquelle l'industrie entraîne ses systèmes, face à des concurrents comme Google DeepMind (avec ses travaux sur RT-2 et Gemini Robotics), Meta (V-JEPA) et Physical Intelligence (pi0). Sur le segment de la simulation pour la robotique, des acteurs comme Mujoco (DeepMind) et Genesis (MIT/CMU) occupent également le terrain. Les prochaines étapes annoncées par NVIDIA passent par l'extension des datasets ouverts et la montée en échelle des plateformes de simulation, sans timeline de commercialisation précisée pour les frameworks présentés à l'ICRA.

UELes intégrateurs industriels européens en robotique d'assemblage pourraient à terme bénéficier des frameworks sim-to-real NVIDIA (Isaac Lab, SPARR), mais aucun déploiement ni partenariat européen n'est annoncé à ce stade.

💬 Le 30% de gain sur le temps de cycle, c'est le seul chiffre qui va faire bouger un décideur industriel. NVIDIA ne fabrique pas de robots mais joue exactement le même coup qu'avec les GPU : devenir l'infrastructure incontournable avant que le marché soit mature, face à DeepMind, Meta et les autres. Reste que passer de 80% à 99% de fiabilité, le vrai seuil pour les lignes critiques, c'est encore une autre histoire.

IA physiquePaper
1 source
VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)
4arXiv cs.RO 

VLA-REPLICA : un benchmark reproductible et économique pour l'évaluation réelle des modèles vision-langage-action (VLA)

Une équipe de recherche vient de publier VLA-REPLICA (arXiv:2605.20774, mai 2026), un banc d'évaluation réel, bas coût et reproductible, conçu pour tester les modèles de type Vision-Language-Action (VLA) sur des tâches de manipulation robotique. L'architecture repose entièrement sur des composants disponibles dans le commerce, ce qui permet à n'importe quel laboratoire d'assembler le setup en quelques jours et de reproduire les mêmes conditions expérimentales. Le benchmark intègre une suite de tâches de manipulation variées, un dataset de démonstrations de petite taille pour l'adaptation au domaine cible, ainsi que des protocoles d'évaluation distincts pour des scénarios en distribution et hors distribution. Les expériences menées couvrent l'apprentissage par imitation classique et plusieurs modèles VLA de l'état de l'art, avec des résultats cohérents obtenus sur des setups construits indépendamment dans différents sites. L'enjeu derrière VLA-REPLICA est directement lié à un problème structurel du secteur : l'évaluation réelle des modèles VLA reste fragmentée, coûteuse, et difficile à comparer d'un labo à l'autre. Les benchmarks en simulation ne capturent pas la complexité du monde physique, tandis que les benchmarks réels existants exigent souvent du matériel spécialisé onéreux ou une évaluation centralisée. Ce benchmark vise à combler ce fossé en fournissant une infrastructure standardisée et décentralisée, ce qui est une condition nécessaire pour que la communauté puisse comparer honnêtement les modèles et identifier leurs limites réelles, notamment face au sim-to-real gap qui affecte encore la plupart des politiques de manipulation. Les modèles VLA ont connu une montée en puissance rapide ces deux dernières années, avec des systèmes comme pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou OpenVLA issu des travaux de Stanford et Berkeley. Malgré des performances impressionnantes en démo, leur déploiement industriel reste freiné par l'absence de protocoles d'évaluation partagés et comparables. VLA-REPLICA s'inscrit dans un mouvement plus large de standardisation des benchmarks robotiques, comparable à ce qu'ont représenté BOP ou NIST Task Board pour d'autres sous-domaines. La prochaine étape logique serait l'adoption de ce protocole par plusieurs équipes tier-1 pour valider la reproductibilité à grande échelle et créer une baseline commune sur laquelle ancrer les publications futures.

UELes laboratoires européens de robotique (CEA-List, INRIA, universités) peuvent adopter ce benchmark reproductible bas coût pour évaluer leurs modèles VLA sur une infrastructure standardisée, abaissant la barrière d'entrée aux comparaisons internationales sans dépendre de matériel onéreux ou de benchmarks centralisés.

💬 C'est le genre de truc qu'on attendait depuis deux ans, même si ça fait moins de bruit qu'un nouveau modèle. Les benchmarks en simulation ne capturent pas le monde physique, et les vrais setups coûtaient trop cher pour être reproduits d'un labo à l'autre. Du matos grand public et des protocoles partagés, c'est la fondation qui manquait pour que les comparaisons aient enfin du sens.

IA physiquePaper
1 source