$\omega$-0 : un modèle prédictif latent du monde pour la manipulation locomotrice humanoïde concurrente
Des chercheurs présentent ω-0, un modèle prédictif world-action conçu pour la loco-manipulation concurrente chez les robots humanoïdes, c'est-à-dire la capacité à se déplacer, ajuster sa posture, garder l'équilibre et manipuler un objet simultanément, comme un geste unique plutôt que deux tâches séparées. À partir d'une instruction en langage naturel, d'une observation visuelle et de l'état proprioceptif du robot, le modèle prédit directement des latents d'action pour tout le corps, compatibles avec le contrôleur. Plutôt que de reconstruire des vidéos futures comme d'autres approches, ω-0 apprend des embeddings compacts d'observations futures, objectif prédictif léger couplé à une génération d'action par diffusion sur le corps entier. Le système accepte des entrées RGB égocentriques, RGB exocentriques et profondeur exocentrique, et s'appuie sur un rejeu de simulation piloté par contrôleur pour convertir des priors de mouvement humains ou publics en latents exécutables par le robot. Les auteurs ont aussi constitué ω-HOME, un jeu de données domestique réel de plus de 40 heures, avec vues multiples synchronisées, mouvements SMPL du corps entier, états robot et latents d'action. Sur 11 tâches ménagères réelles, un seul modèle ω-0 produit des comportements fluides de manipulation en mouvement et surpasse des références en apprentissage par imitation, en VLA, en politiques humanoïdes dédiées et en autres modèles world-action.
Ce travail cible un angle mort du secteur: la plupart des politiques humanoïdes actuelles traitent marche et manipulation comme deux problèmes distincts, ce qui produit des comportements saccadés peu adaptés aux tâches domestiques, où un robot doit par exemple continuer d'avancer tout en attrapant un objet sur une étagère. Les modèles world-action existants restent soit centrés sur le bras, en ignorant la locomotion, soit centrés sur la vidéo, coûteux à entraîner car ils prédisent des images futures complètes. En apprenant des représentations latentes compactes plutôt que des vidéos, ω-0 cherche un compromis: garder la capacité d'anticipation d'un world model sans son coût de calcul. Si le résultat se confirme au-delà des 11 tâches testées, il renforcerait l'hypothèse qu'une architecture VLA à latents diffusés peut unifier locomotion et manipulation à l'échelle, un problème encore largement non résolu pour les humanoïdes commerciaux.
Ce travail s'inscrit dans la vague récente des modèles world-action pour la robotique, où l'enjeu est de donner aux robots une forme d'anticipation visuelle avant d'agir, en exploitant des données humaines pour compenser la rareté des données robot réelles. Le résumé, publié comme preprint arXiv (2608.06375v1), ne précise ni affiliation industrielle ni acteur commercial: il s'agit à ce stade d'une contribution académique, pas d'un produit déployé. Le jeu de données ω-HOME et le code, s'ils sont rendus publics, devront être repris par d'autres équipes pour vérifier la généralisation au-delà des 11 tâches ménagères testées. La suite logique pour ce type de travaux est le passage à l'échelle, sur davantage de tâches, de plateformes et d'environnements, ainsi que la confrontation directe avec les VLA propriétaires déployés par les grands acteurs humanoïdes du secteur.
Dans nos dossiers




