Aller au contenu principal
RecherchearXiv cs.RO 

$\omega$-0 : un modèle prédictif latent du monde pour la manipulation locomotrice humanoïde concurrente

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent ω-0, un modèle prédictif world-action conçu pour la loco-manipulation concurrente chez les robots humanoïdes, c'est-à-dire la capacité à se déplacer, ajuster sa posture, garder l'équilibre et manipuler un objet simultanément, comme un geste unique plutôt que deux tâches séparées. À partir d'une instruction en langage naturel, d'une observation visuelle et de l'état proprioceptif du robot, le modèle prédit directement des latents d'action pour tout le corps, compatibles avec le contrôleur. Plutôt que de reconstruire des vidéos futures comme d'autres approches, ω-0 apprend des embeddings compacts d'observations futures, objectif prédictif léger couplé à une génération d'action par diffusion sur le corps entier. Le système accepte des entrées RGB égocentriques, RGB exocentriques et profondeur exocentrique, et s'appuie sur un rejeu de simulation piloté par contrôleur pour convertir des priors de mouvement humains ou publics en latents exécutables par le robot. Les auteurs ont aussi constitué ω-HOME, un jeu de données domestique réel de plus de 40 heures, avec vues multiples synchronisées, mouvements SMPL du corps entier, états robot et latents d'action. Sur 11 tâches ménagères réelles, un seul modèle ω-0 produit des comportements fluides de manipulation en mouvement et surpasse des références en apprentissage par imitation, en VLA, en politiques humanoïdes dédiées et en autres modèles world-action.

Ce travail cible un angle mort du secteur: la plupart des politiques humanoïdes actuelles traitent marche et manipulation comme deux problèmes distincts, ce qui produit des comportements saccadés peu adaptés aux tâches domestiques, où un robot doit par exemple continuer d'avancer tout en attrapant un objet sur une étagère. Les modèles world-action existants restent soit centrés sur le bras, en ignorant la locomotion, soit centrés sur la vidéo, coûteux à entraîner car ils prédisent des images futures complètes. En apprenant des représentations latentes compactes plutôt que des vidéos, ω-0 cherche un compromis: garder la capacité d'anticipation d'un world model sans son coût de calcul. Si le résultat se confirme au-delà des 11 tâches testées, il renforcerait l'hypothèse qu'une architecture VLA à latents diffusés peut unifier locomotion et manipulation à l'échelle, un problème encore largement non résolu pour les humanoïdes commerciaux.

Ce travail s'inscrit dans la vague récente des modèles world-action pour la robotique, où l'enjeu est de donner aux robots une forme d'anticipation visuelle avant d'agir, en exploitant des données humaines pour compenser la rareté des données robot réelles. Le résumé, publié comme preprint arXiv (2608.06375v1), ne précise ni affiliation industrielle ni acteur commercial: il s'agit à ce stade d'une contribution académique, pas d'un produit déployé. Le jeu de données ω-HOME et le code, s'ils sont rendus publics, devront être repris par d'autres équipes pour vérifier la généralisation au-delà des 11 tâches ménagères testées. La suite logique pour ce type de travaux est le passage à l'échelle, sur davantage de tâches, de plateformes et d'environnements, ainsi que la confrontation directe avec les VLA propriétaires déployés par les grands acteurs humanoïdes du secteur.

Dans nos dossiers

À lire aussi

PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique
1arXiv cs.RO 

PAIWorld : un modèle fondation du monde en 3D cohérent pour la manipulation robotique

Des chercheurs ont soumis PAIWorld sur arXiv (2506.18375, juin 2026), un framework de modèle fondationnel de monde (world foundation model, WFM) conçu pour la manipulation robotique avec cohérence 3D multi-vues. L'architecture, construite sur un transformateur de diffusion (DiT), intègre trois composants : des blocs d'attention croisée géométriquement informés (Geometry-Aware Cross-View Attention), un encodage positionnel rotatif qui intègre directions de rayons caméra et poses extrinsèques (Geometric RoPE), et un module Latent 3D-REPA qui distille des représentations 3D à partir de modèles 3D figés. Sur les benchmarks publics, PAIWorld se classe premier sur le leaderboard WorldArena et deuxième sur l'AgiBot-Challenge2026, deux références communautaires pour les simulateurs de manipulation. Le problème que PAIWorld adresse est concret : les robots de manipulation utilisent typiquement plusieurs caméras simultanées (vue égocentrique, eye-to-hand, poignet), mais les modèles de monde existants se contentent de concaténer les tokens de chaque vue sans raisonnement géométrique, générant dérive d'objet entre vues, incohérence de profondeur et désalignement de texture. Ces artefacts dégradent l'entraînement de politiques dans les simulateurs et amplifient le sim-to-real gap, problème central pour tout industriel cherchant à transférer des comportements entraînés en simulation vers des robots physiques. En établissant un canal explicite de communication inter-vues combiné à un prior géométrique 3D, PAIWorld vise à améliorer la fidélité des simulateurs utilisés pour le post-entraînement de politiques multi-vues et la planification basée sur des modèles (model-based planning). Les world foundation models appliqués à la robotique constituent un axe de recherche en forte croissance en 2026, porté notamment par des travaux comme UniSim et Genie 2, ainsi que par les approches VLA (Vision-Language-Action) qui cherchent à intégrer simulation et apprentissage de politiques. L'AgiBot-Challenge2026, structuré autour de tâches de manipulation dextère, joue un rôle de référence communautaire croissant pour ces systèmes. Il s'agit d'une prépublication scientifique sans partenariat commercial ni déploiement industriel annoncé : les suites logiques restent l'évaluation sur des benchmarks de transfert sim-to-real avec des plateformes physiques et l'intégration dans des world action models complets.

RecherchePaper
1 source
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
2arXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée. L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées. L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source
TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense
3arXiv cs.RO 

TacForeSight : un modèle du monde tactile guidé par la force pour la manipulation en contact dense

Des chercheurs ont publié sur arXiv (référence 2606.11184) TacForeSight, un framework léger d'anticipation tactile guidée par la force pour la manipulation en contact riche. Le système repose sur deux composants : TacForceWM, un modèle du monde tactile qui prédit les dynamiques latentes tactiles à court horizon à partir de capteurs bi-doigts conditionnés par les signaux de force et de couple au poignet à haute fréquence, et une politique conditionnée par l'anticipation tactile (Predictive Tactile-Conditioned Policy) qui exploite ces prédictions comme priors de contact, modélise l'évolution tactile courante-vers-future via cross-attention, et fusionne les features visuo-tactiles via un module de gating adaptatif. Les expériences portent sur cinq tâches représentatives de manipulation sur robot réel et trois scénarios de perturbation en cours de manipulation, avec des résultats supérieurs aux baselines existantes dans tous les cas, notamment sous perturbations de contact dynamiques. Le code et les datasets seront mis à disposition publiquement sur tacforesight.github.io. L'apport technique central est de modéliser explicitement les rôles asymétriques de la force globale au poignet (basse résolution spatiale, haute fréquence) et du toucher local bi-doigts (haute résolution spatiale, dynamique plus lente), distinction que la plupart des méthodes d'imitation learning actuelles ignorent. En opérant entièrement dans un espace latent compact, le framework permet un raisonnement de contact proactif compatible avec le contrôle haute fréquence, là où les approches réactives échouent sous perturbations imprévues. Pour les intégrateurs industriels et les équipes travaillant sur l'assemblage ou le conditionnement robotisé, c'est une démonstration concrète que la fusion force+tactile dans un world model améliore la robustesse réelle sans alourdir l'inférence en temps réel. Ce travail s'inscrit dans une vague de recherche combinant world models et retour tactile pour la manipulation dextre, aux côtés d'approches comme Pi-0 (Physical Intelligence) ou les travaux sur GR00T N2 de NVIDIA qui intègrent également des politiques tactile-aware. Aucun concurrent français ou européen direct n'est identifié sur ce créneau précis, bien que des acteurs comme Pollen Robotics ou Enchanted Tools s'appuient aussi sur la manipulation fine. Il s'agit ici d'un preprint non encore évalué par les pairs, sans déploiement industriel ni partenaire annoncé : les résultats, bien que prometteurs sur cinq tâches de laboratoire, devront être reproduits sur des géométries et conditions de contact plus variées avant de valider la généralisation à l'échelle industrielle.

UEImpact indirect : le code open-source prévu sur tacforesight.github.io pourrait être exploité par des équipes européennes travaillant sur la manipulation fine, comme Pollen Robotics ou les labos CEA-List, mais aucun acteur FR/EU n'est impliqué dans ce travail.

RecherchePaper
1 source
CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur
4arXiv cs.RO 

CReF : fusion croisée et récurrente pour la locomotion humanoïde conditionnée par la profondeur

Cette avancée en recherche fournit une méthode de bout en bout pour permettre à un robot humanoïde de marcher sur des terrains complexes en utilisant seulement une caméra de profondeur, sans passer par une carte 3D intermédiaire du terrain. Baptisée CReF (Cross-modal and Recurrent Fusion), l'approche fusionne directement les données de profondeur brutes captées à l'avant du robot avec les signaux de proprioception (l'état interne des articulations et du corps), via un mécanisme d'attention croisée piloté par la proprioception. Cette fusion passe ensuite par un bloc résiduel à porte, puis par une unité récurrente GRU dotée d'une porte de sortie de type "highway", qui pondère dynamiquement la contribution des informations récurrentes et instantanées selon le contexte. Les chercheurs ajoutent une récompense d'appui au sol qui identifie, à partir de nuages de points sous les pieds, les zones porteuses les plus proches et incite le robot à y poser le pied. Testée en simulation puis sur un humanoïde physique, la méthode montre un transfert zero-shot réussi vers des environnements réels variés : mains courantes, palettes ajourées, surfaces fortement réfléchissantes et terrains extérieurs encombrés visuellement. L'intérêt pour l'industrie tient à la simplification radicale du pipeline perception-vers-contrôle. Les méthodes précédentes s'appuyaient souvent sur des représentations de terrain 2.5D centrées sur le robot ou sur des objectifs géométriques auxiliaires pendant l'apprentissage, ce qui imposait des étapes de construction de carte ou des transferts de compétences en plusieurs stades. En évitant ces intermédiaires géométriques explicites, CReF réduit la latence et la complexité d'intégration, un enjeu direct pour les intégrateurs qui cherchent à déployer des humanoïdes en environnement logistique ou industriel réel plutôt qu'en démonstration contrôlée. Le succès du transfert zero-shot sur des surfaces réfléchissantes et des structures ajourées, deux cas connus pour perturber les capteurs de profondeur, est une preuve empirique concrète que l'apprentissage bout-en-bout depth-vers-contrôle peut tenir la route hors laboratoire, un point encore débattu dans le secteur. Ce travail s'inscrit dans la lignée des recherches sur la locomotion perceptive des humanoïdes, où la tension entre robustesse et simplicité d'architecture reste un problème ouvert, à côté des approches concurrentes utilisant des cartes d'élévation ou des skills pré-entraînés séparément. L'article, disponible sur arXiv, en est à sa troisième version révisée, signe d'itérations après retours de relecture. Les auteurs ne précisent pas de plateforme commerciale ni de partenaire industriel associé à ces travaux, qui relèvent pour l'instant de la recherche académique plutôt que d'un produit déployé ; la prochaine étape naturelle serait une validation sur davantage de plateformes humanoïdes et en conditions de production prolongées.

RecherchePaper
1 source