Aller au contenu principal
Wh0 : des modèles du monde génératifs comme source extensible de données égocentrées de manipulation manuelle
IA physiquearXiv cs.RO 

Wh0 : des modèles du monde génératifs comme source extensible de données égocentrées de manipulation manuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UEPourquoi ça compte

Des chercheurs ont publié Wh0, un cadre exploitant des modèles vidéo génératifs pour produire en masse des données d'entraînement égocentrées de mains humaines manipulant des objets. Conditionné sur du langage, des objets et des scènes, le système génère WM-H, un dataset de 50 000 épisodes de vidéos d'interaction humain-objet, puis convertit ces séquences en supervision exploitable par un robot via reconstruction du mouvement de la main et édition visuelle. Co-entraîné avec un volume limité de données robotiques réelles, Wh0 adapte des modèles VLA (Vision-Language-Action) pré-entraînés à la manipulation dextre. Évalué sur 18 tâches réelles de manipulation fine, le système porte le taux de succès zéro-shot sur des tâches inédites de 8,3 % à 38,9 % par rapport à un modèle entraîné uniquement sur données robotiques.

Ce résultat pointe vers un constat croissant dans le secteur : la téléopération reste coûteuse et difficile à passer à l'échelle, tandis que la simulation classique (IsaacSim, MuJoCo) bute sur le sim-to-real gap. Wh0 propose une troisième voie en ancrant la génération dans des vidéos égocentrées réalistes, puis en résolvant le mismatch d'embodiment par édition visuelle. Pour un intégrateur ou un décideur industriel, la valeur est double : réduire le coût de collecte de données et couvrir une diversité d'objets et de scènes difficile à atteindre en lab. Le résultat zéro-shot ne préjuge pas du déploiement industriel à grande échelle, mais les ablations internes confirment que l'alignement scène/embodiment est le levier dominant de performance, devant le simple volume de génération.

La manipulation dextre est l'un des fronts les plus disputés de la robotique physique en 2026, face à des acteurs comme Physical Intelligence (Pi-0), Figure (Helix) et NVIDIA (GR00T N2) qui mobilisent d'importants budgets de téléopération pour atteindre la généralisation. Des approches basées sur des vidéos Internet existantes comme HOI4D avaient montré la richesse du signal égocentré humain, mais l'écart entre la main humaine et l'effecteur robot restait un obstacle non résolu. Wh0 publie son code et ses données en open source, ce qui pourrait bénéficier à des équipes européennes travaillant sur la préhension fine, comme Enchanted Tools ou Pollen Robotics. La prochaine étape logique serait l'extension à des architectures bi-manuelles ou à des mains multi-doigts, non couvertes par les 18 tâches de l'évaluation actuelle.

Impact France/UE

L'open-source de Wh0 et du dataset WM-H (50 000 épisodes) réduit la barrière d'entrée pour des équipes européennes travaillant sur la manipulation dextre, notamment Enchanted Tools et Pollen Robotics.

💬 Le point de vue du dev

La téléopération coûte cher, la simulation bute sur le sim-to-real gap, tout le monde le sait. Wh0 prend une troisième voie : générer en masse des vidéos égocentrées réalistes de mains humaines, puis aligner l'embodiment par édition visuelle, et ça fait passer le taux de succès zéro-shot de 8 % à presque 40 % sur des tâches inédites. C'est open source, donc des équipes comme Enchanted Tools ou Pollen Robotics ont maintenant un dataset sérieux sans y mettre le budget de Physical Intelligence.

À lire aussi

ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle
1arXiv cs.RO 

ModPack : une interface de téléopération extensible pour la manipulation mobile bimanuelle

Une équipe de recherche a présenté ModPack, un système de téléopération modulaire conçu pour piloter des robots à manipulation bimanuelle mobile, indépendamment de leur plateforme matérielle. Le cœur du dispositif est un "sac à dos" portable autonome intégrant calcul embarqué, alimentation, communication et stockage de données. Autour de cette interface commune, le système propose des modules interchangeables en plug-and-play : téléopération articulation par articulation avec retour haptique, manipulation mobile, et perception active. Les chercheurs ont testé ModPack sur deux plateformes robotiques distinctes lors de tâches réelles de manipulation mobile, démontrant sa capacité à servir de socle réutilisable pour la collecte de données et l'apprentissage de politiques de contrôle. L'ensemble du design matériel et de la pile logicielle est publié en open source, accompagné d'un site de projet dédié. Cette approche répond à une limite structurelle bien identifiée dans la robotique humanoïde et la manipulation mobile : la plupart des systèmes de téléopération actuels sont conçus sur mesure pour un robot et une tâche donnés, ce qui oblige les laboratoires et les entreprises à reconstruire leurs outils de collecte de données à chaque nouveau matériel. Pour les acteurs qui développent des modèles vision-langage-action (VLA) comme Pi-0, GR00T N2 ou Helix, la disponibilité de données de démonstration humaine de qualité, capturées efficacement sur des embodiments variés, est un goulot d'étranglement central pour l'apprentissage par imitation. Un outil modulaire et open source comme ModPack pourrait réduire le coût d'ingénierie nécessaire pour générer ces jeux de données, un enjeu direct pour les intégrateurs et les équipes de recherche qui cherchent à faire monter en échelle leurs pipelines de collecte plutôt qu'à réinventer le matériel de téléopération à chaque projet. Le développement de ModPack s'inscrit dans la tendance plus large de la robotique d'apprentissage, où la qualité et le volume des données de téléopération conditionnent directement les performances des politiques apprises, à l'image des efforts menés autour de plateformes comme Figure 03 ou Optimus Gen 3. En ouvrant l'intégralité du design matériel et du code, les auteurs positionnent ModPack comme une infrastructure communautaire plutôt qu'un produit commercial fermé, une démarche qui rappelle d'autres initiatives open source du secteur visant à standardiser les outils de collecte pour accélérer la recherche académique. L'article, publié sur arXiv, ne précise pas encore de feuille de route pour une adoption industrielle à plus grande échelle ni de partenariats annoncés, ce qui en fait pour l'instant une contribution de recherche plutôt qu'un déploiement commercial.

IA physiqueActu
1 source
Motus2 : un modèle du monde général auto-évolutif pour la manipulation dextérique
2arXiv cs.RO 

Motus2 : un modèle du monde général auto-évolutif pour la manipulation dextérique

Un article déposé sur arXiv fin août 2026 (arXiv:2608.30237) présente Motus2, un modèle du monde pour la manipulation dextre. Plutôt que d'ajouter une simple tête d'action à un simulateur, il repose sur un seul réseau à poids partagés exposant trois interfaces : une politique qui propose des séquences d'actions, un simulateur qui en prédit les conséquences visuelles, et un évaluateur qui juge ces prédictions, le tout formant une boucle fermée de décision et d'apprentissage. L'entraînement combine démonstrations expertes triées et interactions ratées, réutilisées comme signal pour la dynamique et la valeur. Les données montent en échelle, de vidéos égocentriques monoculaires vers des données stéréo puis des trajectoires robotiques réelles, avec retour tactile et instanciation sur une plateforme biomimétique à deux bras et deux mains dextres. Aucun chiffre de charge utile, de temps de cycle ou de taux de réussite n'est fourni. L'enjeu est de dépasser un défaut classique des modèles du monde robotiques, la déconnexion entre prédiction et apprentissage utile. En unifiant politique, simulateur et évaluateur, Motus2 vise une boucle d'auto-amélioration où le robot apprend aussi de ses échecs, non plus seulement de démonstrations humaines coûteuses à collecter à grande échelle, un frein connu pour les modèles vision-langage-action comme Pi-0 ou GR00T N2. Si l'approche se confirme au-delà du papier, elle réduirait la dépendance à la téléopération massive. L'absence de métriques chiffrées dans le résumé invite toutefois à la prudence, il s'agit d'une proposition architecturale, non d'un résultat comparé publiquement à l'état de l'art. Ce travail s'inscrit dans la vague des modèles du monde appliqués à la robotique généraliste, où les laboratoires opposent depuis 2025 approches génératives pures et architectures hybrides combinant simulation et politique. Motus2 se distingue par le partage total des poids entre ses trois fonctions et l'usage explicite des échecs comme signal d'apprentissage. Le choix d'une plateforme bimanuelle à mains dextres et retour tactile vise la manipulation fine plutôt que la seule locomotion humanoïde. L'article ne précise ni laboratoire d'origine ni calendrier de déploiement pilote, à ce stade Motus2 reste un jalon de recherche en préprint, dont la validation empirique reste à documenter.

IA physiquePaper
1 source
Fine-tuning des modèles VLA par contrôle génératif auto-démontré pour la manipulation multitâche
3arXiv cs.RO 

Fine-tuning des modèles VLA par contrôle génératif auto-démontré pour la manipulation multitâche

Un article publié sur arXiv fin août 2026 (référence 2608.19490) présente une méthode de finetuning pour les modèles vision-langage-action (VLA), ces politiques robotiques qui combinent perception, langage et contrôle moteur. Le constat de départ : des modèles VLA de pointe comme π0.5, entraînés sur de larges corpus multi-robots, voient leurs performances chuter dès qu'ils sont déployés sur un nouveau robot dont la configuration matérielle diffère de celle de l'entraînement. Le finetuning classique sur des données expertes du nouveau robot corrige la tâche ciblée mais efface la capacité du modèle à suivre des instructions génériques, un oubli catastrophique. Les auteurs proposent que le VLA zero-shot génère lui-même, en ligne, des trajectoires d'interaction supplémentaires pour enrichir ses données de finetuning, sans démonstration humaine additionnelle. La méthode est validée sur un robot bimanuel ALOHA réel et un nouveau benchmark de simulation baptisé RoboTwin, avec des vidéos publiées sur self-supervised-control.pages.dev. Le travail cible un vrai goulot d'étranglement pour l'industrialisation des VLA : spécialiser un modèle fondation sur un robot précis sans sacrifier la polyvalence qui justifie son usage. Pour les intégrateurs, c'est le compromis qui freine aujourd'hui le déploiement de politiques comme π0, GR00T N2 ou Helix sur des lignes hétérogènes, où chaque nouvelle géométrie de bras impose de re-collecter des démonstrations coûteuses, au risque d'effacer les acquis génériques du modèle de base. Si l'approche tient au-delà d'ALOHA et RoboTwin, elle réduirait le coût marginal d'ajout d'un robot ou d'une compétence, en s'appuyant sur les rollouts du modèle plutôt que sur davantage de téléopération humaine. La démarche s'inscrit dans la lignée des VLA ouverte par RT-2 puis consolidée par π0 et π0.5 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA ou Helix de Figure AI, tous conçus pour généraliser au-delà d'un seul robot. Le choix d'ALOHA, plateforme bimanuelle open source popularisée par Stanford, ancre l'évaluation dans un cadre reproductible plutôt que dans une démonstration propriétaire, et RoboTwin vise à combler l'absence de benchmark standard pour la généralisation multi-tâches. Aucun partenaire industriel ni calendrier de transfert vers un robot commercial n'est évoqué : il s'agit pour l'instant d'une preuve de concept académique, publiée en preprint et non encore relue par les pairs.

IA physiqueOpinion
1 source
Clé-Gram : des connaissances mondiales extensibles pour la manipulation par IA incarnée
4arXiv cs.RO 

Clé-Gram : des connaissances mondiales extensibles pour la manipulation par IA incarnée

Key-Gram (arXiv:2605.18556, mai 2026) est un preprint qui propose un cadre de mémoire conditionnelle séparant explicitement la connaissance linguistique du raisonnement visuel dans les politiques de manipulation robotique. Là où les architectures VLA (Vision-Language-Action) actuelles fusionnent langage et vision dans un backbone partagé, Key-Gram décompose une instruction en "key-grams" (unités sémantiques propres à la tâche), récupère des priors linguistiques via un lookup déterministe O(1) dans une table externe, puis injecte ces entrées dans des couches cachées sélectionnées via gating contextuel et fusion convolutive légère. Appliqué aux modèles π₀ et π₀.₅ de Physical Intelligence, le système enregistre des gains relatifs de 29,5 %/9,9 % sur le benchmark de simulation RoboTwin2.0, de 35,8 %/4,5 % sur LIBERO-Plus en transfert sans fine-tuning sur le domaine cible, et de 15,4 %/8,1 % sur des tâches longues en manipulation bimanuelle réelle. Ces résultats quantifient un problème structurel rarement isolé dans la littérature VLA : la compétition de modalités dans le backbone partagé, où raisonnement visuel et compréhension linguistique se disputent la capacité de calcul. Le gain de 35,8 % sur LIBERO-Plus sans réentraînement cible est la donnée la plus exploitable pour les intégrateurs industriels : il suggère qu'une mémoire externe améliore la généralisation entre tâches sans fine-tuning complet, réduisant directement le coût de déploiement sur des lignes de production variées. La table de mémoire, extensible sans mise à jour du backbone et chargeable en mémoire hôte à l'inférence, permet d'ajouter de nouveaux vocabulaires de tâches sans redéploiement de l'ensemble du modèle. Physical Intelligence (Pi), fondée en 2023 par d'anciens chercheurs de Google et de l'UC Berkeley, a développé π₀ en 2024 comme VLA généraliste pour la manipulation bimanuelle. Key-Gram s'appuie sur ce backbone sans le modifier, ce qui constitue son atout principal : la séparation de la composante linguistique est architecturalement propre et non-destructive. Sur ce créneau de la généralisation compositionnelle, Google DeepMind, Figure AI (architecture Helix) et 1X Technologies proposent des approches concurrentes à base de transformers multi-modaux. La principale limite du papier est l'absence de validation sur des backbones autres que π, ce qui laisse ouverte la question de la généricité de la méthode.

💬 35% de gain sur LIBERO-Plus sans réentraînement, c'est le chiffre à retenir. L'idée de sortir le vocabulaire de tâche dans une table externe (plutôt que de tout enfouir dans le backbone partagé), c'est architecturalement propre et ça permet d'ajouter de nouvelles tâches sans redéployer l'ensemble du modèle. Reste que pour l'instant ça n'a été validé que sur π₀, donc faut voir si ça tient sur d'autres architectures avant de crier victoire.

IA physiqueOpinion
1 source