Aller au contenu principal
IA physiquearXiv cs.RO 

Motus2 : un modèle du monde général auto-évolutif pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv fin août 2026 (arXiv:2608.30237) présente Motus2, un modèle du monde pour la manipulation dextre. Plutôt que d'ajouter une simple tête d'action à un simulateur, il repose sur un seul réseau à poids partagés exposant trois interfaces : une politique qui propose des séquences d'actions, un simulateur qui en prédit les conséquences visuelles, et un évaluateur qui juge ces prédictions, le tout formant une boucle fermée de décision et d'apprentissage. L'entraînement combine démonstrations expertes triées et interactions ratées, réutilisées comme signal pour la dynamique et la valeur. Les données montent en échelle, de vidéos égocentriques monoculaires vers des données stéréo puis des trajectoires robotiques réelles, avec retour tactile et instanciation sur une plateforme biomimétique à deux bras et deux mains dextres. Aucun chiffre de charge utile, de temps de cycle ou de taux de réussite n'est fourni.

L'enjeu est de dépasser un défaut classique des modèles du monde robotiques, la déconnexion entre prédiction et apprentissage utile. En unifiant politique, simulateur et évaluateur, Motus2 vise une boucle d'auto-amélioration où le robot apprend aussi de ses échecs, non plus seulement de démonstrations humaines coûteuses à collecter à grande échelle, un frein connu pour les modèles vision-langage-action comme Pi-0 ou GR00T N2. Si l'approche se confirme au-delà du papier, elle réduirait la dépendance à la téléopération massive. L'absence de métriques chiffrées dans le résumé invite toutefois à la prudence, il s'agit d'une proposition architecturale, non d'un résultat comparé publiquement à l'état de l'art.

Ce travail s'inscrit dans la vague des modèles du monde appliqués à la robotique généraliste, où les laboratoires opposent depuis 2025 approches génératives pures et architectures hybrides combinant simulation et politique. Motus2 se distingue par le partage total des poids entre ses trois fonctions et l'usage explicite des échecs comme signal d'apprentissage. Le choix d'une plateforme bimanuelle à mains dextres et retour tactile vise la manipulation fine plutôt que la seule locomotion humanoïde. L'article ne précise ni laboratoire d'origine ni calendrier de déploiement pilote, à ce stade Motus2 reste un jalon de recherche en préprint, dont la validation empirique reste à documenter.

À lire aussi

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique
1arXiv cs.RO 

Tau-zéro WM : un modèle du monde vidéo-action unifié pour la manipulation robotique

Des chercheurs ont déposé le 1er juin 2026 sur arXiv (réf. 2606.01027) τ₀-WM (tau-zéro World Model), une architecture unifiée vidéo-action pour la manipulation robotique. Le modèle repose sur un backbone de diffusion vidéo partagé qui intègre simultanément apprentissage de politique, prédiction vidéo et évaluation d'actions au sein d'un même cadre prédictif. Il expose deux interfaces complémentaires : un modèle d'action vidéo qui prédit conjointement des représentations visuelles latentes futures et des séquences d'actions continues à partir d'observations multi-caméras, d'instructions en langage naturel et de l'état courant du robot ; et un simulateur vidéo conditionné sur l'action, capable de dérouler des séquences candidates en projections multi-vues tout en attribuant des scores denses de progression de tâche. L'entraînement porte sur environ 27 300 heures de données combinant téléopération réelle, interactions de style UMI (Universal Manipulation Interface, protocole de collecte de données en bimanuel développé par Stanford), vidéos égocentrées humaines, et trajectoires de succès comme d'échecs. L'intérêt principal réside dans la convergence entre politique et modèle de monde au sein d'une architecture commune. Les VLA (Vision-Language-Action models) actuels génèrent des actions sans anticiper leurs conséquences, laissant la gestion des erreurs à des modules séparés. τ₀-WM introduit un mécanisme de rectification à l'inférence : le simulateur évalue chaque séquence candidate via un score dense de progression, et les candidats jugés insuffisants sont corrigés par re-débruitage. Ce test-time scaling structuré pourrait réduire les interventions humaines sur des tâches longue durée, un enjeu clé pour les intégrateurs industriels qui peinent encore à déployer des robots autonomes sur des séquences de plus de quelques étapes. Sur les benchmarks de manipulation fine et longue séquence, les auteurs déclarent surpasser les baselines comparables, sans préciser les conditions expérimentales ni les contraintes matérielles testées. Ce travail s'inscrit dans une course engagée depuis fin 2024 entre Physical Intelligence (pi-0), NVIDIA (GR00T N2) et Figure (Helix) pour des architectures VLA à grande échelle, mais rares sont celles qui intègrent simulation interne et évaluation d'action dans un seul modèle plutôt que dans un pipeline découplé. L'usage de données UMI signale une stratégie d'agrégation multi-source qui dépasse les corpus propriétaires et pourrait favoriser la généralisation à de nouveaux environnements. Le papier reste pour l'instant un preprint non soumis à revue par les pairs : les performances annoncées restent à valider sur robot physique en conditions réelles, et aucune date de déploiement ou partenariat industriel n'est mentionné.

IA physiqueOpinion
1 source
Fine-tuning des modèles VLA par contrôle génératif auto-démontré pour la manipulation multitâche
2arXiv cs.RO 

Fine-tuning des modèles VLA par contrôle génératif auto-démontré pour la manipulation multitâche

Un article publié sur arXiv fin août 2026 (référence 2608.19490) présente une méthode de finetuning pour les modèles vision-langage-action (VLA), ces politiques robotiques qui combinent perception, langage et contrôle moteur. Le constat de départ : des modèles VLA de pointe comme π0.5, entraînés sur de larges corpus multi-robots, voient leurs performances chuter dès qu'ils sont déployés sur un nouveau robot dont la configuration matérielle diffère de celle de l'entraînement. Le finetuning classique sur des données expertes du nouveau robot corrige la tâche ciblée mais efface la capacité du modèle à suivre des instructions génériques, un oubli catastrophique. Les auteurs proposent que le VLA zero-shot génère lui-même, en ligne, des trajectoires d'interaction supplémentaires pour enrichir ses données de finetuning, sans démonstration humaine additionnelle. La méthode est validée sur un robot bimanuel ALOHA réel et un nouveau benchmark de simulation baptisé RoboTwin, avec des vidéos publiées sur self-supervised-control.pages.dev. Le travail cible un vrai goulot d'étranglement pour l'industrialisation des VLA : spécialiser un modèle fondation sur un robot précis sans sacrifier la polyvalence qui justifie son usage. Pour les intégrateurs, c'est le compromis qui freine aujourd'hui le déploiement de politiques comme π0, GR00T N2 ou Helix sur des lignes hétérogènes, où chaque nouvelle géométrie de bras impose de re-collecter des démonstrations coûteuses, au risque d'effacer les acquis génériques du modèle de base. Si l'approche tient au-delà d'ALOHA et RoboTwin, elle réduirait le coût marginal d'ajout d'un robot ou d'une compétence, en s'appuyant sur les rollouts du modèle plutôt que sur davantage de téléopération humaine. La démarche s'inscrit dans la lignée des VLA ouverte par RT-2 puis consolidée par π0 et π0.5 de Physical Intelligence, OpenVLA, GR00T N2 de NVIDIA ou Helix de Figure AI, tous conçus pour généraliser au-delà d'un seul robot. Le choix d'ALOHA, plateforme bimanuelle open source popularisée par Stanford, ancre l'évaluation dans un cadre reproductible plutôt que dans une démonstration propriétaire, et RoboTwin vise à combler l'absence de benchmark standard pour la généralisation multi-tâches. Aucun partenaire industriel ni calendrier de transfert vers un robot commercial n'est évoqué : il s'agit pour l'instant d'une preuve de concept académique, publiée en preprint et non encore relue par les pairs.

IA physiqueOpinion
1 source
PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique
3Pandaily 

PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique

PHANES AI, start-up fondée par Yang Shuo, professeur à l'Institut de technologie de Harbin (campus de Shenzhen), a publié un nouveau modèle de fondation tactile baptisé TouchWorld, conçu pour la manipulation dextre en robotique. L'objectif est de combler une faille des modèles vision-langage-action (VLA) actuels: ceux-ci peuvent voir qu'un doigt robotique touche un bouton, mais ne peuvent pas savoir s'il a réellement été enfoncé. TouchWorld attribue au toucher un double rôle. En mode prédictif, avant d'exécuter une action, le modèle anticipe non seulement l'image visuelle attendue en fin de sous-tâche, mais aussi une carte tactile précisant quel doigt devrait ressentir une pression, à quel endroit et avec quelle intensité, une référence physique que la vision seule ne peut fournir. En mode réactif, une fois le contact établi, le modèle lit en continu les signaux tactiles et l'état des articulations pour appliquer des micro-corrections de position, de force de préhension et d'angle du poignet, sans nécessiter une replanification par la politique de haut niveau. Sur six tâches réelles (arrosage de plantes, nettoyage de table, insertion de prise, insertion de tasse, récurage de poêle, prise de mouchoir), TouchWorld atteint 65,0% de réussite en conditions normales et 57,2% en présence de perturbations comme le déplacement de la cible ou une interférence de préhension, soit 15,7 et 16,0 points de plus que la meilleure référence testée. Chaque tâche a été entraînée sur 200 trajectoires de téléopération et évaluée sur 100 essais robotiques réels. Cette approche répond à un problème concret pour l'industrie: les modèles VLA actuels échouent souvent en silence lorsqu'un contact physique ne se passe pas comme prévu, un angle mort critique pour des applications comme l'assemblage de précision ou la manipulation d'objets fragiles. En traitant le signal tactile comme un flux séparé plutôt que comme une modalité fondue dans le pipeline visuel, PHANES AI défend l'idée que la densité d'information et la vitesse de traitement du toucher sont trop différentes de celles de la vision pour partager une même architecture sans que le signal tactile ne soit noyé. Si les résultats se confirment à plus grande échelle, ce découplage pourrait devenir un standard pour les robots humanoïdes ou les bras industriels appelés à manipuler des objets déformables ou mal positionnés, un domaine où la démonstration en laboratoire peine souvent à se traduire en fiabilité réelle. Yang Shuo, né en 1998, est déjà professeur titulaire et directeur de thèse à HIT Shenzhen, l'un des plus jeunes professeurs titulaires de Chine. Lauréat de la bourse doctorale Google (un des neuf récipiendaires mondiaux) et finaliste du prix du meilleur article à ICLR, il est rentré en Chine à 26 ans pour fonder PHANES AI, qui réunit désormais une équipe couvrant les données, la modélisation, le contrôle robotique et le matériel. L'entreprise s'inscrit dans une compétition mondiale sur les modèles de fondation pour la manipulation dextre, aux côtés d'acteurs comme les équipes derrière Pi-0 ou GR00T N2, avec pour différenciation affichée le traitement natif du signal tactile plutôt qu'un simple ajout de capteurs.

IA physiqueActu
1 source
MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique
4arXiv cs.RO 

MuseVLA : un modèle VLA multimodal adaptatif pour la manipulation robotique

Des chercheurs présentent ce mois-ci MuseVLA (arXiv:2606.17598, juin 2026), un modèle Vision-Language-Action capable d'intégrer des capteurs non-RGB comme entrées de perception active lors de tâches de manipulation robotique. Sur un robot à main dextre testée en conditions réelles, MuseVLA atteint un taux de succès moyen de 80,6 % sur trois familles de tâches : saisie guidée par la température, recherche d'objet par signal audio, et récupération d'objet dissimulé assistée par radar. L'architecture repose sur un mécanisme en deux temps : le modèle génère d'abord un "sensor token" qui sélectionne dynamiquement la modalité sensorielle pertinente pour la tâche en cours, puis convertit la mesure capteur en une "grounded sensor image", une représentation intermédiaire unifiée fusionnée avec le flux RGB classique avant la génération d'action. Les auteurs introduisent également un pipeline de synthèse de données qui augmente des datasets RGB existants avec des images capteur simulées, contournant ainsi le coût prohibitif de la collecte de données multisensorielles réelles. L'apport principal est architectural plutôt que purement empirique : le découplage entre le traitement capteur spécifique et le backbone VLA permet d'intégrer de nouveaux capteurs sans réentraîner le modèle de base, un principe analogue aux "tool calls" dans les LLM. Cette modularité répond à une limite structurelle des VLA actuels, dont Pi-0 (Physical Intelligence), OpenVLA ou GR00T N2 (NVIDIA), qui opèrent quasi exclusivement sur RGB. La capacité de zéro-shot sur des tâches non vues lors de l'entraînement est notable, même si les conditions expérimentales restent celles d'un laboratoire, sans déploiement industriel rapporté. Les métriques de cycle time ou de robustesse en environnement non contrôlé ne sont pas fournies, ce qui limite l'interprétation du 80,6 % en contexte réel. Le papier s'inscrit dans une effervescence autour des VLA généralistes depuis mi-2024, avec des acteurs comme Physical Intelligence, 1X Technologies, Enchanted Tools côté européen, et les équipes de Google DeepMind ou Carnegie Mellon qui multiplient les approches de fusion multimodale. MuseVLA reste pour l'instant un preprint sans code ni dataset publié, et la question de la généralisation à des capteurs industriels standards (LiDAR, force/torque) n'est pas traitée. Les prochaines étapes naturelles seraient un benchmark comparatif sur des plateformes connues type Franka ou UR, et une validation hors labo pour confirmer la thèse du sim-to-real sur les données capteur synthétiques.

UELes acteurs européens comme Enchanted Tools opèrent dans le même segment VLA généraliste, mais ce preprint n'implique aucune institution ou entreprise française ou européenne.

IA physiqueOpinion
1 source