Aller au contenu principal
RecherchearXiv cs.RO 

Rapport technique UniWAM : manipulation mobile unifiée par modélisation monde-action à flux mixtes et supervision par pose d'ancrage de manipulation

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

UniWAM, un rapport technique publié sur arXiv, propose un modèle monde-action unifié (« world-action model ») qui traite à la fois la navigation et la manipulation d'un robot mobile. Son architecture à flux mixtes dispose d'encodeurs d'actions et de têtes de sortie distincts pour chaque tâche, mais d'un backbone partagé. Cela permet d'entraîner conjointement le modèle sur des données de navigation et de manipulation échantillonnées indépendamment. Chaque flux peut être inféré seul, ou les deux en parallèle par batch. Les auteurs introduisent aussi la supervision MAP (Manipulation Anchor Pose), qui indique où s'arrêter et comment s'orienter avant de saisir un objet. Un pipeline automatisé génère le jeu MAP-Data à partir de scènes 3D à grande échelle : plus de 1,5 million d'épisodes, soit 7 500 heures. Il fournit, image par image, les boîtes englobantes de l'objet cible et les coordonnées MAP dans le plan image. Sur le banc d'essai MAP-Bench des auteurs, UniWAM réduit l'erreur de position de 30,1 % et l'erreur de cap de 44,0 % par rapport aux meilleures références externes. Sur 24 tâches réelles, il obtient les meilleurs résultats en navigation MAP et en manipulation mobile, avec une manipulation pure seulement « compétitive ». Code, données et benchmark sont publiés.

Le point important pour les intégrateurs est que le goulot d'étranglement de la manipulation mobile se situe souvent à la jonction entre les deux phases. Un bras habile ne sert à rien si la base s'arrête mal positionnée ou mal orientée. En formulant explicitement cette pose d'arrêt comme cible apprenable, UniWAM s'attaque à un mode de défaillance fréquent des politiques VLA (vision-langage-action) de bout en bout. Le recours à des scènes 3D synthétiques pour produire une supervision que la collecte réelle ne fournit pas à coût raisonnable illustre aussi un déplacement du problème, de la téléopération vers la génération de données. Les réserves sont claires. Les gains chiffrés portent sur un benchmark conçu par les mêmes auteurs. Les 24 tâches réelles ne sont décrites ni par leur nombre d'essais ni par la plateforme robotique dans le résumé. Enfin, le fait que la manipulation seule ne soit que « compétitive » montre que l'unification n'est pas gratuite. Rien n'indique de déploiement industriel : il s'agit d'un résultat de recherche.

Ce travail s'inscrit dans la tendance des modèles fondation robotiques, où des systèmes comme Pi-0, GR00T ou Helix traitent surtout la manipulation, tandis que la navigation reste un module séparé. Les approches monde-action, qui prédisent l'évolution de la scène en plus des actions, gagnent du terrain pour exploiter des données non robotiques. Les prochaines étapes à surveiller sont la validation par des tiers sur MAP-Bench, des tests sur d'autres morphologies, et l'intégration de MAP-Data dans les pipelines d'entraînement ouverts, puisque le jeu est public.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique
1arXiv cs.RO 

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique

Des chercheurs proposent UVTA, un cadre qui exploite des démonstrations humaines enregistrées avec retour tactile pour améliorer les politiques de manipulation dextre des robots. L'équipe a d'abord construit un système de capture de mouvement tactile, qui enregistre de façon synchrone les images, les signaux tactiles et les mouvements de la main. Avec cet outil, elle a constitué le jeu de données UVTA, qui couvre cinq tâches riches en contacts. Il comprend 1 000 démonstrations humaines et 150 démonstrations robot par tâche. Le modèle associé, un Unified Visual-Tactile-Action Model, projette l'humain et le robot dans des représentations tactiles et d'action alignées. Il prédit conjointement les trajectoires futures d'action et de toucher. Les démonstrations humaines supervisent ainsi l'apprentissage de représentations sensibles au contact, et seules les actions du robot sont exécutées au déploiement. Lors d'évaluations sur robot réel, sur les cinq tâches, la méthode atteint 70 % de réussite moyenne. La meilleure base de comparaison visuo-tactile plafonne à 29 %, et une ablation d'architecture à 42 %. L'enjeu tient au goulot d'étranglement des données tactiles. La téléopération de mains dextres ne renvoie à l'opérateur qu'un retour tactile limité, ce qui rend les démonstrations robot riches en toucher difficiles à collecter à grande échelle. Les auteurs contournent le problème avec l'hypothèse que la main change mais que la physique de l'interaction reste la même. Les données humaines deviennent alors une source de supervision plus abondante et plus variée. Les performances progressent avec le nombre de démonstrations humaines et ne saturent pas à 1 000 par tâche. Cela suggère qu'une montée en volume pourrait encore améliorer les résultats, sans que le papier le démontre au-delà. Pour les intégrateurs et les équipes qui développent des politiques de préhension fine, l'idée est de déplacer l'effort de collecte du robot vers l'humain, moins coûteux. Elle vise les tâches où la vision seule échoue, comme l'insertion, la manipulation en occlusion ou le contrôle de force. Il s'agit d'un travail académique, pas d'un produit, et il faut lire les chiffres avec prudence. Le score de 70 % porte sur seulement cinq tâches, avec 150 démonstrations robot par tâche, dans un cadre de laboratoire. Le résumé ne précise ni la main utilisée, ni les capteurs tactiles, ni le nombre d'essais, ni la nature exacte des tâches. L'écart avec les bases de comparaison (29 % et 42 %) est net, mais il dépend de choix de baselines que seul le texte complet permet d'apprécier. Le papier s'inscrit dans un courant de recherche qui cherche à apprendre la manipulation à partir de vidéos et de gants de capture humains, pour dépasser la téléopération. Il ajoute ici la modalité tactile, encore peu présente dans les grands modèles vision-langage-action (VLA). La version 2 de l'article sur arXiv et une page projet (uni-vta.github.io) sont disponibles. Aucun déploiement industriel ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes
2arXiv cs.RO 

DECOWAM : un modèle monde-action pour la manipulation mobile de robots à pattes

Des chercheurs présentent DECOWAM (Decoupled Whole-Body World-Action Model), un modèle monde-action conçu pour la manipulation mobile sur robots à pattes équipés d'un bras, décrit dans une prépublication arXiv (2608.20114v1) mise en ligne fin août 2026. Le système part d'un backbone FastWAM adapté et gelé, sur lequel sont entraînés uniquement des adaptateurs résiduels, soit 25,95 millions de paramètres entraînables. L'architecture ajoute un goulot d'étranglement futur équivalent-action distillé à partir d'observations privilégiées, des représentations latentes de la base et du bras séparées de manière adversariale, ainsi qu'un conditionnement par la vitesse de la base pour la prédiction vidéo. Les auteurs introduisent également ARMDOG, un nouveau jeu de données collecté sur robot réel qui synchronise vidéo, état corps entier, actions et instructions en langage naturel. Sur un protocole de rejeu fixe, DECOWAM réduit l'erreur quadratique moyenne de prédiction d'action de 21,7% par rapport à FastWAM. Sur 79 essais en boucle fermée par méthode, il obtient la meilleure coordination corps entier et la meilleure robustesse au déplacement de la base parmi les systèmes comparés, tandis que le taux de complétion des tâches reste comparable au meilleur système de référence, sans amélioration nette sur ce critère précis. L'apport principal tient à la séparation explicite du mouvement propre de la caméra (lié au déplacement de la base) des actions du bras, un problème que les modèles monde-action existants, conçus pour des plateformes à base fixe, ignorent largement. Pour les intégrateurs travaillant sur des robots mobiles à bras (quadrupèdes ou plateformes à roues), cela suggère qu'un modèle de prédiction vidéo pré-entraîné peut être adapté à moindre coût, via peu de paramètres, plutôt que réentraîné intégralement pour gérer un point de vue mobile. Le résultat reste toutefois nuancé: les gains portent sur la coordination et la robustesse mesurées en simulation de rejeu, pas sur un saut de performance en complétion de tâche réelle. Le travail se positionne comme une extension aux plateformes mobiles des modèles monde-action initialement développés pour bras fixes, sans nommer de backbone concurrent autre que FastWAM ni d'entreprise partenaire. Il s'agit d'une contribution académique publiée en prépublication, sans annonce de déploiement commercial ni de calendrier de mise en production; le jeu de données ARMDOG pourrait toutefois servir de futur benchmark pour la manipulation mobile corps entier.

RecherchePaper
1 source
TacSushi : modélisation monde-action ancrée dans le tactile pour la manipulation dextérique de sushis
3arXiv cs.RO 

TacSushi : modélisation monde-action ancrée dans le tactile pour la manipulation dextérique de sushis

Une équipe de recherche présente TacSushi, une politique robotique world-action ancrée dans le toucher, bâtie sur un modèle de monde Cosmos3, destinée à la manipulation dextre d'aliments déformables comme le sushi. Le système encode l'image RGB courante, une consigne en langage naturel et l'état de la main, puis fusionne par un mécanisme de gating feature-wise les signaux tactiles des bouts de doigts dans la représentation d'action ; pendant l'entraînement seulement, un décodeur conditionné par les segments d'action démontrés prédit les observations visuelles futures, la progression de la tâche et le risque de contact, avant d'être retiré au déploiement. Entraîné sur 340 essais réussis et 50 essais échoués sur robot réel, TacSushi a été testé sur 600 rollouts couvrant trois tâches en distribution et deux variantes d'ingrédients hors distribution, la qualité du plat final étant jugée par un protocole mêlant à parts égales cinq notations humaines et trois notations de modèles vision-langage. Résultat : 68,3% de réussite moyenne en distribution et 37,5% hors distribution, contre 36,7%/10,0% sans la supervision par conséquences futures et 25,0%/17,5% avec une simple concaténation tactile au lieu de la fusion gated. Ces chiffres valident surtout deux choix d'architecture plutôt qu'une performance spectaculaire : la fusion tactile gated par caractéristique apporte un gain net face à une concaténation brute, et la supervision prédictive, entraînée mais jamais exécutée en production, améliore la généralisation sans coût au déploiement. Pour les équipes de manipulation dextre et les intégrateurs, l'écart entre réussite en distribution et hors distribution illustre une nouvelle fois le fossé persistant entre démonstration contrôlée et généralisation réelle des politiques vision-langage-action, un problème que le secteur peine encore à résoudre malgré les annonces. Évaluer la qualité perçue de l'aliment via des juges humains et des modèles vision-langage, plutôt qu'un seuil géométrique binaire, répond aussi à une limite méthodologique connue des benchmarks de manipulation alimentaire, où texture et présentation comptent autant que le succès du geste. TacSushi s'inscrit dans la lignée des politiques robotiques bâties sur des backbones de modèles de monde ou vision-langage-action, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais cible un terrain nettement moins couvert, la manipulation d'aliments fragiles, plutôt que la préhension d'objets rigides. Publié en prépublication sur arXiv sans affiliation industrielle mentionnée, le travail reste une évaluation de laboratoire sur rollouts contrôlés, sans partenaire commercial ni calendrier de déploiement annoncés, et son jeu d'entraînement de 340 démonstrations réussies pour seulement 50 échecs demeure modeste au regard des efforts de VLA à grande échelle menés par les grands laboratoires. La suite logique, non précisée par les auteurs, consisterait à élargir les tâches culinaires et les variantes d'ingrédients testées pour vérifier si les gains observés hors distribution résistent à une variabilité alimentaire encore plus large.

RecherchePaper
1 source
DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
4arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source