Aller au contenu principal
RecherchearXiv cs.RO 

PointWAM : modélisation d'actions du monde en 3D pour la manipulation robotique dextre

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.02840) PointWAM, un « Point World Action Model » qui prédit conjointement l'évolution du monde et les actions d'un robot sous forme de trajectoires de points 3D. Le modèle décompose la scène en deux entités, l'environnement et les mains (l'acteur). Les deux sont prévus dans un même repère espace-temps. À partir d'un nuage de points coloré et d'une instruction en langage naturel, il anticipe comment la scène et les mains évoluent ensemble. Il retranspose ensuite le mouvement de main prévu en commandes robot. Les résultats sont ceux des auteurs, sur le benchmark DexJoCo et sur un robot réel. Le pré-entraînement sur des vidéos de démonstrations humaines améliore le taux de succès moyen sur DexJoCo de 56,9 points de pourcentage. Ajouter la supervision des trajectoires de la scène, et pas seulement celles des mains, apporte 10,9 points de plus. Avec les deux ingrédients, PointWAM dépasse de 11,7 points l'état de l'art précédent sur dix tâches DexJoCo et surpasse de « solides » VLA (modèles vision-langage-action) sur un robot physique. L'article ne précise pas dans cet extrait les modèles de référence, le robot ou le nombre d'essais.

L'enjeu est la manipulation dextre, où les approches courantes montrent leurs limites. Les world action models habituels représentent le monde en images RGB ou en espaces latents, et les actions en poses d'effecteur ou en angles articulaires. Ces représentations capturent mal la structure spatiale 3D et la géométrie des contacts, qui décident pourtant du succès d'une saisie ou d'une manipulation en main. Une représentation explicite en points 3D évite aussi de choisir à la main les objets ou points-clés propres à chaque tâche. Elle permet ainsi un pré-entraînement à grande échelle sur des vidéos humaines, une source de données bien moins coûteuse que la téléopération robotique. Le gain de 56,9 points suggère que le transfert humain vers robot dépend beaucoup du choix de représentation. Ces chiffres viennent d'un preprint non évalué par les pairs, sur un benchmark très probablement en grande partie simulé. Le résultat sur robot réel reste à qualifier, notamment sur la diversité des tâches et la robustesse hors laboratoire.

Ce travail s'inscrit dans la montée des world action models, qui fusionnent prédiction de dynamique et génération d'actions, en réaction aux VLA purement réactifs. Ces derniers, comme Pi-0 ou Helix, s'appuient sur des représentations 2D et des données robot coûteuses. PointWAM se place sur le créneau de l'apprentissage à partir de vidéos humaines et de la 3D explicite, face aux approches par images ou latents. La suite dépendra de la reproduction des résultats, d'une éventuelle publication du code et des poids, et de tests sur des mains robotiques multi-doigts variées. Aucune application industrielle ni calendrier de déploiement n'est annoncé à ce stade.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace
1arXiv cs.RO 

SkeleWAM : modélisation squelette du monde et de l'action pour une manipulation robotique efficace

Des chercheurs publient sur arXiv (2610.02120) SkeleWAM, un modèle « world action » (WAM) compact pour la manipulation robotique. Un WAM combine la génération d'actions du robot avec la prédiction d'états futurs. La plupart des WAM existants prédisent des vidéos ou des latents visuels appris. Le nouveau modèle représente plutôt la scène sous la forme d'un squelette 3D épars, composé des articulations du robot, des centres d'objets et de points d'interaction. Ce squelette est construit en ligne à partir des images RGB-D courantes et de la proprioception du robot. Il sert d'état géométrique unique pour générer les actions et prédire les squelettes futurs, ce qui apporte une supervision géométrique supplémentaire sans reconstruction visuelle. À l'inférence, le modèle produit les actions directement depuis le squelette courant et l'instruction en langage naturel. Une stratégie auxiliaire, Medoid Action Consensus (MAC), sélectionne parmi plusieurs échantillons d'actions stochastiques un consensus représentatif. Sur le benchmark LIBERO-Plus, SkeleWAM atteint 85,9 % de réussite globale avec 57,1 millions de paramètres, soit 3,7 points de plus que Cosmos-Policy. L'intérêt tient au compromis entre performance et taille. Les WAM fondés sur la vidéo ou sur des latents visuels portent des informations d'apparence sans rapport avec le contrôle et ne codent la géométrie d'interaction qu'implicitement. Avec 57,1 M de paramètres, SkeleWAM se situe très en dessous des modèles de fondation de type VLA, qui comptent en général plusieurs milliards de paramètres. Si l'approche tient hors benchmark, elle ouvre la voie à des politiques embarquables sur du calcul modeste, un point décisif pour les intégrateurs qui visent des cellules industrielles sans GPU lourd. Elle suggère aussi qu'un état structuré, centré sur les relations robot-objet, peut suffire à remplacer la prédiction de pixels. Des réserves s'imposent : LIBERO-Plus est un benchmark en simulation, qui évalue la robustesse à des perturbations, et l'écart de 3,7 points reste modeste. Aucun test sur robot réel n'est mentionné dans le résumé. Enfin, la construction du squelette suppose une perception RGB-D fiable, ce qui déplace une partie de la difficulté vers l'estimation des centres d'objets et des points d'interaction en conditions réelles. SkeleWAM s'inscrit dans la montée des world action models, qui cherchent à marier politique et modèle du monde, avec Cosmos-Policy comme référence directe de la comparaison. La tendance dominante a consisté à prédire des vidéos futures, coûteuses en calcul. Les travaux récents explorent des représentations plus sobres, géométriques ou latentes, pour réduire ce coût. Les auteurs publient une page de projet (skelewam-project.github.io). La suite logique serait une validation sur matériel réel, sur des tâches variées et dans des environnements encombrés, ainsi qu'une comparaison avec les grands VLA sur des benchmarks complémentaires. Il s'agit pour l'instant d'une préimpression, sans produit ni déploiement associé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)
3arXiv cs.RO 

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv, sous la référence 2609.22332, AffordanceWAM, un nouveau modèle conjoint de monde et d'action pour la manipulation robotique généraliste. Bâti sur un Transformer de diffusion vidéo pré-entraîné, il associe un module « World Expert » et un module « Action Expert » reliés par une attention conjointe masquée, pour prédire simultanément les images RGB futures de la scène, un champ d'affordance scalaire, une carte de chaleur des zones manipulables et la trajectoire d'action continue du robot, sous un objectif d'entraînement unique de type flow-matching. Les vidéos humaines filmées à la première personne supervisent ces trois flux visuels, tandis que les démonstrations robotiques ajoutent la supervision d'action, sans retargeting ni étiquetage manuel des gestes humains, avant validation sur les bancs d'essai RoboCasa et CALVIN (protocole ABC vers D) et sur des tâches de manipulation réelles. Le problème visé est la pénurie de données d'entraînement pour les politiques vision-langage-action : les vidéos robot avec actions étiquetées restent coûteuses et peu diversifiées, tandis que les vidéos humaines égocentriques, abondantes, manquent d'actions robotiques exploitables et diffèrent en morphologie. AffordanceWAM affiche des gains constants face à des références limitées au RGB seul ou aux seules données robot, et surtout une amélioration monotone sur RoboCasa à mesure que le volume de vidéos humaines annotées en affordance augmente, à supervision robot constante. Pour les équipes entraînant des modèles VLA à grande échelle, ce résultat trace une voie pour réduire la dépendance à la téléopération coûteuse en exploitant des corpus vidéo humains déjà disponibles en masse. Le travail s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où prédiction vidéo et génération d'action sont fusionnées dans une architecture unique plutôt que traitées séparément, une direction également suivie par plusieurs laboratoires industriels développant des modèles vision-langage-action. Il s'agit à ce stade d'une prépublication non encore validée par relecture par les pairs, testée sur des bancs d'essai académiques et un nombre restreint de scénarios réels, et non d'un produit ou d'un déploiement commercial. Le papier ne précise ni la taille exacte des corpus vidéo humains, ni de calendrier de publication du code ou des poids du modèle, laissant la reproductibilité comme prochaine étape à vérifier.

RechercheActu
1 source
MVG-WAM : modélisation monde-action intégrant la géométrie multi-vues pour la manipulation robotique
4arXiv cs.RO 

MVG-WAM : modélisation monde-action intégrant la géométrie multi-vues pour la manipulation robotique

Des chercheurs publient MVG-WAM (Multi-View Geometry-Aware World-Action Model), un modèle monde-action pour la manipulation robotique, décrit dans le preprint arXiv 2609.37793. Il repose sur un modèle vidéo pré-entraîné qui prédit à la fois la dynamique visuelle et les actions. Le modèle atteint 99,1 % de réussite moyenne sur LIBERO et 92,07 % sur RoboTwin 2.0. En conditions réelles, il obtient 91,3 % de succès sur 150 essais répartis sur trois tâches, avec la plateforme bimanuelle Cobot Magic. Le résumé ne détaille ni les tâches, ni le nombre d'essais par tâche, ni la comparaison avec des modèles concurrents. Il ne s'agit ni d'un produit ni d'un déploiement, mais d'un résultat de recherche. Les World-Action Models (WAM) exploitent les connaissances visuelles des modèles vidéo pour piloter des bras robotiques. Leur point faible est l'interface multi-caméras. Les images synchronisées sont en général juxtaposées en mosaïque, ou leurs tokens sont concaténés. Les relations géométriques entre caméras restent donc implicites, ce qui complique le lien entre le contexte global de la scène et la géométrie locale nécessaire au contact. MVG-WAM traite les vues comme des projections d'un même monde physique. Il combine un état global contraint par la géométrie épipolaire avec des états géométriques propres à chaque vue. Un routage sensible aux caméras fournit à chaque région vidéo son contexte géométrique et l'état global partagé. Le modèle est aussi ancré à l'échelle métrique par une supervision de profondeur future à plusieurs horizons, sans décodage de profondeur pendant l'exécution des actions. Le coût d'inférence n'augmente donc pas. Ces résultats situent MVG-WAM dans la course aux politiques généralistes issues de modèles vidéo, face aux VLA (vision-langage-action) comme Pi-0 ou GR00T. Il faut relativiser les scores. LIBERO est quasi saturé, avec des performances proches de 99 % pour plusieurs méthodes, et il discrimine donc peu. RoboTwin 2.0 est un benchmark de simulation bimanuelle plus exigeant. Le test réel de 150 essais reste modeste, sur un seul robot, et sans détail sur les conditions ni les échecs. L'écart entre benchmark et terrain n'est donc pas mesuré. Pour les intégrateurs, l'intérêt est ailleurs. Les configurations multi-caméras sont la norme en atelier, et une représentation qui exploite explicitement la calibration pourrait améliorer la précision sans capteurs supplémentaires. Reste à savoir si le gain se confirme sur des scènes non vues et des cadences industrielles. Ce travail prolonge la vague des modèles monde-action, qui greffent la prédiction vidéo sur le contrôle robotique, en parallèle des VLA fondés sur des modèles vision-langage. Ces deux approches se disputent la position de fondation pour la manipulation. Le preprint n'annonce ni code, ni calendrier, ni pilote industriel, et n'a pas été relu par des pairs. La suite logique serait une évaluation sur d'autres plateformes, des tâches plus longues et des comparaisons directes avec les VLA et WAM de référence.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source