Aller au contenu principal
RecherchearXiv cs.RO 

Repenser le modèle monde-action pour la manipulation robotique compositionnelle et en contexte

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent ViGAR (Visual Goal-conditioned Action Reasoning), un cadre hiérarchique pour la manipulation robotique compositionnelle à long horizon, détaillé dans un preprint arXiv (2610.02368). Il sépare la tâche en deux modules. Un planificateur de sous-buts visuels prédit, à partir de l'observation courante et de l'instruction globale, une image du sous-but de la prochaine sous-tâche. Un exécuteur de sous-buts génère ensuite conjointement les trajectoires visuelles futures et les actions, conditionnées par ce sous-but. Les deux composants partagent la même représentation de world model pré-entraîné. Sur le benchmark simulé RoboTwin Clean2Random, ViGAR atteint 82,00 % de réussite en configuration Clean et 67,02 % en configuration Random. Cela représente 12,86 points de pourcentage de mieux que la meilleure référence, en moyenne. Les auteurs ajoutent des essais sur robot réel : cinq tâches compositionnelles et deux tâches d'apprentissage en contexte. Le résumé ne précise ni la plateforme matérielle, ni le nombre d'essais, ni les modèles de référence.

Ce travail s'attaque à une limite connue des world-action models (WAM), qui prédisent à la fois de courts futurs visuels et des actions, mais sans raisonnement explicite au niveau des sous-tâches. Pour un intégrateur, la plupart des tâches utiles, comme l'assemblage, le tri ou le conditionnement, enchaînent plusieurs gestes coordonnés, et c'est sur cet enchaînement que les politiques de bout en bout échouent le plus souvent. Introduire un sous-but visuel explicite rend le plan lisible et inspectable, ce qui compte pour le diagnostic en production. L'apprentissage en contexte va dans le même sens. Une image du but global fournie comme contexte suffit à induire des décompositions et des comportements différents, sans mise à jour des paramètres. Cela réduirait le coût de reconfiguration d'une cellule robotisée. Les résultats restent à relativiser : le score Random de 67 % montre qu'une perte de performance subsiste face à la variabilité de l'environnement, et les tests réels sont peu nombreux.

Ce travail s'inscrit dans la montée des politiques vision-langage-action (VLA) et des world models comme base de la manipulation généraliste. Il se place face à des approches qui produisent des actions seules, comme Pi-0, ou des modèles qui prédisent des futurs vidéo sans hiérarchie. Le benchmark RoboTwin, de manipulation bimanuelle avec randomisation de l'environnement, sert de plus en plus de test de robustesse. C'est un résultat académique, sans produit ni déploiement annoncé. Les prochaines étapes à surveiller sont la validation sur des horizons plus longs et des plateformes variées, la publication du code et des poids, et le coût de calcul d'une prédiction visuelle à chaque sous-tâche, que le résumé ne chiffre pas.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
1arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source
Modèles du monde pour la manipulation robotique
2arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source
Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone
3arXiv cs.RO 

Streaming-WAM : modèle monde-action conditionné par l'action pour la manipulation robotique asynchrone

Un modèle de recherche baptisé Streaming-WAM (World-Action Model), décrit dans un article publié sur arXiv le 25 septembre 2026 (arXiv:2609.28927v1), s'attaque au coût de calcul des modèles qui prédisent l'image future pour piloter un bras robotique. Ces modèles, dits world-action models, génèrent habituellement une prédiction visuelle avant de produire l'action suivante, ce qui immobilise le robot pendant l'inférence. Streaming-WAM fonctionne en mode asynchrone : à chaque mise à jour, il conditionne sa prédiction visuelle non seulement sur la dernière observation caméra, mais aussi sur les actions déjà engagées, c'est-à-dire le segment fixe du prochain lot de mouvements en cours d'exécution par le robot. Les caractéristiques visuelles ainsi anticipées servent ensuite à générer, dans la même passe, les actions restantes du lot. Sur le benchmark de simulation LIBERO, le système atteint un taux de succès moyen de 98,35 % tout en divisant par 2,93 le temps moyen par épisode par rapport à une variante appelée Fast-WAM. Sur une tâche en conditions réelles consistant à tamponner une feuille de papier, le temps d'épisode passe de 90 secondes avec un modèle synchrone classique (Joint-WAM) à 38 secondes avec Streaming-WAM. L'enjeu dépasse la simple accélération : les world-action models sont perçus comme un moyen de rendre la manipulation robotique plus robuste en anticipant les conséquences visuelles d'une action avant de l'exécuter, mais leur latence de génération les rendait jusqu'ici difficiles à déployer en temps réel. En montrant qu'il est possible de conserver un taux de succès élevé tout en réduisant fortement le temps de cycle grâce à l'asynchronie, ce travail répond directement à l'un des reproches récurrents faits aux architectures de prédiction du monde en robotique : leur écart entre performance en simulation et viabilité pratique. Pour les intégrateurs et laboratoires qui évaluent ces approches face aux politiques vision-langage-action plus légères, ce type de résultat suggère qu'il n'est plus nécessaire de sacrifier la vitesse pour garder les bénéfices de la prédiction visuelle. Le travail se positionne comme une amélioration incrémentale par rapport à deux approches de référence citées dans l'article, Fast-WAM et Joint-WAM, qui servent de points de comparaison directs plutôt que de produits commerciaux. Il s'agit à ce stade d'un résultat de recherche publié sur arXiv, validé sur un seul benchmark simulé et une unique tâche physique réalisée en laboratoire, sans indication de partenariat industriel, de déploiement en usine ni de calendrier de commercialisation. La prochaine étape logique, non détaillée dans l'article, consisterait à étendre l'évaluation à un éventail plus large de tâches manuelles réelles et à des plateformes robotiques variées.

RecherchePaper
1 source
DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique
4arXiv cs.RO 

DreamX-Phi 1.0 : modèle du monde vidéo conditionné par l'action pour la manipulation robotique

DreamX-Phi 1.0, un modèle de monde vidéo conditionné par l'action pour la manipulation robotique, est présenté dans un article déposé sur arXiv (2608.13489v1). À partir d'une image observée, d'une instruction en langage naturel et d'une séquence d'actions prescrite, poses de l'effecteur terminal et états du gripper, le système prédit les observations vidéo futures correspondantes. Pour éviter qu'une vidéo réaliste en apparence déplace le mauvais bras ou fasse disparaître l'objet manipulé, les auteurs injectent des transformations géométriques SE(3) propres à chaque bras dans les couches d'attention via un encodage de type PRoPE, complété par une branche de profondeur pour la géométrie de la scène et des masques SAM3 associés à un modèle enseignant V-JEPA figé pour maintenir la cohérence des objets durant la saisie. Le générateur multi-étapes est ensuite distillé en un modèle étudiant à peu d'étapes pour accélérer le déploiement. Le modèle revendique la première place sur la Track 1 et la deuxième sur la Track 2 du WorldArena 2.0 Challenge, avec publication annoncée du modèle et du code. Cette approche s'attaque à un problème central des modèles de monde appliqués à la robotique: une vidéo générée peut paraître photoréaliste tout en étant physiquement incohérente avec les commandes envoyées au robot, ce qui invalide son usage pour l'entraînement de politiques ou la planification. En ancrant la génération vidéo sur la géométrie rigide réelle de chaque bras et en préservant l'identité des objets manipulés, DreamX-Phi cherche à combler l'écart entre démonstration visuelle convaincante et fidélité exploitable pour le contrôle. La distillation en modèle étudiant à peu d'étapes répond à une contrainte pratique bien connue des intégrateurs: les modèles de monde vidéo multi-étapes sont souvent trop lents pour une boucle de contrôle temps réel, ce qui limite sinon leur usage à la simulation ou à l'évaluation hors ligne. Le classement sur WorldArena 2.0 reste toutefois un résultat de benchmark académique et non une validation en conditions réelles sur un robot physique. DreamX-Phi s'inscrit dans une vague plus large de modèles de monde vidéo pour la robotique, qui cherchent à compléter ou remplacer les architectures vision-langage-action comme Pi-0 ou GR00T N2 par une simulation générative directe des conséquences d'une action. Le recours à SAM3 pour la segmentation et à V-JEPA comme enseignant figé situe le projet dans la lignée des modèles de représentation vidéo auto-supervisés récents plutôt que dans une pile propriétaire fermée. À ce stade, aucune information ne mentionne de déploiement sur un robot physique ni de partenariat industriel: il s'agit d'un article de recherche accompagné d'un résultat de compétition, le modèle et le code étant seulement annoncés comme à venir. La suite logique, si cette promesse de publication est tenue, sera l'adoption du modèle comme brique de simulation ou d'évaluation par d'autres équipes travaillant sur la manipulation robotique.

RecherchePaper
1 source