Aller au contenu principal
RecherchearXiv cs.RO 

ST-WAM : un modèle sémantique-temporel monde-action pour une manipulation robuste face aux changements de distribution visuelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Optimiser des robots pour de nouveaux environnements visuels reste un point faible connu des modèles VLA (vision-langage-action). Une équipe de recherche publie ST-WAM (Semantic-Temporal World Action Model), une architecture qui s'attaque au phénomène qu'elle nomme "Training-Distribution Hallucination" : lorsqu'un World Action Model reçoit une scène visuellement décalée par rapport à ses données d'entraînement, il a tendance à halluciner du contenu appris plutôt qu'à rester fidèle à ce qu'il observe réellement. Les chercheurs montrent, via une analyse de triplets d'images, que les features DINOv3 restent nettement plus stables face à ces variations visuelles que les latents Wan-VAE, tout en préservant mieux les distinctions d'état de la tâche. ST-WAM combine les deux : DINOv3 sert de représentation sémantique partagée pour la prédiction du futur et la récupération d'historique, tandis que le VAE conserve la dynamique fine. Deux composants portent l'architecture, les Dual-Space Future Experts (DSFE), qui prédisent conjointement latents VAE et features DINO, et le Current-Anchored Intent Retrieval (CAIR), qui récupère les indices pertinents dans l'historique DINO récent selon le contexte visuel-langage courant. Le modèle s'entraîne de bout en bout sans pré-entraînement embodied supplémentaire ni annotations spécifiques, et n'a pas besoin de générer explicitement le futur à l'inférence.

Les chiffres sont l'argument central : 98,7% sur LIBERO et 92,8% sur RoboTwin 2.0, mais surtout un gain de 21,3 points sur LIBERO-Plus en zero-shot par rapport à Fast-WAM, et un taux de succès en conditions réelles sous décalage visuel qui plus que double, passant de 25,8% à 61,5%. Pour l'industrie, c'est un signal important : la robustesse face aux changements d'éclairage, de fond ou d'agencement de scène reste l'un des principaux obstacles entre les démonstrations en laboratoire et le déploiement réel, et ce travail suggère que découpler la sémantique de la dynamique pixel par pixel est une piste concrète pour réduire cet écart. Un doublement du taux de succès en conditions de shift visuel réel est un résultat rare dans la littérature récente sur les VLA, où la plupart des gains annoncés restent cantonnés aux benchmarks simulés.

Les World Action Models s'inscrivent dans la lignée des approches type GR00T N2 ou Pi-0, qui cherchent à unifier prédiction du monde et génération d'action plutôt que de traiter la perception et le contrôle séparément. Le talon d'Achille identifié ici, la supervision par génération pixel pure qui mélange contenu utile à la tâche et contenu visuel non pertinent, est un problème structurel partagé par la plupart des WAM actuels, y compris Fast-WAM, utilisé comme référence de comparaison dans l'étude. En s'appuyant sur DINOv3, un encodeur de features déjà reconnu pour sa robustesse aux variations visuelles, les auteurs proposent une piste d'amélioration incrémentale plutôt qu'une rupture architecturale. Les prochaines étapes attendues pour ce type de travaux sont une validation sur des plateformes robotiques plus variées et une évaluation face à des shifts visuels encore plus prononcés que ceux testés dans LIBERO-Plus.

À lire aussi

Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact
1arXiv cs.RO 

Contrôle robuste aux distributions via l'inférence de Stein pour la manipulation au contact

Une équipe de chercheurs publie sur arXiv (référence 2605.19029) une méthode de contrôle robuste pour la manipulation robotique en contact riche, domaine couvrant la saisie, l'assemblage et l'insertion précise d'objets. Le travail formalise le problème comme une optimisation de contrôle robuste aux distributions (distributionally robust control), résolue via l'inférence variationnelle de Stein, une technique probabiliste déterministe issue du machine learning bayésien. Les contrôleurs qui en résultent modélisent explicitement l'incertitude paramétrique liée aux contacts, sans nécessiter les volumes massifs de données d'entraînement qu'exigent les approches data-driven modernes. Les résultats expérimentaux rapportés indiquent une robustesse améliorée jusqu'à un facteur 3 par rapport aux méthodes classiques à base de modèles, sur une gamme de tâches avec incertitude paramétrique large. Ce chiffre est à nuancer : il provient des propres benchmarks des auteurs, sans validation indépendante. La manipulation en contact riche reste l'un des goulots d'étranglement critiques pour le déploiement de robots industriels polyvalents. Les approches VLA (Vision-Language-Action models), comme pi-0 de Physical Intelligence, offrent une flexibilité remarquable mais se dégradent fortement lorsque les données d'entraînement sont rares, ce qui limite leur adoption dans des environnements industriels où les jeux de données sont difficiles à constituer. Les contrôleurs classiques à base de modèles, à l'inverse, sont computationnellement efficaces mais peinent à représenter l'incertitude task-sensitive, c'est-à-dire celle qui impacte réellement la performance sur une tâche précise. L'approche proposée tente de combler ce fossé en injectant une modélisation probabiliste flexible dans le cadre déterministe des contrôleurs classiques, un compromis potentiellement attractif pour les intégrateurs industriels cherchant fiabilité sans pipeline de données massif. Ce travail s'inscrit dans une tendance académique cherchant à réconcilier le model-based engineering (Boston Dynamics, ABB) et les learned policies (Physical Intelligence avec pi-0, Google DeepMind avec ses architectures GR00T-style). L'inférence variationnelle de Stein, popularisée par Liu et Wang en 2016, est ici adaptée au contrôle optimal, ce qui représente une contribution méthodologique notable. Le résumé disponible ne mentionne ni déploiements réels ni partenaires industriels, signalant clairement un stade de recherche fondamentale, probablement conduite en simulation ou sur bancs d'essai de laboratoire. Une validation sur des plateformes hardware standardisées comme les bras Franka Emika ou UR10, dont les propriétés de contact sont bien documentées, constituerait la prochaine étape logique avant toute perspective d'industrialisation.

RecherchePaper
1 source
MoMo : composer le mode de mouvement en manipulation robotique via une tokenisation spatio-temporelle de l'action
2arXiv cs.RO 

MoMo : composer le mode de mouvement en manipulation robotique via une tokenisation spatio-temporelle de l'action

Une équipe de recherche présente MoMo, un framework d'apprentissage par imitation en deux étapes qui permet de faire varier non plus seulement la précision d'un geste robotique, mais sa manière d'être exécuté. Le système combine un tokeniseur d'actions spatio-temporel et un transformeur de clonage comportemental, qui reçoit en entrée à la fois la tâche à accomplir et une condition continue de « mode de mouvement ». Testé sur six tâches de manipulation avec un robot réel, ce paramètre permet de produire des comportements qualifiés de posés, dynamiques ou intermédiaires, que des évaluateurs humains parviennent à distinguer de façon fiable. Les différences se mesurent concrètement dans la vitesse et l'accélération des articulations, ainsi que dans l'angle d'approche de l'effecteur terminal. Fait notable, lorsqu'une tâche n'a été démontrée que dans un seul mode d'exécution, MoMo parvient à transférer un mode demandé mais jamais vu pour cette tâche précise, tout en conservant l'essentiel du taux de réussite. Le papier est publié sur arXiv (2607.26315v1). Cette capacité de généralisation compositionnelle, à savoir combiner une tâche connue avec un style d'exécution inédit, touche un point sensible du déploiement industriel des robots manipulateurs: jusqu'ici, les modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix se concentrent surtout sur le « quoi faire », rarement sur le « comment le faire ». Or pour un intégrateur, la manière d'exécuter un geste compte autant que sa réussite: un préhenseur qui va vite sur une pièce robuste mais qui doit ralentir sur un composant fragile, ou une cadence différente selon la proximité d'un opérateur humain. Que ce réglage de style soit réutilisable d'une tâche à l'autre, sans réentraîner un modèle dédié par comportement, laisse entrevoir une réduction du coût de personnalisation des compétences robotiques en usine. Ce travail s'inscrit dans la lignée des recherches en clonage comportemental et en apprentissage par imitation, qui cherchent depuis plusieurs années à dépasser la simple reproduction de trajectoires démontrées pour capturer des facteurs de comportement transférables. Il reste, à ce stade, une preuve de concept académique limitée à six tâches et un seul bras robotique en laboratoire, sans indication de partenariat industriel ni de calendrier de déploiement. La suite logique serait une validation sur davantage de plateformes et de familles de tâches, pour vérifier si ce contrôle du style de mouvement tient à l'échelle des modèles VLA généralistes actuellement commercialisés.

RecherchePaper
1 source
SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations
3arXiv cs.RO 

SID : glissement dans la distribution pour une manipulation robotique robuste à partir de peu de démonstrations

Des chercheurs ont présenté SID (Sliding into Distribution), un cadre structuré pour la manipulation robotique capable de généraliser à partir de seulement deux démonstrations humaines. Évalué sur six tâches réelles variées (saisies, manipulations d'objets), SID atteint environ 90 % de taux de succès dans des configurations hors-distribution (OOD), c'est-à-dire avec des poses d'objets, des points de vue ou des conditions d'éclairage non vus lors de l'entraînement. La dégradation reste inférieure à 10 % en présence de distracteurs visuels ou de perturbations physiques externes. Le système s'appuie sur deux composants clés : un champ de mouvement centré sur l'objet, appris depuis des démonstrations "canonicalisées" (normalisées en pose), et une politique d'exécution égocentrique légère entraînée par flow matching conditionné, complétée par une augmentation de données par reprojection de nuage de points cinématiquement cohérente. L'intérêt de SID tient à sa frugalité en données : là où les politiques visuomotrices end-to-end standard (type ACT, Diffusion Policy) réclament des dizaines à centaines de démonstrations, SID opère à deux. C'est un signal fort pour les intégrateurs industriels qui peinent à collecter des données en volume sur cellule réelle. Le mécanisme de correction distributional est particulièrement notable : le champ de mouvement génère de larges corrections quand le robot s'écarte de la trajectoire démontrée, puis s'annule naturellement à l'approche de la zone fiable, avant de passer la main à la politique locale. Ce découplage explicite entre récupération hors-distribution et exécution fine constitue une alternative architecturale aux approches purement régressives. Les résultats suggèrent que le "sim-to-real gap" n'est pas le seul problème à résoudre : gérer le glissement distributional en ligne, sans recollecte de données, est un levier sous-exploité. Cette publication s'inscrit dans une vague de travaux sur la manipulation à faible donnée qui cherchent à dépasser les limites des transformeurs d'actions (ACT, π0 de Physical Intelligence, GR00T N2 de NVIDIA) en introduisant des structures géométriques explicites plutôt que de tout apprendre de bout en bout. Le flow matching, popularisé ces deux dernières années comme alternative plus stable à la diffusion pour la génération de trajectoires, est ici combiné à une représentation canonique de l'objet, une approche qui rappelle les travaux sur les réseaux de catégorie neurale (NCF) ou les politiques basées sur des keypoints. Le papier ne mentionne pas de partenaires industriels ni de timeline de déploiement, et reste pour l'instant au stade de preuve de concept académique sur banc réel. Les prochaines étapes naturelles seraient une extension à des objets déformables et une validation sur des bras commerciaux (Franka, xArm) dans des environnements moins contrôlés que le labo.

RecherchePaper
1 source
Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts
4arXiv cs.RO 

Dream-Tac : un modèle d'action monde tactile unifié pour la manipulation robotique riche en contacts

Des chercheurs ont publié le 9 juin 2026 sur arXiv (arXiv:2606.08737) Dream-Tac, un modèle d'action mondial unifié intégrant la modalité tactile pour la manipulation robotique en contact. L'architecture joint trois dimensions simultanément : la génération d'actions, la prédiction d'observations visuelles futures et la dynamique tactile. Deux contributions techniques structurent le système : une fusion visuotactile à déclenchement par contact ("contact-gated visuotactile fusion"), qui intègre sélectivement les signaux tactiles uniquement lors des phases d'interaction physique effective, et un biais d'attention conscient du contact ("contact-aware attention bias") régulant les échanges cross-modaux. Pour rendre le modèle déployable en temps réel, les auteurs introduisent une stratégie d'accélération à deux niveaux : reformulation du biais lors de l'entraînement pour préserver les chemins d'attention fusionnés, et accélération de la diffusion par cache à l'inférence. Résultat annoncé : entraînement 2,9 fois plus rapide, inférence 1,8 fois plus rapide. Sur six tâches de manipulation en contact riche, Dream-Tac améliore la précision des actions de 31,7 % en moyenne. Le code est publié sur GitHub. Le résultat le plus significatif n'est pas le chiffre brut des 31,7 %, mais ce qu'il révèle sur une limitation structurelle des modèles d'action mondiaux (world action models) actuels : ces architectures, qui héritent la capacité prédictive des world models pour guider la génération d'actions, s'appuient quasi exclusivement sur la vision. Or, la vision seule est insuffisante pour les tâches à fort contact (assemblage de pièces, vissage, insertion de connecteurs, manipulation d'objets souples) où les signaux critiques sont d'ordre haptique. Dream-Tac adresse directement ce "reality gap" tactile, en montrant que l'intégration conditionnelle de la modalité tactile dans le pipeline de diffusion améliore substantiellement la robustesse. Pour les intégrateurs industriels et les équipes robotique travaillant sur des cellules d'assemblage ou de finishing, c'est un signal clair que les VLA (Vision-Language-Action models) ne suffisent pas seuls pour les cas d'usage à contact. Le contexte est celui d'une compétition intense entre laboratoires sur la manipulation dextère. Physical Intelligence (pi0, pi0-FAST), Boston Dynamics, Figure AI et Agility Robotics investissent massivement dans des pipelines de manipulation généralisable, principalement visuels. Côté recherche académique, des travaux comme DexDiffuser ou UniDexGrasp ont posé les bases de la manipulation dextère par diffusion, mais sans intégration tactile unifiée. Dream-Tac s'inscrit dans une tendance émergente visant à enrichir ces pipelines avec des capteurs de contact (GelSight, Digit, BubbleGripper), encore peu intégrés dans les architectures de world models. Il s'agit ici d'un article de recherche arXiv, pas d'un produit ou d'un déploiement industriel : les six tâches de validation sont des benchmarks contrôlés en laboratoire, et la généralisation à des environnements réels non structurés reste à démontrer. Les prochaines étapes naturelles seraient une validation sur des plateformes hardware commerciales (UR, Franka, ou bras dextre humanoïde) et une extension à des gripper tactiles standardisés disponibles sur le marché.

RechercheOpinion
1 source