Aller au contenu principal
RecherchearXiv cs.RO 

MT-WAM : réorienter la représentation prédictive à passage unique vers la génération d'action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv en septembre 2026 (référence 2609.21474v1), MT-WAM fait évoluer le modèle Fast-WAM de contrôle robotique par apprentissage vidéo-action. Le système génère les actions à partir d'un unique passage avant dans un Transformer de diffusion vidéo, sans produire de vidéo future à l'inférence. MT-WAM y ajoute deux supervisions, prédiction de trajectoires de points 2D futurs et de caractéristiques visuelles futures, traitées par une branche légère à deux flux avec masque d'attention anti-interférence copiée depuis les derniers blocs du backbone vidéo. À l'inférence, seuls des caches vidéo et mouvement sont recalculés à chaque replanification, la prédiction vidéo future étant abandonnée. Résultat, sans pré-entraînement de politique supplémentaire : 98,2% de réussite sur LIBERO, 73,7% sur LIBERO-Plus (+23,8 points face à Fast-WAM), une hausse de 6,30% à 19,40% sur RoboTwin 2.0 en configuration Random, et de 67,0% à 77,8% en moyenne sur quatre tâches réelles.

L'enjeu dépasse la simple prouesse benchmark : les modèles de contrôle robotique de type VLA cherchent à exploiter une représentation vidéo pré-entraînée pour produire des actions fiables sans supporter le coût de calcul d'une génération vidéo complète à chaque inférence. En montrant qu'une supervision orientée vers la dynamique future et la structure visuelle améliore surtout la robustesse sur des variations non vues, comme le confirment les gains sur LIBERO-Plus et sur la configuration Random de RoboTwin, MT-WAM apporte un indice concret que les architectures façon Fast-WAM sous-exploitaient jusqu'ici leur propre représentation vidéo pour l'action, un point utile pour qui conçoit des politiques robotiques génériques à partir de backbones vidéo pré-entraînés plutôt que des politiques spécialisées entraînées de bout en bout.

MT-WAM se présente explicitement comme une extension de Fast-WAM, dont il reprend le principe fondateur : le co-entraînement vidéo-action améliore le contrôle sans nécessiter de génération vidéo à l'exécution. Classé en soumission croisée sur arXiv, le travail s'inscrit dans un courant de recherche actif sur les modèles de fondation robotiques combinant prédiction vidéo et génération d'action via des Transformers de diffusion. Les auteurs ne signalent ni partenariat industriel ni intégration produit : les résultats reposent sur des benchmarks de simulation reconnus (LIBERO, LIBERO-Plus, RoboTwin 2.0) et sur seulement quatre tâches réelles, ce qui invite à la prudence avant toute extrapolation à grande échelle. Aucune date de mise à disposition du code n'est mentionnée dans la publication.

Dans nos dossiers

À lire aussi

Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde
1arXiv cs.RO 

Vers un apprentissage robotique unifié : relier représentation, modèles vision-langage-action et modèles du monde

Un article publié sur arXiv sous la référence 2609.03927v1 propose une synthèse unifiée de l'apprentissage robotique, en organisant les travaux existants autour de trois axes complémentaires : la compréhension via l'apprentissage de représentation, l'action via les modèles vision-langage-action (VLA), et le raisonnement via les modèles du monde. Les auteurs introduisent une taxonomie structurée qui capture les choix de conception clés en matière de représentation de l'environnement, d'apprentissage de politiques et de modélisation prédictive, et dressent un état des lieux des avancées récentes dans ces trois domaines de recherche. Le papier pointe un problème central pour le secteur : ces trois paradigmes progressent rapidement mais restent développés de façon cloisonnée, ce qui produit des systèmes fragmentés, peu capables de généraliser, de raisonner sur des horizons temporels longs ou de planifier dans des environnements non structurés. C'est un signal utile pour les intégrateurs et décideurs B2B qui misent tout sur un seul bloc technologique, qu'il s'agisse d'un VLA pour l'action ou d'un modèle du monde pour la prédiction. Les auteurs soutiennent que les limites observées sur le terrain, quantification insuffisante de l'incertitude, mauvaise généralisation hors distribution, transfert difficile d'une plateforme robotique à une autre, compréhension limitée du contexte long, planification longue portée fragile, ne viennent pas seulement des composants pris isolément mais du manque d'intégration entre perception, action et raisonnement. Cela nuance l'hypothèse répandue selon laquelle il suffirait de faire grossir un seul type de modèle pour résoudre l'autonomie robotique générale. Cette synthèse arrive alors que les trois courants qu'elle croise, apprentissage de représentation pour la perception, modèles VLA pour le contrôle d'action, modèles du monde pour la prédiction des conséquences, ont chacun connu des avancées rapides ces dernières années dans la recherche robotique sans converger vers une architecture commune. Plutôt que de comparer des produits ou des laboratoires concurrents, l'article se positionne comme une carte du terrain de recherche à destination de la communauté scientifique. Les auteurs esquissent des directions futures vers des systèmes d'apprentissage robotique unifiés, physiquement ancrés et probabilistes, capables de maintenir des représentations internes cohérentes et de soutenir la prise de décision sur des interactions prolongées en conditions réelles, sans toutefois annoncer de calendrier de mise en œuvre ni de prototype déployé.

RecherchePaper
1 source
RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation
2arXiv cs.RO 

RepSAM : adapter les modèles fondation à la vision robotique par guidage de représentation

Des chercheurs ont publié le 26 mai 2026 sur arXiv (2605.25495) RepSAM, un cadre d'adaptation à l'efficacité paramétrique (PEFT) conçu pour transférer les capacités de SAM (Segment Anything Model) vers la perception robotique en environnements non structurés. Le diagnostic de départ est précis : les couches superficielles du transformeur subissent un écart de représentation important entre données génériques et données robotiques (CKA inférieur à 0,7), tandis que les couches profondes restent stables (CKA supérieur à 0,7). RepSAM exploite cette asymétrie via une allocation de rang guidée par la CKA (Centered Kernel Alignment) pour concentrer les paramètres entraînables là où le décalage est effectivement significatif. Le résultat : 89,0 % de mIoU contre 90,9 % pour le fine-tuning complet, soit 97,9 % des performances, avec seulement 4,0 millions de paramètres entraînables sur 632 millions totaux, une réduction de 158 fois. L'entraînement tient en 4 heures sur un seul GPU A100, contre 384 heures-GPU pour le fine-tuning intégral, et surpasse DoRA de 7,9 points de mIoU sur six benchmarks. En manipulation robotique, le gain atteint 12 points absolus de taux de succès par rapport à la baseline LoRA RGB, avec une significativité statistique p inférieur à 0,01. L'enjeu industriel est direct : le gouffre entre les modèles de vision généralistes et les conditions réelles de la robotique (objets transparents, scènes encombrées, éclairage variable) reste l'un des principaux blocages pour les intégrateurs. RepSAM démontre qu'un adapter bien ciblé, informé par la structure interne du réseau plutôt qu'appliqué uniformément, peut quasiment égaler un fine-tuning complet à une fraction du coût de calcul. Pour un responsable technique déployant des bras manipulateurs ou des systèmes de picking, cela signifie qu'il devient réaliste d'adapter un modèle de fondation sur du matériel standard, sans infrastructure de calcul dédiée ni données massives. SAM, développé par Meta AI et publié en 2023, s'est imposé comme référence pour la segmentation zero-shot, mais ses performances se dégradent hors distribution, notamment en robotique industrielle. Les méthodes PEFT comme LoRA et DoRA avaient déjà tenté ce pont, avec des gains limités faute d'adaptation différenciée par couche. RepSAM s'inscrit dans la continuité de travaux sur l'analyse de représentation pour guider le fine-tuning (CKA comme outil de diagnostic, popularisé depuis 2019). La prochaine étape logique est la validation sur des robots réels en conditions industrielles ; l'article se limite pour l'instant à des benchmarks simulés et des tâches de manipulation contrôlées, ce qui laisse ouvert le sim-to-real gap à grande échelle.

UELes intégrateurs européens de bras manipulateurs et systèmes de picking pourraient adapter des modèles de vision fondation sur du matériel GPU standard, réduisant la barrière à l'IA perceptive sans infrastructure de calcul dédiée.

RechercheOpinion
1 source
TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique
3arXiv cs.RO 

TacWAM : un modèle d'action du monde guidé par ancrage, avec prédiction tactile sensible à la mécanique

Traduction-résumé de l'article arXiv ci-dessous, format demandé (3 paragraphes, sans titres). --- Des chercheurs présentent TacWAM (Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction), un modèle qui combine prédiction d'état futur et génération d'action pour des robots manipulateurs, en s'appuyant cette fois sur le tactile plutôt que sur la seule vision. Le système repose sur trois briques : un encodeur tactile à fusion spatialement alignée (SAF) qui projette apparence tactile, champs de force denses et flux de déformation dans un espace latent commun, avec reconstruction bilatérale des forces et couples pour préserver l'information de contact globale ; un encodeur d'historique tactile qui donne du contexte temporel à la prédiction future ; et un mécanisme d'attention tri-modal guidé par ancrage (AGT) qui sépare les tokens visuels et tactiles courants, les tokens de prédiction future et les tokens d'action, de façon à ce que la supervision par le tactile futur n'agisse pas comme un raccourci direct pour l'action. Sur quatre tâches réelles de manipulation à contact riche (prise d'objets fragiles, contact de surface soutenu, manipulation dynamique en main), TacWAM atteint un taux de réussite moyen de 75,0 %, soit 37,5 points de plus que la meilleure référence testée. Des ablations montrent une dégradation nette dès que l'historique tactile est retiré ou que l'accès aux cibles de prédiction future est relâché. L'enjeu dépasse la simple mesure de performance : la vision seule peine à fournir un signal utile pour la force, le glissement ou la déformation lors de tâches de contact fin, un angle mort connu des approches de manipulation par apprentissage. En montrant qu'une prédiction tactile future bien conçue, couplée à une architecture qui empêche cette prédiction de devenir une "triche" pour l'action, améliore significativement des tâches réputées difficiles (objets fragiles, contact soutenu), les auteurs apportent un argument concret en faveur de l'intégration native du tactile dans les futurs modèles de type "world action model", au-delà des architectures VLA aujourd'hui dominées par la vision et le langage. Ce travail s'inscrit dans la lignée des World Action Models, qui cherchent à unifier prédiction du monde et politique d'action pour améliorer la robustesse des robots manipulateurs, un axe déjà exploré via la vision par des modèles comme GR00T N2 ou Pi-0. TacWAM reste à ce stade une contribution de recherche publiée sur arXiv, validée sur un nombre restreint de tâches en laboratoire et non un système déployé industriellement ; ses auteurs annoncent vouloir approfondir les ablations et étendre l'évaluation à davantage de scénarios de contact.

RecherchePaper
1 source
EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique
4arXiv cs.RO 

EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique

EDAR (Environment-Dependent Action Representation) est une nouvelle méthode d'apprentissage de représentations d'actions pour la manipulation robotique, présentée dans un article publié sur arXiv (référence 2607.11427v1). Le problème que les auteurs cherchent à résoudre est que les trajectoires de contrôle brutes utilisées pour entraîner des politiques robotiques sont bruitées, redondantes et difficiles à modéliser telles quelles. Les approches existantes se contentent généralement d'encoder la structure du flux d'actions lui-même, sans tenir compte explicitement de l'environnement dans lequel ces actions sont exécutées. EDAR propose au contraire de coupler les commandes moteur avec leurs effets visuels attendus, conditionnés par le contexte de la scène, afin que la représentation apprise capture la sémantique de l'interaction plutôt que de simples motifs au niveau des commandes. Les auteurs ont testé leur méthode sur des bancs d'essai de manipulation à la fois simulés et sur robot réel. Cette approche s'attaque à un angle mort connu des architectures VLA (vision-language-action) actuelles: le même segment d'action peut produire des résultats radicalement différents selon la disposition des objets, les propriétés physiques de la scène ou l'état initial de l'environnement. En ancrant les tokens d'action dans les conséquences visuelles attendues plutôt que dans la seule structure de commande, EDAR vise à améliorer la généralisation des politiques apprises, en particulier sur des tâches de manipulation à long horizon, où les erreurs de représentation s'accumulent au fil des étapes. Pour les équipes qui développent des politiques de manipulation généralistes, ce type de travail illustre une tendance de fond: le passage d'une modélisation purement centrée sur le contrôle vers des représentations conjointes action-perception, jugées nécessaires pour que les modèles de fondation robotiques (dans la lignée de GR00T N2, Pi-0 ou Helix) tiennent leurs promesses au-delà des démonstrations en environnement contrôlé. Le papier s'inscrit dans un courant de recherche plus large sur les représentations d'actions pour la robotique, où plusieurs travaux récents ont exploré la tokenisation d'actions, l'apprentissage par imitation conditionné par la vision, ou les modèles du monde pour anticiper les conséquences des actions. EDAR se positionne comme une contribution méthodologique plutôt qu'un produit ou un système déployé: il n'y a pas d'annonce de déploiement industriel ni de partenariat commercial associé à ce travail, qui reste à ce stade une publication de recherche évaluée sur des bancs d'essai académiques. Les prochaines étapes attendues pour ce type de travaux sont généralement l'intégration dans des pipelines VLA plus larges et des tests de transfert sur des plateformes robotiques commerciales, mais aucune feuille de route de ce type n'est mentionnée dans l'abstract.

RecherchePaper
1 source