
PACT-WAM : prédiction d'actions et anticipation visuelle par encodage temporel compact pour la manipulation robotique
PACT-WAM (Predicting Actions and Visual Foresight with Compact Temporal Encoding), décrit dans un article arXiv (2602.15882v2), est un « world-action model » qui génère conjointement, par flow conditionnel, une trajectoire d'actions sur 16 pas de temps et la prévision visuelle correspondante. Son encodage hiérarchique de l'historique, grossier pour les observations anciennes et fin pour les récentes, conserve 16 observations à 256 tokens par vue, 75% de moins qu'un encodage dense équivalent. Un module de flow partagé met conjointement à jour action et vision via deux têtes dédiées, un décodeur TiTok-VAE reconstruit les images futures multi-vues, et un module optionnel de révision des propositions (PR), fondé sur un modèle vision-langage, filtre les exécutions au moment du test. Sans PR, les taux de réussite atteignent 98,6% sur LIBERO, 92,3% sur RoboTwin 2.0 et 78,0% sur des tâches réelles avec un bras Piper ; avec PR, 99,5%, 93,4% et 86,7%.
Ce travail illustre la convergence entre modèles d'action (VLA) et modèles du monde génératifs, afin que le robot anticipe visuellement les conséquences de ses gestes avant exécution. L'apport concret porte sur le coût de calcul : la compression hiérarchique à 256 tokens par vue réduit fortement la charge des représentations temporelles denses sans dégrader la performance, un enjeu direct pour faire tourner ce type de modèle en temps réel sur du matériel embarqué. L'écart entre les scores en simulation, supérieurs à 92%, et sur tâches réelles avec le bras Piper, 78% sans PR, rappelle que le fossé simulation-réel reste ouvert, même si la révision de propositions au moment du test le réduit, moyennant un surcoût de calcul que les auteurs assument comme un compromis.
PACT-WAM a été évalué sur deux bancs d'essai de simulation courants, LIBERO et RoboTwin 2.0, et sur des manipulations réelles avec un bras Piper. Il s'inscrit dans la lignée des architectures récentes combinant modèles vision-langage-action et modèles du monde génératifs, une direction suivie par plusieurs équipes de recherche. Le papier ne précise ni affiliation institutionnelle ni calendrier de diffusion publique du modèle ou du code, ce qui en fait pour l'instant une contribution académique, validée en simulation et sur un nombre restreint de tâches réelles.
Dans nos dossiers




