VPWEM : politique visuomotrice non markovienne à mémoire de travail et épisodique
Voici l'article traduit et résumé :
Une équipe de recherche publie VPWEM (Visuomotor Policy with Working and Episodic Memory), une architecture destinée aux politiques visuomotrices utilisées en apprentissage par imitation robotique. Le problème ciblé : la plupart des politiques actuelles ne conditionnent leurs décisions que sur l'observation courante ou un historique court, ce qui les rend inefficaces sur des tâches non-markoviennes nécessitant une mémoire à long terme, comme retrouver un objet déplacé hors champ de vision quelques instants plus tôt. Plutôt que d'élargir la fenêtre de contexte, coûteux en calcul et propice au surapprentissage de corrélations superficielles, VPWEM conserve une fenêtre glissante d'observations récentes comme mémoire de travail à court terme, et ajoute un compresseur contextuel basé sur Transformer qui convertit récursivement les observations sorties de la fenêtre en un nombre fixe d'embeddings de mémoire épisodique. Ce compresseur combine auto-attention sur les résumés passés et attention croisée sur les observations historiques, et s'entraîne conjointement avec la politique. L'architecture a été instanciée sur des diffusion policies, avec mémoire et calcul quasi constants à chaque pas de temps. Sur les benchmarks MIKASA (tâches de manipulation exigeantes en mémoire) et MoMaRT (manipulation mobile), VPWEM dépasse les diffusion policies et modèles vision-langage-action (VLA) de référence de plus de 20% et 5% respectivement. Le code est disponible sur GitHub.
Pour les intégrateurs et décideurs robotiques, ce travail répond à une limite concrète des systèmes VLA et diffusion policies actuellement déployés en usine ou en logistique : leur incapacité à raisonner sur des séquences longues fait qu'ils échouent dès qu'une tâche exige de se souvenir d'un événement passé, un tri d'objets par comptage, une inspection multi-étapes, un scénario où un obstacle a bougé hors caméra. Un gain de 20% sur les tâches à mémoire intensive suggère que le goulot d'étranglement n'est pas tant la capacité de perception ou de génération d'action que la gestion du contexte temporel, un point souvent minimisé dans les démonstrations commerciales de robots humanoïdes ou de bras manipulateurs, où les tâches testées restent généralement courtes et markoviennes.
Ce travail s'inscrit dans la lignée des diffusion policies popularisées pour le contrôle robotique ces dernières années, et des architectures VLA (vision-language-action) comme Pi-0 ou GR00T N2, qui dominent actuellement les annonces du secteur mais peinent structurellement sur la mémoire longue durée. VPWEM se positionne comme complément architectural plutôt que rupture, applicable en théorie à d'autres backbones de politique. Il s'agit ici d'une publication de recherche avec code ouvert, pas d'un produit ou d'un déploiement industriel, une étape amont dans la chaîne qui sépare la recherche académique des systèmes commerciaux vendus par les acteurs de l'humanoïde.
Dans nos dossiers




