Force-based memory pour les modèles vision-langage-action dans la manipulation à contacts riches
Une équipe de recherche propose FM-VLA, un modèle vision-langage-action (VLA) doté d'une mémoire basée sur la force plutôt que sur l'image, décrit dans un article publié sur arXiv (référence 2607.18231v1) daté de juillet 2026. Le système encode l'historique des forces de contact captées par le robot dans des tokens de mémoire compacts, générés par un autoencodeur variationnel (VAE) pré-entraîné à reconstruire des séries temporelles de force. Ces représentations latentes sont ensuite injectées, avec un court historique d'état, comme tokens de conditionnement supplémentaires dans le module d'action du VLA. L'équipe a testé FM-VLA sur trois tâches nécessitant une mémoire temporelle : retrouver un bloc caché, appuyer plusieurs fois sur un bouton, et essuyer une vaisselle un nombre précis de fois. Résultat annoncé : plus de 80% de taux de réussite, avec un surcoût de calcul à l'inférence jugé minime, et des performances nettement supérieures aux approches de référence.
L'enjeu dépassé le simple gain de précision : les VLA actuels reposent souvent sur une hypothèse markovienne, où l'action ne dépend que de l'observation présente, ce qui les rend aveugles à des événements répétitifs difficiles à distinguer visuellement, comme plusieurs pressions rapides sur un même bouton. Les approches existantes de mémoire visuelle, qui rééchantillonnent des images passées, sont coûteuses en calcul et échouent justement sur ces cas ambigus. En s'appuyant sur le signal de force, disponible nativement sur la plupart des bras manipulateurs équipés de capteurs, FM-VLA offre une alternative légère pour la manipulation en contact riche, un domaine clé pour l'assemblage industriel, l'insertion de pièces ou la manipulation fine où la vision seule ne suffit pas à lever l'ambiguïté temporelle.
Ce travail s'inscrit dans la lignée des modèles VLA généralistes comme Pi-0 ou GR00T N2, qui ont démontré la capacité de ces architectures à généraliser sur des tâches de manipulation variées, mais peinent encore sur les scénarios non markoviens. FM-VLA se positionne comme une brique modulaire plutôt qu'un système complet, testée pour l'instant en conditions contrôlées sur un nombre restreint de tâches. Les auteurs mettent à disposition une page de projet dédiée pour les détails techniques et démonstrations, sans annoncer pour l'instant de déploiement industriel ou de partenariat commercial.
Dans nos dossiers




