
MIM-VLA : apprentissage de représentations d'interaction physique à partir du retour moteur de la pince
MIM-VLA est un preprint (arXiv 2610.08425, v1) qui ajoute à une politique vision-langage-action (VLA) une représentation de la réponse physique au contact, tirée uniquement du moteur de la pince. Un Motor Interaction Module (MIM) encode le courant, la position, la vitesse et la validité du signal du gripper récents sous la forme d'un « token d'interaction » de 128 dimensions. Le module est préentraîné sur des étiquettes de contact et de phase d'interaction relues par des humains. Il conditionne ensuite uniquement la voie d'action de la pince de SmolVLA, le petit VLA open source de Hugging Face. Les actions du bras et l'interface en contrôle de position restent inchangées. Le même token alimente MEM, un VLM « sélecteur » qui compare des interactions candidates et produit des choix accompagnés d'explications. Trois tests réels sont décrits : comparer la résistance d'objets visuellement différents, distinguer un objet réel de sa réplique par sondage actif, et saisir délicatement des objets fragiles, y compris des instances jamais vues. Sur 13 paires d'objets, MIM-VLA choisit l'objet le plus résistant dans 75,0 % des essais, contre 48,8 % pour SmolVLA, soit un niveau proche du hasard.
L'intérêt est pratique. Les VLA actuels décident surtout à partir de l'image et de l'état du robot, et ne « sentent » pas ce qui se passe après le contact. Les approches tactiles classiques demandent des capteurs supplémentaires, comme des matrices tactiles ou des capteurs force-couple, qui alourdissent la pince, le coût et la maintenance. Ici, les auteurs affirment n'utiliser que le retour moteur déjà disponible, sans estimation de force calibrée ni contrôle direct du courant. Pour un intégrateur, cela rend la piste réaliste sur des pinces existantes, notamment pour manipuler des objets fragiles ou contrôler la qualité par palpation. Les limites sont claires. Il s'agit d'un résultat de laboratoire, sans nombre d'essais détaillé dans le résumé. Les tâches sont choisies par les auteurs, et 75 % de réussite signifie encore une erreur sur quatre, loin d'un niveau industriel.
Ce travail s'inscrit dans la poussée vers des VLA « physiquement ancrés » face à la limite de la vision seule. La concurrence passe par les capteurs tactiles dédiés, les capteurs force-couple et les grands modèles généralistes de type Pi-0, qui restent essentiellement visuels. La proposition MIM-VLA est plus légère, mais sa validité hors du couple pince-SmolVLA testé reste à démontrer. La suite logique serait de valider sur d'autres pinces et d'autres VLA, avec des comparaisons directes face à des capteurs tactiles.
Dans nos dossiers




