AVT-Fabric : perception visuo-tactile active par sélection adaptative de preuves pour comparer des tissus
Un article publié sur arXiv (arXiv:2609.21377v1, soumis en septembre 2026) présente AVT-Fabric, un framework de comparaison robotique de tissus combinant vision RGB et retour tactile. Une porte à double échelle évalue la confiance du modèle sur le jeton de réponse et l'écart brut entre logits pour décider si une observation tactile supplémentaire, via un capteur GelSight étiqueté en force, est nécessaire; une mémoire textuelle compacte conserve l'historique des actions exécutées et un vote majoritaire consolide les prédictions retenues. Sur 400 comparaisons de test, AVT-Fabric atteint 98,0% de précision avec un modèle multimodal de seulement 7 milliards de paramètres, contre 94,0% pour la référence MLLM-Fabric à 90 milliards de paramètres, soit 4,0 points de mieux tout en n'utilisant en moyenne que 1,60 étape sur les cinq disponibles. Le gain atteint 9,25 points face à l'inférence passive équivalente, avec 61,8% de latence en moins côté modèle, et une précision supérieure au mode vision seule. Déployé sur un robot réel, le système obtient 78,1% de précision en classement par paires et sélectionne le bon tissu dans sept scénarios sur huit testés.
Le résultat interroge l'hypothèse dominante selon laquelle un modèle plus gros est toujours plus performant: ici, un modèle douze fois plus petit dépasse la référence à 90 milliards de paramètres en décidant intelligemment quand solliciter le capteur tactile, plutôt qu'en calculant davantage. Pour les intégrateurs en manipulation textile, tri logistique ou blanchisserie automatisée, cela suggère qu'équiper chaque bras de capteurs tactiles et fusionner systématiquement toutes les modalités coûte cher pour un gain marginal, alors qu'une sélection adaptative de l'évidence tactile réduit le budget de calcul tout en améliorant la précision. La généralisation testée sur quatre architectures MLLM supplémentaires renforce cette piste, même si le benchmark reste un test contrôlé de laboratoire et que la validation robotique ne couvre que huit scénarios applicatifs.
AVT-Fabric se positionne directement face à MLLM-Fabric, système antérieur reposant sur un modèle massif de 90 milliards de paramètres, et s'inscrit dans une tendance plus large de la recherche robotique vers des modèles compacts capables de sélectionner intelligemment l'information plutôt que d'empiler la puissance de calcul. La publication reste académique: aucune entreprise commerciale, aucun partenaire industriel ni calendrier de déploiement pilote n'y figure. Les auteurs indiquent vouloir poursuivre les tests de généralisation sur d'autres familles de modèles multimodaux et étendre l'approche à d'autres tâches de manipulation de matériaux déformables, au-delà de la simple comparaison de tissus.
Dans nos dossiers




