Aller au contenu principal
RecherchearXiv cs.RO 

AVT-Fabric : perception visuo-tactile active par sélection adaptative de preuves pour comparer des tissus

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (arXiv:2609.21377v1, soumis en septembre 2026) présente AVT-Fabric, un framework de comparaison robotique de tissus combinant vision RGB et retour tactile. Une porte à double échelle évalue la confiance du modèle sur le jeton de réponse et l'écart brut entre logits pour décider si une observation tactile supplémentaire, via un capteur GelSight étiqueté en force, est nécessaire; une mémoire textuelle compacte conserve l'historique des actions exécutées et un vote majoritaire consolide les prédictions retenues. Sur 400 comparaisons de test, AVT-Fabric atteint 98,0% de précision avec un modèle multimodal de seulement 7 milliards de paramètres, contre 94,0% pour la référence MLLM-Fabric à 90 milliards de paramètres, soit 4,0 points de mieux tout en n'utilisant en moyenne que 1,60 étape sur les cinq disponibles. Le gain atteint 9,25 points face à l'inférence passive équivalente, avec 61,8% de latence en moins côté modèle, et une précision supérieure au mode vision seule. Déployé sur un robot réel, le système obtient 78,1% de précision en classement par paires et sélectionne le bon tissu dans sept scénarios sur huit testés.

Le résultat interroge l'hypothèse dominante selon laquelle un modèle plus gros est toujours plus performant: ici, un modèle douze fois plus petit dépasse la référence à 90 milliards de paramètres en décidant intelligemment quand solliciter le capteur tactile, plutôt qu'en calculant davantage. Pour les intégrateurs en manipulation textile, tri logistique ou blanchisserie automatisée, cela suggère qu'équiper chaque bras de capteurs tactiles et fusionner systématiquement toutes les modalités coûte cher pour un gain marginal, alors qu'une sélection adaptative de l'évidence tactile réduit le budget de calcul tout en améliorant la précision. La généralisation testée sur quatre architectures MLLM supplémentaires renforce cette piste, même si le benchmark reste un test contrôlé de laboratoire et que la validation robotique ne couvre que huit scénarios applicatifs.

AVT-Fabric se positionne directement face à MLLM-Fabric, système antérieur reposant sur un modèle massif de 90 milliards de paramètres, et s'inscrit dans une tendance plus large de la recherche robotique vers des modèles compacts capables de sélectionner intelligemment l'information plutôt que d'empiler la puissance de calcul. La publication reste académique: aucune entreprise commerciale, aucun partenaire industriel ni calendrier de déploiement pilote n'y figure. Les auteurs indiquent vouloir poursuivre les tests de généralisation sur d'autres familles de modèles multimodaux et étendre l'approche à d'autres tâches de manipulation de matériaux déformables, au-delà de la simple comparaison de tissus.

Dans nos dossiers

À lire aussi

Calcul près du capteur pour une perception visuo-tactile rapide
1arXiv cs.RO 

Calcul près du capteur pour une perception visuo-tactile rapide

Des chercheurs ont présenté, le 5 août 2026 sur arXiv (2608.05725), un système de calcul déporté au plus près du capteur pour les capteurs visuotactiles, ces dispositifs qui reconstruisent la géométrie de contact à partir de gradients de surface mesurés optiquement. Plutôt que de transmettre les données brutes vers un hôte pour traitement, l'équipe implémente un solveur de Poisson spectral sous forme de pipeline matériel entièrement streaming, exécuté directement à proximité du capteur. Le cœur de calcul consomme environ 347 mW et tourne à 166 MHz, sans branchement conditionnel ni convergence itérative, ce qui garantit une latence déterministe. Pour une image de 128x128 pixels, la première valeur de profondeur sort 35 107 cycles après réception du premier pixel, soit 0,211 ms de latence fixe. Sur 15 géométries de contact testées, les profondeurs reconstruites s'écartent d'une référence calculée en double précision de seulement 0,17% de la profondeur de contact maximale. Conséquence directe: une boucle de réflexe protecteur robotique pilotée par ces reconstructions embarquées se referme en 28,3 ± 4,9 ms, contre 169,9 ± 27,8 ms pour une boucle équivalente s'appuyant sur un traitement côté hôte avec le même actionneur, soit un gain d'environ six fois. Ce résultat cible un goulot d'étranglement rarement mis en avant dans le débat sur le toucher robotique: ce n'est pas la captation qui limite la réactivité des bras et mains dotés de peau tactile, mais le transfert de données et l'ordonnancement logiciel côté hôte. En rapprochant le calcul du capteur, les auteurs montrent qu'il est possible d'obtenir une géométrie de contact précise à un coût énergétique très faible et avec une latence prévisible, deux conditions indispensables pour des réflexes de sécurité en temps réel lors d'une interaction physique homme-robot ou d'une manipulation fine. Pour les intégrateurs qui cherchent à fiabiliser des boucles de contrôle de contact, l'argument dépasse la simple vitesse: la latence déterministe évite les pics imprévisibles qui compliquent le réglage des contrôleurs. Les capteurs visuotactiles denses, popularisés par des approches type GelSight, reposent depuis plusieurs années sur une reconstruction par stéréophotométrie coûteuse en calcul, généralement déléguée à un GPU ou un CPU hôte. Ce travail s'inscrit dans la tendance plus large du calcul en périphérie de capteur pour la robotique, où edge computing et matériel dédié remplacent progressivement les pipelines logiciels génériques. Les auteurs ne précisent pas d'intégration produit ni de partenaire industriel; il s'agit à ce stade d'une démonstration de faisabilité architecturale, dont la prochaine étape logique serait une validation sur un capteur physique complet et une comparaison face à d'autres architectures de calcul en périphérie.

RecherchePaper
1 source
AdaDexGrasp : préhension dextérique adaptative par fusion de représentations visuo-tactiles 3D
2arXiv cs.RO 

AdaDexGrasp : préhension dextérique adaptative par fusion de représentations visuo-tactiles 3D

Un nouveau système de préhension robotique baptisé AdaDexGrasp vient d'être publié sur arXiv (référence 2608.07600) en août 2026. Le framework vise à rapprocher les mains robotiques dextres du niveau d'adaptabilité humain en fusionnant vision et toucher : les signaux tactiles de chaque doigt sont associés à son identité propre et combinés à la géométrie 3D de l'objet saisi, formant une représentation unique dite visuo-tactile. Cette représentation alimente trois briques : génération de poses de préhension tenant compte du contact dès la planification, prédiction de faisabilité, puis ajustement dynamique de la prise une fois le contact établi. Les auteurs disent avoir testé l'approche en simulation et sur robot réel, avec une amélioration du taux de réussite et de la généralisation à des objets variés. Le résumé publié ne fournit toutefois ni chiffre précis de taux de succès, ni nombre de degrés de liberté de la main utilisée, ni comparaison chiffrée avec des méthodes existantes, des détails qui restent à vérifier dans l'article complet. Le sujet touche un angle mort connu de la préhension robotique dextre : la plupart des pipelines actuels planifient une prise à partir d'images puis exécutent sans réellement corriger après le contact, ce qui dégrade la robustesse face aux objets fragiles, déformables ou mal localisés par la seule vision. Un mécanisme de rétroaction tactile post-contact qui tiendrait ses promesses hors laboratoire intéresserait directement les intégrateurs travaillant sur le bin-picking, l'assemblage fin ou les mains de robots humanoïdes, domaines où l'échec de préhension reste un goulot d'étranglement malgré les progrès des modèles vision-langage-action. Cette recherche s'inscrit dans une tendance plus large de fusion visuo-tactile en manipulation robotique, portée depuis plusieurs années par des capteurs comme GelSight ou DIGIT et par des jeux de données de préhension dextre type DexGraspNet. AdaDexGrasp reste à ce stade une contribution académique en pré-publication, non revue par les pairs, sans partenariat industriel ni déploiement annoncé. Sa validation indépendante sur du matériel commercial constituera la prochaine étape à surveiller.

RecherchePaper
1 source
ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA
3arXiv cs.RO 

ViTaR : adaptation résiduelle visuo-tactile pour la manipulation par modèles fondation VLA

Une équipe publie sur arXiv (2608.15816v1) ViTaR (Visuo-Tactile Residual Adaptation), qui comble un angle mort des modèles Vision-Language-Action (VLA) : entraînés sur de vastes a priori visuels, ils produisent la même action que le contact avec l'objet soit établi, perdu ou déstabilisé. Plutôt que de modifier l'intérieur du VLA, au risque d'un oubli catastrophique, ou de recourir à du renforcement en ligne près des conditions d'échec, ViTaR garde le modèle gelé et traite le tactile comme un modulateur d'exécution plutôt que comme une entrée génératrice d'action. Une première étape détermine si une correction résiduelle est localement justifiée à partir des résultats observés, une seconde la convertit en un gain continu calculé en temps réel. Sur le benchmark UniVTAC, sept tâches de manipulation à fort contact, ViTaR atteint 61,3% de réussite moyenne, soit 30,6 points de plus que le VLA gelé de base, devançant aussi des méthodes tactiles spécialisées ; des essais sur robot physique confirment le transfert au bruit et à la dynamique réels des capteurs. Ce résultat cible un point critique pour l'industrialisation des VLA, de plus en plus déployés sur bras manipulateurs et humanoïdes : ces modèles excellent sur des tâches visuelles généralistes mais restent fragiles dès qu'il faut saisir, insérer ou assembler avec un contact fin, un scénario omniprésent en logistique et en assemblage industriel. En montrant qu'une correction résiduelle bornée, greffée sur un VLA figé, suffit à gagner plus de 30 points de réussite sans réentraîner le modèle de base, ViTaR ouvre une voie pour ajouter de la robustesse tactile aux piles VLA existantes sans dégrader leurs capacités généralistes. Les approches précédentes laissaient au contraire au tactile une influence non bornée sur l'action générée, au risque de contredire les a priori qui font la généralisabilité de ces modèles. Le travail s'inscrit dans les efforts pour doter les modèles VLA de fondation, dans la lignée de familles comme Pi-0, GR00T ou Helix, d'une perception multimodale plus fine que la seule vision. Publié comme soumission arXiv nouvelle, ViTaR reste à ce stade une contribution de recherche validée sur un benchmark simulé et par des essais robot physique limités, sans annonce de déploiement industriel ni de partenariat commercial. Les auteurs ne donnent pas de calendrier pour une intégration dans des piles VLA commerciales existantes.

RecherchePaper
1 source
ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs
4arXiv cs.RO 

ViBe : adaptation du comportement visuel pour le contrôle du corps entier des humanoïdes perceptifs

Un preprint publié sur arXiv (2609.09918) décrit ViBe (Visual Behavior Adaptation), un framework de post-entraînement qui ajoute une perception visuelle aux contrôleurs de suivi de mouvement pour humanoïdes à corps complet. La méthode réutilise des encodeurs visuels pré-entraînés via un module extracteur multi-requêtes, injecte ce retour perceptif dans le tracker par des adaptateurs low-rank (LoRA) pour un réglage économe en paramètres, puis ajuste l'ensemble par optimisation de politique à partir d'un reward de tâche et d'un jeu de données de référence. Sur quatre tâches, la marche perceptive sur trottoirs et parcours type parkour, le repositionnement d'un cube (Repose Cube), la locomotion-manipulation d'objets variés et l'esquive de balles (dodgeball), le transfert sim-to-real s'effectue en zero-shot et reste robuste en extérieur, en faible luminosité et face à des distracteurs visuels RGB, y compris pour une variante orientée objectif de Repose Cube résolue avec un planificateur volontairement simple. L'apport ne se limite pas à la démonstration technique. Les trackers de mouvement actuels, entraînés en simulation par imitation de trajectoires, n'intègrent aucune perception extéroceptive et dépendent donc d'un planificateur de haut niveau pour réagir à l'environnement. Les contrôleurs perceptifs existants comblaient ce manque en entraînant des encodeurs purement géométriques depuis zéro, plus faciles à transférer en réel mais pauvres en sémantique, et en passant par une distillation élève-enseignant propre à chaque tâche, coûteuse à répéter. En réutilisant des encodeurs visuels pré-entraînés et en cantonnant l'adaptation à des modules low-rank, ViBe suggère que le goulot d'étranglement du contrôle humanoïde perceptif se déplace de la simulation physique, déjà largement maîtrisée, vers l'intégration efficace de la perception sémantique, un point clé pour les intégrateurs qui cherchent à sortir ces robots des environnements contrôlés d'usine. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement à grande échelle pour la locomotion humanoïde, où le transfert sim-to-real reste le paradigme dominant, et se distingue des architectures vision-langage-action de bout en bout comme Pi-0 ou GR00T N2 en proposant une adaptation légère d'un tracker déjà entraîné plutôt qu'une politique généraliste entraînée sur un large corpus de démonstrations. Publié comme contribution académique, sans partenariat industriel ni plateforme commerciale nommée à ce stade, l'article n'évoque aucun déploiement réel. La suite logique consisterait à valider la méthode sur des humanoïdes commerciaux et à la comparer directement, en coût d'entraînement et en robustesse, aux pipelines de distillation élève-enseignant aujourd'hui utilisés par les acteurs du secteur.

RecherchePaper
1 source