Aller au contenu principal
Sur quoi porter l'attention, quoi retenir : représentation visuo-tactile conditionnée par la compétence, avec mémoire d'événements guidée par la progression
RecherchearXiv cs.RO 

Sur quoi porter l'attention, quoi retenir : représentation visuo-tactile conditionnée par la compétence, avec mémoire d'événements guidée par la progression

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv (2609.38494) une méthode de représentation visuo-tactile conditionnée par la compétence pour la manipulation robotique, avec un site de projet associé. Le principe : l'importance relative de la vision et du toucher change selon l'étape de la tâche. La vision guide l'approche, tandis que le toucher, par son évolution temporelle, décide de la saisie, de l'alignement et du contact. Les politiques multimodales actuelles utilisent pourtant des contextes temporels et des stratégies de fusion fixes. Les auteurs proposent que la primitive de compétence interrogée (par exemple saisir, tourner, glisser) conditionne la fusion de jetons d'observation à court terme, propres à chaque modalité. Le modèle consulte en parallèle une mémoire d'événements éparse, qui ne conserve que les observations terminales des K dernières compétences exécutées. L'évaluation porte sur l'estimation de la progression d'une compétence, sur trois tâches riches en contacts. Les auteurs annoncent une réduction de 87 % du délai de détection de glissement face à des modèles de progression de pointe affinés, de 67,5 % du délai de détection d'achèvement d'une torsion face à une ablation vision seule, et de 92 % de l'erreur de progression sur une tâche de recherche à l'aveugle grâce à la mémoire éparse.

Pour les intégrateurs et les équipes qui développent des politiques VLA ou de manipulation dextre, le résultat déplace la question habituelle. Le débat porte souvent sur la taille du modèle ou l'architecture de la politique, alors que les auteurs soutiennent que la formation de l'observation (quoi regarder, sur quelle durée, avec quel capteur) est un goulot central. Les gains se concentrent là où l'achèvement d'une action se définit par le contact ou par l'historique de la tâche : détecter un glissement ou savoir qu'une torsion est finie, ce que la vision seule perçoit tardivement ou pas du tout. Cela rappelle que le tactile n'est utile que si l'architecture lui accorde la bonne fenêtre temporelle, et que la détection d'échec ou de fin de geste est un levier de fiabilité à l'échelle. Il faut toutefois rester prudent : ces chiffres sont des délais d'estimation de progression mesurés sur trois tâches de laboratoire, pas des taux de réussite de manipulation en déploiement. Les baselines et le matériel exacts devront être vérifiés dans le papier complet.

Ce travail s'inscrit dans la montée des politiques généralistes (VLA comme Pi-0 ou GR00T) et de la manipulation visuo-tactile, où les capteurs tactiles à base de gel optique se démocratisent mais restent mal exploités par des architectures conçues pour la vision. L'approche rejoint les recherches sur la mémoire à long horizon et la décomposition en compétences, qui visent à rendre les politiques robustes sur des séquences longues. Il s'agit d'une prépublication v1, sans pilote industriel ni code produit annoncé dans le résumé. Les prochaines étapes à surveiller sont l'intégration dans une politique complète de bout en bout, des tests sur des mains multi-doigts et une validation hors laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Mémoire pour attention : re-perception conditionnée par le langage avec une carte vision-langage-mouvement
1arXiv cs.RO 

Mémoire pour attention : re-perception conditionnée par le langage avec une carte vision-langage-mouvement

Des chercheurs testent une carte persistante annotée par comportements, la Vision-Language-Motion Map (VLMM), sur deux questions de planification robotique. Sur 28 scènes du simulateur AI2-THOR, un planificateur exploitant les coûts comportementaux de la VLMM réduit l'objectif de planification d'environ 35% par rapport à une approche classique. Mais en exécution réelle en boucle fermée, ce gain fond à environ 4%, et un modèle vision-langage (VLM) interrogé à la demande fait quasiment aussi bien. Sur la seconde question, celle de savoir quoi ré-observer en priorité quand le budget de perception est limité, la mémoire de la carte, historique des changements ou simple date de dernière observation, produit le meilleur calendrier de re-perception, équivalent à un oracle, là où un VLM sans mémoire se révèle médiocre. Le bénéfice se concentre sur les objets importants (facteur d'environ 1,6 fois la moyenne), et une tâche de récupération d'objet confirme moins de trajets inutiles. Le gain croît avec l'hétérogénéité des scènes selon une borne de Cauchy-Schwarz, égale à la variance de la racine de la volatilité. Avec un vrai prior CLIP sur des objets rendus, l'avantage atteint +21 à 26%. Quand la tâche est conditionnée par le langage, la VLMM identifie les objets pertinents en vocabulaire ouvert et suit leurs changements, dépassant une base récence-pertinence de +2,5% et un VLM à la demande de +8,9%. Ce résultat nuance l'idée répandue qu'une carte sémantique persistante améliore mécaniquement la navigation: pour "comment contourner une pièce", la mémoire est un luxe dont l'intérêt s'évapore à l'exécution, un VLM interrogé au vol suffisant. En revanche, pour décider quoi re-observer sans tout rescanner, cruciale pour un robot mobile ou humanoïde à budget de calcul et de caméra limité, la mémoire change la donne. Pour les intégrateurs, la leçon est concrète: pas besoin de carte comportementale complexe pour le déplacement, mais un vrai gain à prioriser les re-vérifications sur les objets qui comptent, avec économie de calcul et de temps de cycle. Ni le langage seul ni la dynamique seule ne suffisent, seule leur combinaison produit l'avantage. Les cartes sémantiques enrichies par VLM se sont multipliées avec la montée des modèles vision-langage-action, généralement validés en simulation avant tout déploiement réel. Ce travail se positionne en creux face à cette tendance en exposant l'écart entre gains de planification hors ligne et performance réelle en boucle fermée, un avertissement utile pendant que le secteur multiplie les annonces de cartes cognitives pour robots humanoïdes et logistiques. Les auteurs comparent leur approche aux VLM à la demande, sans mémoire mais coûteux en calcul, et aux baselines de récence pondérée. Travail de recherche publié sur arXiv, sans partenaire industriel annoncé, ses suites naturelles porteraient sur une validation hors simulateur et sur des plateformes robotiques réelles, où l'arbitrage calcul-mémoire-perception est plus contraint.

RecherchePaper
1 source
Vers une manipulation d'objets de haute précision : politique visuomotrice guidée par SAM3, avec mémoire persistante et conditionnement visuel ciblé
2arXiv cs.RO 

Vers une manipulation d'objets de haute précision : politique visuomotrice guidée par SAM3, avec mémoire persistante et conditionnement visuel ciblé

Une équipe de recherche présente FOM-SAM3, un système de manipulation robotique combinant le modèle de segmentation SAM3 avec une mémoire persistante d'objets, décrit dans un article publié sur arXiv (référence 2609.21621v1). Le système cible la manipulation fine d'objets, c'est-à-dire la capacité d'un robot à saisir un objet précis parmi d'autres visuellement similaires. La méthode, baptisée FOM-SAM3, apprend des jetons de mémoire réutilisables à partir d'un nombre limité d'images d'enregistrement multi-vues, tout en gardant le modèle SAM3 entièrement gelé, via un apprentissage de type "un contre tous" qui encode la reconnaissance de l'objet cible et le rejet des objets similaires. Ces jetons sont stockés dans une banque de mémoire réutilisable. Les chercheurs y associent un module nommé Focused Spatial-Appearance Encoding (FSAE), qui combine les caractéristiques d'apparence locale de l'objet avec les coordonnées de sa boîte englobante pour piloter des politiques d'action existantes, Diffusion Policy et Action Chunking with Transformers. Le dispositif a été validé sur un jeu de données maison, FO-30, comprenant 30 objets physiques répartis en quatre catégories larges, et testé sur trois tâches de manipulation avec un robot réel. L'enjeu pointé par les auteurs est un angle mort connu des politiques visuomotrices actuelles: un conditionnement au niveau de la scène ne permet pas de sélectionner explicitement un objet, tandis qu'un conditionnement au niveau de la catégorie ne distingue pas deux objets similaires appartenant à la même catégorie. Pour l'industrie, cela concerne directement les cas d'usage où un robot doit saisir une référence précise au milieu de produits quasi identiques, un problème récurrent en logistique et en tri industriel. Les résultats rapportés montrent une robustesse aux objets distracteurs, une capacité de discrimination entre objets proches, et une extensibilité à de nouveaux objets sans réentraîner le modèle de segmentation de base. Ce travail s'inscrit dans la lignée des recherches qui cherchent à coupler des modèles de segmentation générique comme SAM3 à des politiques d'action robotique, plutôt qu'à entraîner des architectures visuomotrices de bout en bout. Il reste à ce stade un article de recherche déposé sur arXiv, non encore revu par les pairs, validé en laboratoire sur un jeu de données restreint de 30 objets et trois tâches, sans annonce de déploiement industriel ni de partenaire commercial associé.

RechercheActu
1 source
Représentations statiques et dynamiques pour l'estimation de l'angle de contact tactile avec des capteurs à événements
3arXiv cs.RO 

Représentations statiques et dynamiques pour l'estimation de l'angle de contact tactile avec des capteurs à événements

Des chercheurs ont publié le 3 juin 2026 un preprint (arXiv:2606.03545) évaluant trois méthodes de représentation des données issues du NeuroTac, un capteur tactile neuromorphique event-based, pour l'estimation de l'angle de contact. Les flux d'événements générés lors du contact physique sont transformés en contours spatiaux selon trois approches : une représentation dynamique capturant l'activité événementielle la plus récente, une représentation statique reconstituant un état de contact persistant, et leur combinaison. Sur tous les scénarios de mouvement testés, les trois pipelines maintiennent une latence de traitement P99 inférieure à 10 ms, quel que soit l'intervalle d'échantillonnage utilisé. La représentation statique surpasse marginalement les deux autres en précision : elle atteint une MAE (erreur absolue moyenne) de 0,160° en roulement continu du capteur sur une surface, et de 0,251° lors de phases d'arrêt aléatoires intercalées dans le mouvement. Elle présente également une variance plus faible face aux variations de vitesse et de profondeur d'indentation. Pour les intégrateurs et les équipes de contrôle robotique, une latence P99 sous 10 ms représente le seuil en dessous duquel le retour tactile peut alimenter des boucles de contrôle temps-réel sans devenir le facteur limitant de la chaîne de commande. La précision de 0,160° en roulement est compatible avec des tâches d'assemblage ou d'insertion nécessitant un contrôle fin de l'orientation de contact. Le résultat le plus contre-intuitif est la performance supérieure de la représentation statique sur la dynamique : les capteurs event-based étant précisément réputés pour leur réactivité temporelle, l'hypothèse implicite était que les représentations exploitant cette dimension temporelle seraient les meilleures. Ici, la simplicité de la représentation statique s'avère plus robuste, ce qui réduit la complexité du traitement embarqué nécessaire. Le NeuroTac est issu des travaux du Bristol Robotics Laboratory, dans le groupe de Nathan Lepora, qui a d'abord développé le TacTip, un capteur optique tactile biomimétique, avant d'en produire une variante neuromorphique. Dans l'écosystème des capteurs tactiles de précision, il concurrence des dispositifs comme le DIGIT (Meta AI Research et CMU), le GelSight (MIT) ou les capteurs Xela Robotics. L'article demeure un preprint non soumis à peer review, et les scénarios évalués, fondés sur des mouvements de roulement contrôlés en laboratoire, restent éloignés des conditions d'une manipulation industrielle réelle. La validation sur des tâches multi-doigts ou des mains robotiques complètes comme la Shadow Hand constituerait une prochaine étape naturelle pour évaluer le passage à l'échelle.

RecherchePaper
1 source
L'imagination du toucher : manipulation guidée par le toucher via des représentations tactiles imaginées
4arXiv cs.RO 

L'imagination du toucher : manipulation guidée par le toucher via des représentations tactiles imaginées

Des chercheurs présentent TacImag, un framework qui apprend à un robot à « imaginer » le toucher plutôt que de le mesurer physiquement. Le système prédit des signaux tactiles à partir de la vision et de la proprioception seules, en s'entraînant sur des démonstrations où vision et tactile réel sont enregistrés en parallèle. Une fois entraîné, TacImag guide les politiques de manipulation sans capteur tactile au moment du déploiement. L'équipe l'a évalué sur six tâches en simulation et quatre tâches réelles. Les résultats montrent que les champs de force imaginés améliorent les tâches sensibles au contact de 44,4% en moyenne, tandis que les images tactiles imaginées améliorent les tâches sensibles à la texture de 23,3%, un écart qui révèle que l'efficacité de la méthode dépend fortement du type de représentation choisi selon la tâche visée. Article publié sur arXiv (2607.01684v1). L'enjeu pratique est significatif pour l'industrie de la manipulation robotique : les capteurs tactiles restent fragiles, nécessitent un étalonnage régulier et alourdissent la maintenance, ce qui freine leur adoption à grande échelle chez les intégrateurs. En montrant qu'un robot peut bénéficier des avantages du toucher sans embarquer de matériel tactile en production, TacImag ouvre une voie pour réduire coûts et complexité tout en gardant les gains de performance sur les tâches de contact fin, comme l'insertion ou la manipulation d'objets fragiles. Point notable soulevé par les auteurs eux-mêmes : le système ne se contente pas de reconstituer une mesure tactile manquante. Il agit plutôt comme une forme de supervision consciente du contact, qui transforme des indices visuels d'interaction subtils en représentations plus facilement exploitables par les politiques d'apprentissage. Le travail s'inscrit dans la recherche sur la manipulation robotique riche en contacts, un domaine où le tactile est étudié depuis plusieurs années comme complément à la vision pour les gestes fins. Il s'agit ici d'une contribution académique, sans déploiement industriel ni produit commercial associé. Les auteurs suggèrent que la prochaine étape consistera à généraliser l'approche à des scénarios de contact plus divers et à l'intégrer dans des pipelines d'apprentissage de politiques plus larges, notamment les modèles vision-langage-action.

RecherchePaper
1 source