Aller au contenu principal
TactileReflex : contrôle réflexe vision-tactile piloté par les statistiques du bruit pour la manipulation sensible à la force
RecherchearXiv cs.RO 

TactileReflex : contrôle réflexe vision-tactile piloté par les statistiques du bruit pour la manipulation sensible à la force

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

TactileReflex est un contrôleur en boucle fermée à trois canaux pour la manipulation de contenants déformables fragiles, comme des gobelets plastiques remplis de liquide. Publié sur arXiv (2605.23568), il utilise deux capteurs visuo-tactiles pour extraire, à environ 12 Hz, trois métriques image : l'intensité de cisaillement (Sy), l'intensité de contact (Fn) et le centre de pression (C), pilotant en parallèle la suppression du glissement, le relâchement adaptatif au poids et la protection contre les surcharges de force. La calibration est entièrement automatique : les seuils de contrôle sont dérivés du bruit intrinsèque des capteurs via un court protocole de maintien statique et déchargement, sans modèles physiques spécifiques aux matériaux ni réglage manuel par essais-erreurs. Les résultats sont nets : en tests d'ablation sur déformation de contenant, le système complet atteint 5/5 succès contre au maximum 1/5 pour les configurations partielles ; sur une tâche de versement dynamique, les approches à effort fixe échouent 10 fois sur 10, contre 9/10 pour TactileReflex sur deux volumes d'eau distincts.

La difficulté de saisir un gobelet plastique tient à une marge de force extrêmement étroite : trop peu de pression entraîne le glissement, trop la déforme irrémédiablement. C'est un angle mort récurrent des politiques VLA (vision-language-action) et de la téléopération sans retour haptique, qui opèrent à l'aveugle face aux variations de rigidité et de poids des objets manipulés. TactileReflex est présenté comme une couche de sécurité "plug-and-play" pouvant s'intercaler sous tout pipeline de manipulation haut niveau. L'absence de calibration externe et l'interprétabilité du contrôleur réduisent le coût d'intégration, un argument concret pour les intégrateurs déployant des bras robotiques polyvalents sur des lignes incluant des produits fragiles ou déformables.

Les capteurs visuo-tactiles de type GelSight ou DIGIT permettent depuis plusieurs années d'imager le contact à l'échelle millimétrique, mais leur intégration dans des boucles de contrôle temps réel avec des seuils fiables reste un défi ouvert. Dans la course actuelle à la manipulation généraliste, Figure AI, Physical Intelligence (Pi-0) et Google DeepMind (RT-2) travaillent principalement avec des objets rigides aux marges de force confortables, laissant la manipulation déformable en marge des grandes démonstrations. L'article reste un preprint non évalué par les pairs, sans affiliation institutionnelle clairement identifiée ni partenaire industriel ni timeline de déploiement annoncés. Sa compatibilité revendiquée avec les pipelines VLA et la téléopération VR ouvre néanmoins une voie vers les frameworks de collecte de données robotiques, un terrain où des acteurs européens comme Enchanted Tools (France) sont actifs.

À lire aussi

TAO-Force : unifier perception sensible à la force et contrôle rapide-lent pour la manipulation à contacts riches
1arXiv cs.RO 

TAO-Force : unifier perception sensible à la force et contrôle rapide-lent pour la manipulation à contacts riches

TAO-Force, présenté dans un papier de recherche publié sur arXiv en septembre 2026 (arXiv:2609.18497v1), s'attaque aux limites des modèles Vision-Language-Action (VLA) pour la manipulation robotique riche en contact, comme l'insertion de pièces ou l'assemblage fin. Le système ajoute une perception sensible à la force via F-FiLM (Force-conditioned Feature-wise Linear Modulation), un module qui injecte un retour de force encodé dans les représentations d'un backbone vision-langage pré-entraîné et gelé, sans altérer ses connaissances sémantiques. Côté contrôle, une architecture "fast-slow" déclenchée par la détection de contact fait alterner une branche lente en position, qui suit la trajectoire nominale hors contact, et une branche rapide en admittance, qui régule l'interaction physique dès le contact. L'approche est validée par une tâche dédiée de perception de force et par des essais réels sur quatre tâches de manipulation riches en contact ; l'abstract ne précise ni taux de réussite chiffrés, ni plateforme robotique, ni affiliation des auteurs. Le travail cible un angle mort documenté des VLA génériques actuels, de Pi-0 à Helix : leur perception, essentiellement visuelle, détecte mal l'amorce et l'intensité d'un contact, et leur exécution en boucle de position ne s'adapte pas en temps réel aux dynamiques de contact qui évoluent vite, ce qui cantonne ces modèles à la préhension grossière plutôt qu'aux gestes fins comme l'insertion de connecteurs. Pour les intégrateurs et les équipes robotique industrielles, l'intérêt tient à la méthode : injecter un retour de force dans un backbone VLA gelé, sans réentraîner tout le modèle, offre une adaptation moins coûteuse, dans un secteur où l'écart entre démonstrations léchées et fiabilité en usine reste le principal frein à l'adoption de politiques génériques de manipulation. TAO-Force s'inscrit dans une tendance de recherche plus large consistant à ajouter des capteurs de force et de couple aux politiques de manipulation. Ces politiques, entraînées surtout sur des flux caméra, sont ici adaptées via un backbone gelé plutôt que par un réentraînement complet. Publié sur arXiv sans revue par les pairs et sans partenaire industriel ni calendrier de déploiement annoncés, le travail devra être reproduit par d'autres laboratoires avant toute intégration dans des piles logicielles pour bras industriels ou mains de robots humanoïdes.

RecherchePaper
1 source
Rêver le son du contact : générer vidéo et audio pour la manipulation sensible à la force en zero-shot
2arXiv cs.RO 

Rêver le son du contact : générer vidéo et audio pour la manipulation sensible à la force en zero-shot

Un article déposé sur arXiv (référence 2609.19137, catégorie "new") début septembre 2026, intitulé "Dreaming the Sound of Contact", décrit une méthode pour doter les robots manipulateurs d'une perception de la force lors de tâches de contact. Les modèles de génération vidéo utilisés pour apprendre des trajectoires de manipulation ne produisent que des mouvements cinématiques, sans information de force, et échouent donc dès qu'un contact adéquat est requis pour réussir la tâche. Les auteurs augmentent la vidéo générée avec de l'audio: le volume des sons de contact synthétisés façonne un profil de force désirée, borné et variable dans le temps, dérivé conjointement avec la trajectoire à partir d'un simple prompt textuel structuré. Exécutées sur un bras Franka Panda via un régulateur de force en boucle fermée qui suit ce profil audio pendant le contact, ces trajectoires réussissent plusieurs tâches là où une base purement cinématique échoue, sans qu'un taux de réussite chiffré ne soit précisé dans le résumé. Le pipeline sert aussi de générateur de données pour entraîner des politiques exécutant ces tâches en boucle fermée, avec code, vidéos et jeu de données promis sur dreamingcontactsound.github.io. Le travail cible un angle mort des approches génératives aujourd'hui dominantes en manipulation robotique, notamment les modèles vision-langage-action qui imitent des mouvements visuellement plausibles mais ignorent la dynamique de contact, pourtant indispensable pour pousser, essuyer, visser ou insérer une pièce. Montrer qu'un signal audio généré, et non mesuré par un capteur réel, peut suffire à façonner une consigne de force exploitable en boucle fermée ouvre une piste peu coûteuse pour réduire l'écart entre démonstration vidéo et exécution physique réelle. Pour les intégrateurs et les équipes de R&D en manipulation industrielle, l'intérêt est double: moins dépendre de démonstrations réelles coûteuses à collecter, et étendre le champ des politiques apprises par vidéo, aujourd'hui cantonnées aux tâches sans contact critique, vers l'assemblage ou la manipulation fine. Cette méthode s'inscrit dans une lignée de recherches qui exploitent la génération vidéo comme source de trajectoires de manipulation robotique, une alternative à la téléopération ou à l'apprentissage par renforcement en simulation pour collecter des données d'entraînement. L'absence de force dans ces trajectoires générées, et l'échec conséquent sur les tâches à contact riche, est une limite connue depuis l'essor des architectures vision-langage-action à grande échelle. Le choix du bras Franka Panda, plateforme standard des laboratoires de recherche en manipulation, situe ce travail au stade de validation expérimentale plutôt que de déploiement industriel: aucun partenariat commercial, licence ou calendrier de mise en production n'est mentionné. Les seules suites annoncées sont la mise à disposition du code, des vidéos et du jeu de données sur le site du projet, ouvrant la voie à une réplication par la communauté robotique.

RecherchePaper
1 source
Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet
3arXiv cs.RO 

Manipulation Tactile et Visuelle Centrée sur le Contact pour la Manipulation du Bras Complet

Des chercheurs du laboratoire EMPRISE de l'université Cornell présentent TACTIC (Tactile and Vision Conditioned Contact-Centric Control), un contrôleur pour la manipulation "bras entier", où le robot touche l'environnement avec plusieurs segments de son bras et non plus seulement sa pince. Décrit dans un preprint arXiv (2607.09218), le système combine images RGB-D, capteurs tactiles distribués et une carte de proximité 2D compacte pour prédire comment les contacts se forment, glissent ou se rompent au fil du mouvement. Un modèle de dynamique appris est couplé aux jacobiennes de contact pour simuler à l'avance forces d'interaction et configurations futures, et alimente un planificateur prédictif (MPC) à échantillonnage dont les trajectoires candidates sont orientées vers des directions qui modulent les forces plutôt que de les subir. En simulation, TACTIC dépasse les méthodes de référence à base de modèle et les approches purement apprises. Sur un bras réel équipé de peau tactile, l'équipe démontre trois tâches multi-contacts : retourner et repositionner un mannequin, et atteindre un objectif dans un labyrinthe 3D dynamique. La manipulation bras entier est un angle mort des pipelines d'apprentissage actuels, taillés pour un contact unique au niveau de la pince. Dès que plusieurs segments touchent l'environnement simultanément, mouvement et forces de contact deviennent étroitement couplés, l'état de contact reste partiellement caché sous occlusion, et les politiques purement apprises se désynchronisent physiquement hors distribution, faute de données sur les configurations multi-contacts. En hybridant apprentissage et modèle physique explicite, TACTIC illustre une tendance de fond en robotique de manipulation : combiner du model-based pour la garantie physique et de l'apprenant pour la perception, plutôt que tout confier à un modèle de bout en bout type VLA. Pour les intégrateurs visant des bras opérant en espace encombré (tri, logistique, désassemblage), c'est un manque réel comblé, la plupart des démonstrateurs actuels évitant soigneusement tout contact hors pince. Le travail émane du laboratoire EMPRISE de Cornell, spécialisé en manipulation riche en contact et perception tactile, et s'inscrit dans une littérature plus large sur le contrôle prédictif informé par le contact, aux côtés de recherches comparables au MIT ou à CMU. Contrairement aux annonces commerciales de robots humanoïdes comme Figure, Optimus ou les modèles VLA de Physical Intelligence et NVIDIA, il s'agit ici d'un résultat académique validé en simulation puis sur un unique bras de laboratoire, pas d'un produit commercialisé. Aucun acteur français ou européen n'est associé à cette publication. Les auteurs mettent en ligne une page projet (emprise.cs.cornell.edu/tactic) sans calendrier annoncé de transfert vers des plateformes commerciales.

RecherchePaper
1 source
ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
4arXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques. Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final. Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

RecherchePaper
1 source