Aller au contenu principal
RecherchearXiv cs.RO 

VisForce : ancrage visuel des forces actuelles et souhaitées pour la manipulation dextérique orientée objectif

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent VisForce, une méthode qui ancre visuellement les forces de contact, actuelles et désirées, directement sur les positions des doigts d'une main robotique pour des modèles Vision-Language-Action (VLA) appliqués à la manipulation dextre. Plutôt que de fournir la force comme un vecteur d'état séparé, comme le font la plupart des architectures VLA actuelles, VisForce superpose des indices visuels de force sur l'image du poignet en temps réel et sur une image objectif propre à la tâche, puis fusionne ces deux flux via un mécanisme d'attention croisée conditionnée par objectif pour produire des actions tenant compte de la force. La méthode a été testée sur un robot réel UR10 équipé d'une main dextre RH56F1, à travers une tâche de préhension conditionnée par la force et trois tâches de manipulation multi-étapes. Lors des essais de préhension, le système a montré une réponse de force proportionnelle à la force désirée, avec des taux de réussite de saisie-et-levage de 70% pour un œuf et 80% pour un tube de dentifrice. Sur les tâches multi-étapes, les taux de réussite finaux atteignent 70% pour l'insertion d'une tasse et le versement d'une bouteille, 55% pour le transfert de pain à l'aide de pinces, et 40% pour une insertion de cheville avec gestion du glissement. L'article, publié en préimpression sur arXiv (référence 2609.25785), reste un résultat expérimental en environnement contrôlé, sans indication de laboratoire d'origine ni de volume de déploiement.

Ce travail cible une limite concrète des modèles VLA appliqués à la manipulation dextre: la force de contact, essentielle pour saisir un objet fragile ou verser un liquide sans le renverser, est aujourd'hui traitée comme une donnée numérique déconnectée de l'image, ce qui complique l'apprentissage d'une correspondance spatiale entre où toucher et avec quelle force. En rendant la force visible et localisée sur l'image, VisForce permet au modèle de traiter force et vision dans un même espace de représentation, une piste qui pourrait intéresser les intégrateurs travaillant sur la préhension d'objets déformables ou fragiles, en logistique, agroalimentaire ou pharmaceutique. L'écart de performance entre tâches, de 80% pour une saisie simple à 40% pour un assemblage nécessitant une gestion fine du glissement, rappelle aussi que la manipulation dextre conditionnée par VLA progresse mais reste loin d'une fiabilité industrielle sur les tâches de contact complexes.

Cette contribution s'inscrit dans le courant de recherche VLA qui cherche à faire piloter bras et mains robotiques par des politiques génératives entraînées sur vision et langage, mais qui traitent généralement les capteurs de force comme une modalité annexe plutôt qu'un signal ancré spatialement dans l'image. VisForce ne revendique aucun déploiement ni partenariat industriel: il s'agit d'une preuve de concept académique, validée sur un seul bras UR10 et une seule main dextre commerciale, sans comparaison chiffrée rapportée face à d'autres méthodes de conditionnement par la force. Les auteurs présentent ces résultats comme une validation de principe, sans calendrier annoncé pour une généralisation à d'autres mains robotiques ou d'autres tâches.

Dans nos dossiers

À lire aussi

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique
1arXiv cs.RO 

DexTacWAM : un modèle visuo-tactile du monde et de l'action pour la manipulation dextérique

Un article déposé sur arXiv en septembre 2026 (arXiv:2609.24976v1) présente DexTacWAM, un World-Action Model (WAM) visuo-tactile pour la manipulation dextre, qui encode indépendamment chaque bout de doigt et injecte l'information tactile, via un compresseur sensible au doigt et à sa pose, dans un modèle du monde fondé sur la diffusion vidéo. Testé sur six tâches de manipulation à fort contact sur une plateforme bimanuelle à 22 degrés de liberté, DexTacWAM obtient le meilleur score sur toutes, avec une moyenne de 70,6 points contre 38,0 pour le meilleur système de référence, sur une échelle non précisée par les auteurs. Une étude d'ablation montre que retirer la modélisation tactile du monde, tout en gardant les mêmes caractéristiques tactiles et le même module d'action, fait chuter la moyenne sur quatre tâches de 74,7 à 26,6 points. Avec un encodeur vidéo pré-entraîné gelé, quatre heures d'adaptation de l'encodeur tactile et une centaine de démonstrations par tâche suffisent pour une qualité de prédiction visuelle à moins de 0,5 dB du niveau purement visuel, un rappel de contact conservé à 89,4% après compression, un entraînement 2,26 fois plus rapide et une inférence 1,29 fois plus rapide. Ce résultat cible une limite connue des WAM actuels, généralement centrés sur la vision et donc incapables de modéliser directement la dynamique de contact, pourtant déterminante en manipulation fine. L'étude montre que le gain provient surtout du fait de traiter l'évolution du contact comme une composante de l'état du monde prédit, plutôt que d'un simple conditionnement des actions sur des données tactiles. Pour les intégrateurs et les équipes de recherche en robotique dextre, l'intérêt pratique tient à l'efficacité: étendre un grand modèle vidéo déjà entraîné au sens du toucher avec un budget de données et de calcul réduit, sans tout ré-entraîner. Le travail s'inscrit dans la lignée des World-Action Models, qui couplent modélisation vidéo prédictive et génération d'action pour anticiper les effets des mouvements d'un robot, jusqu'ici presque exclusivement visuels. Il s'agit à ce stade d'un article de recherche, sans identification des auteurs ni annonce de partenariat industriel, de plateforme commerciale ou de calendrier de déploiement. La suite logique, non détaillée dans l'article, consisterait à valider l'approche sur davantage de tâches et de plateformes, voire sur des mains dextres commerciales, avant toute intégration dans des systèmes de manipulation opérationnels.

RechercheActu
1 source
ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
2arXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques. Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final. Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

RecherchePaper
1 source
TacSushi : modélisation monde-action ancrée dans le tactile pour la manipulation dextérique de sushis
3arXiv cs.RO 

TacSushi : modélisation monde-action ancrée dans le tactile pour la manipulation dextérique de sushis

Une équipe de recherche présente TacSushi, une politique robotique world-action ancrée dans le toucher, bâtie sur un modèle de monde Cosmos3, destinée à la manipulation dextre d'aliments déformables comme le sushi. Le système encode l'image RGB courante, une consigne en langage naturel et l'état de la main, puis fusionne par un mécanisme de gating feature-wise les signaux tactiles des bouts de doigts dans la représentation d'action ; pendant l'entraînement seulement, un décodeur conditionné par les segments d'action démontrés prédit les observations visuelles futures, la progression de la tâche et le risque de contact, avant d'être retiré au déploiement. Entraîné sur 340 essais réussis et 50 essais échoués sur robot réel, TacSushi a été testé sur 600 rollouts couvrant trois tâches en distribution et deux variantes d'ingrédients hors distribution, la qualité du plat final étant jugée par un protocole mêlant à parts égales cinq notations humaines et trois notations de modèles vision-langage. Résultat : 68,3% de réussite moyenne en distribution et 37,5% hors distribution, contre 36,7%/10,0% sans la supervision par conséquences futures et 25,0%/17,5% avec une simple concaténation tactile au lieu de la fusion gated. Ces chiffres valident surtout deux choix d'architecture plutôt qu'une performance spectaculaire : la fusion tactile gated par caractéristique apporte un gain net face à une concaténation brute, et la supervision prédictive, entraînée mais jamais exécutée en production, améliore la généralisation sans coût au déploiement. Pour les équipes de manipulation dextre et les intégrateurs, l'écart entre réussite en distribution et hors distribution illustre une nouvelle fois le fossé persistant entre démonstration contrôlée et généralisation réelle des politiques vision-langage-action, un problème que le secteur peine encore à résoudre malgré les annonces. Évaluer la qualité perçue de l'aliment via des juges humains et des modèles vision-langage, plutôt qu'un seuil géométrique binaire, répond aussi à une limite méthodologique connue des benchmarks de manipulation alimentaire, où texture et présentation comptent autant que le succès du geste. TacSushi s'inscrit dans la lignée des politiques robotiques bâties sur des backbones de modèles de monde ou vision-langage-action, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, mais cible un terrain nettement moins couvert, la manipulation d'aliments fragiles, plutôt que la préhension d'objets rigides. Publié en prépublication sur arXiv sans affiliation industrielle mentionnée, le travail reste une évaluation de laboratoire sur rollouts contrôlés, sans partenaire commercial ni calendrier de déploiement annoncés, et son jeu d'entraînement de 340 démonstrations réussies pour seulement 50 échecs demeure modeste au regard des efforts de VLA à grande échelle menés par les grands laboratoires. La suite logique, non précisée par les auteurs, consisterait à élargir les tâches culinaires et les variantes d'ingrédients testées pour vérifier si les gains observés hors distribution résistent à une variabilité alimentaire encore plus large.

RecherchePaper
1 source
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
4arXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée. L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées. L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source