VisForce : ancrage visuel des forces actuelles et souhaitées pour la manipulation dextérique orientée objectif
Des chercheurs présentent VisForce, une méthode qui ancre visuellement les forces de contact, actuelles et désirées, directement sur les positions des doigts d'une main robotique pour des modèles Vision-Language-Action (VLA) appliqués à la manipulation dextre. Plutôt que de fournir la force comme un vecteur d'état séparé, comme le font la plupart des architectures VLA actuelles, VisForce superpose des indices visuels de force sur l'image du poignet en temps réel et sur une image objectif propre à la tâche, puis fusionne ces deux flux via un mécanisme d'attention croisée conditionnée par objectif pour produire des actions tenant compte de la force. La méthode a été testée sur un robot réel UR10 équipé d'une main dextre RH56F1, à travers une tâche de préhension conditionnée par la force et trois tâches de manipulation multi-étapes. Lors des essais de préhension, le système a montré une réponse de force proportionnelle à la force désirée, avec des taux de réussite de saisie-et-levage de 70% pour un œuf et 80% pour un tube de dentifrice. Sur les tâches multi-étapes, les taux de réussite finaux atteignent 70% pour l'insertion d'une tasse et le versement d'une bouteille, 55% pour le transfert de pain à l'aide de pinces, et 40% pour une insertion de cheville avec gestion du glissement. L'article, publié en préimpression sur arXiv (référence 2609.25785), reste un résultat expérimental en environnement contrôlé, sans indication de laboratoire d'origine ni de volume de déploiement.
Ce travail cible une limite concrète des modèles VLA appliqués à la manipulation dextre: la force de contact, essentielle pour saisir un objet fragile ou verser un liquide sans le renverser, est aujourd'hui traitée comme une donnée numérique déconnectée de l'image, ce qui complique l'apprentissage d'une correspondance spatiale entre où toucher et avec quelle force. En rendant la force visible et localisée sur l'image, VisForce permet au modèle de traiter force et vision dans un même espace de représentation, une piste qui pourrait intéresser les intégrateurs travaillant sur la préhension d'objets déformables ou fragiles, en logistique, agroalimentaire ou pharmaceutique. L'écart de performance entre tâches, de 80% pour une saisie simple à 40% pour un assemblage nécessitant une gestion fine du glissement, rappelle aussi que la manipulation dextre conditionnée par VLA progresse mais reste loin d'une fiabilité industrielle sur les tâches de contact complexes.
Cette contribution s'inscrit dans le courant de recherche VLA qui cherche à faire piloter bras et mains robotiques par des politiques génératives entraînées sur vision et langage, mais qui traitent généralement les capteurs de force comme une modalité annexe plutôt qu'un signal ancré spatialement dans l'image. VisForce ne revendique aucun déploiement ni partenariat industriel: il s'agit d'une preuve de concept académique, validée sur un seul bras UR10 et une seule main dextre commerciale, sans comparaison chiffrée rapportée face à d'autres méthodes de conditionnement par la force. Les auteurs présentent ces résultats comme une validation de principe, sans calendrier annoncé pour une généralisation à d'autres mains robotiques ou d'autres tâches.
Dans nos dossiers




