Aller au contenu principal
ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
RecherchearXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques.

Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final.

Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

À lire aussi

Dépoussiérer la manipulation dextérique : une recette minimaliste d'apprentissage par renforcement guidé par retargeting
1arXiv cs.RO 

Dépoussiérer la manipulation dextérique : une recette minimaliste d'apprentissage par renforcement guidé par retargeting

Des chercheurs ont publié REGRIND, un pipeline d'apprentissage par renforcement guidé par retargeting qui permet à des mains robotiques multi-doigts d'apprendre des tâches de manipulation dextre à partir d'une seule démonstration humaine. La méthode retranscrit le mouvement main-objet d'un humain vers une référence robotique qui préserve les relations spatiales et de contact entre la main et l'objet, puis entraîne une politique RL résiduelle en simulation pour suivre des points-clés centrés sur l'objet le long de cette référence. La politique obtenue est ensuite transférée directement sur le matériel physique, sans réentraînement, moyennant une identification système soignée des paramètres du robot. Testée sur deux mains robotiques multi-doigts différentes, l'approche produit des comportements fluides et proches du geste humain sur des tâches riches en contacts et en usage d'outils, notamment manier une paire de ciseaux et faire tourner un tournevis. Les travaux sont publiés sur arXiv (2607.11874), avec vidéos et code disponibles en ligne. L'intérêt de ce résultat tient à la difficulté propre de la manipulation dextre par rapport au contrôle locomoteur des humanoïdes, où la recette retargeting-puis-RL avait déjà fait ses preuves. Manipuler des objets suppose de réguler finement les modes de contact et les forces appliquées, un problème nettement plus contraignant que suivre une trajectoire de marche. En montrant qu'une seule démonstration humaine suffit à entraîner une politique transférable au réel, REGRIND propose une alternative frugale en données face aux approches dominantes du secteur, qui s'appuient sur de larges modèles vision-langage-action entraînés sur des volumes massifs de téléopération. Pour les équipes développant des mains robotiques destinées à des tâches d'usage d'outils, industrielles ou domestiques, cela ouvre une voie moins coûteuse en collecte de données pour atteindre un comportement dextre exploitable. L'étude s'inscrit dans la continuité des travaux récents sur le contrôle corps-entier des humanoïdes, où retargeting de mouvement humain et suivi par RL sont devenus une recette standard, mais que les auteurs jugent insuffisamment validée pour la manipulation contact-riche. Au-delà de la démonstration technique, les chercheurs ont mené des expériences matérielles systématiques pour identifier les facteurs qui déterminent la réussite du transfert simulation-vers-réel, en tirant des recommandations pratiques pour quiconque veut appliquer ce type d'apprentissage par retargeting à des scénarios de contact. Le code et les vidéos publiés doivent permettre à la communauté de reproduire et d'étendre ces résultats.

RecherchePaper
1 source
HACo : apprendre la compliance haptique active pour une manipulation dextérique sensible aux forces
2arXiv cs.RO 

HACo : apprendre la compliance haptique active pour une manipulation dextérique sensible aux forces

Des chercheurs présentent HACo (Haptic Active Compliance), une politique de manipulation dextre qui apprend à réguler les forces de contact directement à partir de retours haptiques. Le système combine deux sources de signal habituellement traitées séparément : les réponses tactiles locales des bouts de doigts et les couples articulaires, qui renseignent sur la transmission des charges à travers toute la main articulée, y compris pour les contacts hors de la zone couverte par les capteurs tactiles. Côté données, une téléopération à conformité régulée convertit les commandes de l'opérateur en actions compliantes exécutables par le contrôleur, qui conservent l'intention de mouvement tout en limitant les efforts. HACo apprend ces actions directement, en utilisant l'écart entre commande et état comme supervision auxiliaire de l'intention compliante. Un module de « Compliance Grounding » s'appuie sur une attention croisée haptique à portes (gated cross-attention) pour ancrer la génération d'actions dans l'état haptique courant, sans modélisation explicite du contact en ligne. Le banc d'essai réel couvre la friction multi-contact, l'interaction tangentielle, le contact fragile sur surface courbe, le couple de rotation et les objets déformables. Sur 20 essais par tâche, HACo atteint 83 % de réussite moyenne, contre 35 % pour la meilleure base de comparaison évaluée. L'écart est net, mais il porte sur un protocole de 20 essais par tâche, soit une marge d'incertitude non négligeable sur chaque score individuel. Le résultat reste significatif pour l'industrie : les politiques visuo-motrices actuelles, y compris les VLA, échouent souvent dès que la tâche exige de doser l'effort plutôt que de simplement atteindre une pose. Les cibles d'action habituelles posent deux problèmes. Soit elles encodent des charges excessives, soit elles omettent le mouvement contraint par l'objet. HACo suggère que la conformité peut être apprise de bout en bout plutôt que déléguée à un contrôleur d'impédance réglé à la main. Pour les intégrateurs travaillant sur l'assemblage, la manipulation d'objets fragiles ou déformables, c'est un axe de recherche à suivre. Le papier ne précise toutefois pas ici la main utilisée, le coût des capteurs, ni la généralisation à des objets ou des scènes non vus, et il ne s'agit pas d'un produit. Ce travail s'inscrit dans la montée de la manipulation dextre guidée par le toucher, après une période dominée par la vision et le langage, où les jeux de données de téléopération ne contiennent que des positions cibles. Il s'agit d'une prépublication arXiv (v1) : elle n'a pas été évaluée par des pairs, et aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les acteurs de l'humanoïde, dont Figure, Tesla ou Sanctuary, ont besoin de mains dotées de retour tactile, mais publient peu de détails sur la régulation de force. La suite logique sera la comparaison avec d'autres politiques tactiles sur des plateformes différentes, et la vérification que le gain de 83 % contre 35 % se maintient hors du benchmark des auteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ForceBand : apprentissage de la manipulation de force par sEMG
3arXiv cs.RO 

ForceBand : apprentissage de la manipulation de force par sEMG

Une équipe de chercheurs a présenté ForceBand, un bracelet sEMG (électromyographie de surface) porté au poignet et conçu pour enrichir les démonstrations humaines destinées à l'apprentissage de politiques de manipulation robotique. Le système capture l'activité musculaire du poignet via des électrodes de surface et, combiné à une IMU, alimente un modèle pré-entraîné baptisé EMG2Force qui prédit les forces exercées par chaque doigt. Pour entraîner ce modèle, les chercheurs ont constitué un jeu de données multimodal de 10 heures combinant vidéo égocentrique, signaux sEMG, données inertielles et mesures de forces au bout des doigts, couvrant des actions et objets variés. Après une courte calibration propre à l'utilisateur, celui-ci peut collecter de nouvelles démonstrations avec seulement le bracelet et une caméra : EMG2Force étiquette automatiquement ces séquences avec les traces de force par doigt. Les expériences rapportent une réduction d'erreur de prédiction de force supérieure à 50 % par rapport aux baselines fondées uniquement sur la vision, et un taux de succès de 87 % sur des tâches de saisie, compression et dépose impliquant des objets de formes, tailles et poids variés. L'apport clé de ForceBand réside dans la résolution d'un angle mort structurel des pipelines d'imitation learning : les sources courantes de démonstrations humaines, capture de mouvement ou vidéos internet, fournissent trajectoire et apparence mais ignorent les forces de contact, pourtant déterminantes pour toute manipulation sensible au toucher. Serrer un emballage souple sans l'écraser, insérer un connecteur, manipuler des objets fragiles ou déformables sont des tâches où le contrôle en effort prime sur le contrôle en position. En rendant ces forces observables à faible coût matériel, le système ouvre la voie à des politiques VLA (vision-language-action) capables de généraliser sur des propriétés mécaniques d'objets non vus, sans capteurs de force onéreux montés sur le robot. Ce travail s'inscrit dans une dynamique active autour de l'augmentation des données de démonstration : plusieurs laboratoires explorent des gants haptiques, des capteurs tactiles intégrés aux mains robotiques ou des méthodes de reconstruction de force par vision stéréo. ForceBand se positionne comme une alternative légère et bon marché, accessible sans infrastructure de motion capture. L'article est pour l'instant un preprint arXiv (2606.26093), non encore soumis à une conférence majeure, et les résultats reposent sur un protocole contrôlé en laboratoire. La robustesse au bruit musculaire inter-sujets, à la fatigue et aux variations de placement du bracelet en conditions industrielles reste à démontrer. Les prochaines étapes naturelles impliqueront des tests sur des robots à mains dextrères (dexterous hands) et une validation sur des tâches d'assemblage réelles, là où la complémentarité avec des plateformes comme les mains Allegro ou Shadow est la plus directe.

RecherchePaper
1 source
RealDexUMI : interface portable universelle pour l'apprentissage de la manipulation dextérique
4arXiv cs.RO 

RealDexUMI : interface portable universelle pour l'apprentissage de la manipulation dextérique

RealDexUMI est une interface de téléopération portable présentée en juin 2026 par des chercheurs de BeingBeyond dans un preprint arXiv (arXiv:2606.06033). Le dispositif repose sur un module d'effecteur terminal partagé combinant une main robotique légère, une caméra embarquée dans la paume et des capteurs tactiles au bout des doigts. Un gant isomorphe porté par l'opérateur humain traduit les mouvements des doigts en commandes articulaires directes sur la main robotique, sans retargeting ni conversion d'incarnation. Le système a été évalué sur huit tâches réelles couvrant des manipulations fines, riches en contacts, à longue durée et bimanuelles, obtenant un taux de succès moyen de 88,75%. Les politiques apprises se généralisent à des poses initiales non vues lors de l'entraînement et ont été transférées vers trois morphologies de robots différentes. Le verrou que RealDexUMI cherche à lever est connu dans le secteur sous le nom de "collection-to-deployment gap". Les pipelines classiques de collecte de données pour la manipulation dextre font face à un dilemme : la motion capture ou les gants souples permettent une collecte rapide mais nécessitent un retargeting qui dégrade la fidélité des contacts, tandis que la téléopération robot-spécifique préserve cette fidélité mais reste onéreuse et difficile à passer à l'échelle. RealDexUMI propose un troisième chemin via un effecteur "zéro-gap" : les observations (images embarquées, signaux tactiles, contacts, commandes articulaires) sont identiques entre collecte et déploiement, supprimant le biais d'observation qui dégrade souvent les politiques d'imitation. Un taux de 88,75% sur des tâches bimanuelles longue durée est significatif si les conditions expérimentales sont représentatives, bien que le preprint ne détaille pas encore la distribution des tentatives par tâche ni les protocoles de randomisation des scènes. La question de l'interface universelle de manipulation dextre est activement travaillée depuis plusieurs années, notamment depuis les travaux UMI de Columbia University (2023-2024), qui instrumentaient une spatule pour des robots standard. RealDexUMI étend ce paradigme aux mains multi-doigts, terrain nettement plus difficile. La démarche entre en compétition directe avec des approches comme ALOHA 2 et ACT de Carnegie Mellon, les systèmes de DexHand Research, ou les plateformes bimanuelle d'Apptronik et Agility Robotics. En Europe, des équipes de l'ISIR à Sorbonne Université et du DLR en Allemagne travaillent sur des thématiques proches de capture et transfert de manipulation dextre. BeingBeyond reste discret sur son positionnement commercial et ses partenaires industriels : la prochaine étape naturelle serait une validation dans des environnements non structurés ou une intégration sur des plateformes humanoïdes commerciales comme Figure 03, Unitree G1 ou Fourier GR-1, où la manipulation dextre demeure le principal goulot d'étranglement.

UELes équipes européennes de manipulation dextre (ISIR/Sorbonne, DLR) pourraient intégrer l'approche zéro-gap de RealDexUMI pour accélérer leurs pipelines de collecte de données sans retargeting.

RechercheOpinion
1 source