Aller au contenu principal
RecherchearXiv cs.RO 

HACo : apprendre la compliance haptique active pour une manipulation dextérique sensible aux forces

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HACo (Haptic Active Compliance), une politique de manipulation dextre qui apprend à réguler les forces de contact directement à partir de retours haptiques. Le système combine deux sources de signal habituellement traitées séparément : les réponses tactiles locales des bouts de doigts et les couples articulaires, qui renseignent sur la transmission des charges à travers toute la main articulée, y compris pour les contacts hors de la zone couverte par les capteurs tactiles. Côté données, une téléopération à conformité régulée convertit les commandes de l'opérateur en actions compliantes exécutables par le contrôleur, qui conservent l'intention de mouvement tout en limitant les efforts. HACo apprend ces actions directement, en utilisant l'écart entre commande et état comme supervision auxiliaire de l'intention compliante. Un module de « Compliance Grounding » s'appuie sur une attention croisée haptique à portes (gated cross-attention) pour ancrer la génération d'actions dans l'état haptique courant, sans modélisation explicite du contact en ligne. Le banc d'essai réel couvre la friction multi-contact, l'interaction tangentielle, le contact fragile sur surface courbe, le couple de rotation et les objets déformables. Sur 20 essais par tâche, HACo atteint 83 % de réussite moyenne, contre 35 % pour la meilleure base de comparaison évaluée.

L'écart est net, mais il porte sur un protocole de 20 essais par tâche, soit une marge d'incertitude non négligeable sur chaque score individuel. Le résultat reste significatif pour l'industrie : les politiques visuo-motrices actuelles, y compris les VLA, échouent souvent dès que la tâche exige de doser l'effort plutôt que de simplement atteindre une pose. Les cibles d'action habituelles posent deux problèmes. Soit elles encodent des charges excessives, soit elles omettent le mouvement contraint par l'objet. HACo suggère que la conformité peut être apprise de bout en bout plutôt que déléguée à un contrôleur d'impédance réglé à la main. Pour les intégrateurs travaillant sur l'assemblage, la manipulation d'objets fragiles ou déformables, c'est un axe de recherche à suivre. Le papier ne précise toutefois pas ici la main utilisée, le coût des capteurs, ni la généralisation à des objets ou des scènes non vus, et il ne s'agit pas d'un produit.

Ce travail s'inscrit dans la montée de la manipulation dextre guidée par le toucher, après une période dominée par la vision et le langage, où les jeux de données de téléopération ne contiennent que des positions cibles. Il s'agit d'une prépublication arXiv (v1) : elle n'a pas été évaluée par des pairs, et aucun déploiement industriel ni calendrier de transfert n'est annoncé. Les acteurs de l'humanoïde, dont Figure, Tesla ou Sanctuary, ont besoin de mains dotées de retour tactile, mais publient peu de détails sur la régulation de force. La suite logique sera la comparaison avec d'autres politiques tactiles sur des plateformes différentes, et la vérification que le gain de 83 % contre 35 % se maintient hors du benchmark des auteurs.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique
1arXiv cs.RO 

ReForce : apprentissage du retargeting sensible à la force pour la manipulation dextérique

Une équipe de recherche a publié le 18 août 2026 sur arXiv (référence 2608.15560v1) une méthode baptisée ReForce, conçue pour la manipulation dextre par robot à partir de démonstrations humaines. Le problème visé est le suivant: les pipelines de retargeting (transfert des mouvements humains vers un bras ou une main robotique) restent aujourd'hui essentiellement cinématiques, c'est-à-dire qu'ils copient les trajectoires et postures sans tenir compte des forces de contact, alors que ce sont ces forces qui déterminent la réussite ou l'échec d'une prise en main. ReForce ajoute un résidu de force au-dessus du mouvement retargeté classiquement, calculé par un "force tracker" générique entraîné sur un grand volume d'interactions simulées. La méthode fonctionne en deux modes: téléopération en ligne avec retour de force, et traduction hors ligne de jeux de données de démonstration déjà enregistrés. Les tests, menés à la fois en simulation et sur du matériel réel, portent sur des tâches réputées difficiles car riches en contacts fins: la saisie d'un gobelet en papier et la manipulation de pinces (tongs). Les auteurs rapportent une erreur de suivi de force réduite et un engagement multi-doigts plus stable que les approches purement cinématiques. Pour l'industrie robotique, l'enjeu dépasse le simple gain de précision: la collecte de démonstrations humaines à grande échelle est devenue le principal levier pour entraîner des politiques de manipulation dextre, y compris pour les modèles vision-langage-action. Si le retargeting cinématique ignore la force, les données transmises aux modèles encodent des gestes visuellement corrects mais mécaniquement approximatifs, ce qui explique en partie pourquoi certaines démonstrations impressionnantes en vidéo échouent lors d'un déploiement réel sur objets fragiles, déformables ou glissants. En introduisant un modèle de force générique et transférable, ReForce propose une brique technique susceptible d'améliorer la qualité des jeux de données de téléopération en amont, plutôt que de complexifier uniquement le modèle final. Il s'agit d'une contribution académique en preprint, sans entreprise ni produit commercial associé, à distinguer des annonces de Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix), qui portent sur des modèles de bout en bout déployés ou pilotés en conditions réelles. ReForce se positionne en amont de ces systèmes, sur la brique de collecte et de conversion de données de démonstration. L'abstract ne mentionne ni publication de code, ni jeu de données ouvert, ni calendrier de déploiement industriel: les deux tâches testées, prise de gobelet et manipulation de pinces, servent de preuve de concept plutôt que de benchmark étendu, la validation à plus grande échelle restant à faire.

RecherchePaper
1 source
Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)
2arXiv cs.RO 

Modélisation conjointe monde-action sensible aux affordances pour la manipulation robotique (AffordanceWAM)

Une équipe de recherche a publié le 22 septembre 2026 sur arXiv, sous la référence 2609.22332, AffordanceWAM, un nouveau modèle conjoint de monde et d'action pour la manipulation robotique généraliste. Bâti sur un Transformer de diffusion vidéo pré-entraîné, il associe un module « World Expert » et un module « Action Expert » reliés par une attention conjointe masquée, pour prédire simultanément les images RGB futures de la scène, un champ d'affordance scalaire, une carte de chaleur des zones manipulables et la trajectoire d'action continue du robot, sous un objectif d'entraînement unique de type flow-matching. Les vidéos humaines filmées à la première personne supervisent ces trois flux visuels, tandis que les démonstrations robotiques ajoutent la supervision d'action, sans retargeting ni étiquetage manuel des gestes humains, avant validation sur les bancs d'essai RoboCasa et CALVIN (protocole ABC vers D) et sur des tâches de manipulation réelles. Le problème visé est la pénurie de données d'entraînement pour les politiques vision-langage-action : les vidéos robot avec actions étiquetées restent coûteuses et peu diversifiées, tandis que les vidéos humaines égocentriques, abondantes, manquent d'actions robotiques exploitables et diffèrent en morphologie. AffordanceWAM affiche des gains constants face à des références limitées au RGB seul ou aux seules données robot, et surtout une amélioration monotone sur RoboCasa à mesure que le volume de vidéos humaines annotées en affordance augmente, à supervision robot constante. Pour les équipes entraînant des modèles VLA à grande échelle, ce résultat trace une voie pour réduire la dépendance à la téléopération coûteuse en exploitant des corpus vidéo humains déjà disponibles en masse. Le travail s'inscrit dans la tendance des modèles du monde appliqués à la robotique, où prédiction vidéo et génération d'action sont fusionnées dans une architecture unique plutôt que traitées séparément, une direction également suivie par plusieurs laboratoires industriels développant des modèles vision-langage-action. Il s'agit à ce stade d'une prépublication non encore validée par relecture par les pairs, testée sur des bancs d'essai académiques et un nombre restreint de scénarios réels, et non d'un produit ou d'un déploiement commercial. Le papier ne précise ni la taille exacte des corpus vidéo humains, ni de calendrier de publication du code ou des poids du modèle, laissant la reproductibilité comme prochaine étape à vérifier.

RechercheActu
1 source
IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force
3arXiv cs.RO 

IMPACT : apprentissage d'une commande prédictive à modèle interne pour la manipulation robotique en force

Une équipe de recherche a publié le 12 juin 2026 sur arXiv (référence 2606.10818) IMPACT, un framework d'apprentissage pour la manipulation robotique dite "forceful", c'est-à-dire impliquant des interactions physiques avec l'environnement : utilisation d'outils de masses variables, transport d'objets lourds, nettoyage de surface par contact prolongé. L'architecture découple le problème en deux blocs distincts : un planificateur de tâche de haut niveau, et un contrôleur prédictif basé sur un modèle interne (internal-model predictive control). Les expériences sont menées à la fois en simulation et sur robot réel, avec évaluation sur des objets non vus lors de l'entraînement. Les auteurs ne publient pas encore les métriques quantitatives précises dans l'abstract arXiv disponible, ce qui limite l'analyse indépendante à ce stade. Le verrou technique adressé est réel et sous-estimé dans les pipelines d'imitation learning actuels. Deux stratégies dominent aujourd'hui : la première laisse les forces émerger implicitement via les erreurs de suivi d'un contrôleur d'impédance, ce qui casse la généralisation dès que la masse de l'objet change ; la seconde commande explicitement les efforts via capteur force/couple ou capteur tactile au poignet, ce qui fonctionne mais alourdit l'intégration matérielle et fragilise les déploiements industriels. IMPACT propose une troisième voie en apprenant un modèle interne de la dynamique de contact, permettant au contrôleur prédictif d'anticiper les forces sans capteur dédié ni dégradation de généralisation. Les gains annoncés en taux de succès, sécurité et efficacité énergétique sont cohérents avec l'approche, mais restent à valider sur des benchmarks standardisés comme DROID ou RoboAgent. Ce travail s'inscrit dans un courant actif qui cherche à marier l'apprentissage par imitation avec les garanties du contrôle prédictif (MPC), après des travaux fondateurs comme ILC, DMP, et plus récemment les architectures VLA de type pi0 (Physical Intelligence) ou RoboDiff. Le problème de la manipulation forcée reste un angle mort des démos grand public, qui privilégient les tâches de pick-and-place sur objets légers. Les concurrents directs incluent les approches sim-to-real de CMU (DexVIP, ACT), d'ETH Zurich (ANYmal) et les travaux de Boston Dynamics Research sur la manipulation lourde. Côté européen, aucun acteur n'est directement cité, mais les travaux de Wandercraft et Enchanted Tools sur la dynamique de contact pourraient bénéficier de ce type de framework. La prochaine étape naturelle serait une validation sur manipulateurs industriels (UR, Franka) en conditions de production réelle.

RecherchePaper
1 source
ViHaTeleop : un système de téléopération visuo-haptique léger et à faible coût pour l'apprentissage de la manipulation dextérique
4arXiv cs.RO 

ViHaTeleop : un système de téléopération visuo-haptique léger et à faible coût pour l'apprentissage de la manipulation dextérique

Des chercheurs présentent ViHaTeleop, un système de téléopération visuo-haptique pour l'apprentissage par démonstration en manipulation dexterous. Leger (0,7 kg) et peu couteux (550 dollars), il combine suivi du poignet par SLAM, suivi de la main par camera, et retour vibrotactile par doigt via des actionneurs a résonance linéaire, avec éclairage LED intègre, camera fisheye dédiée et contraintes de retargeting sensibles au contact. Deploye sur un bras Franka équipe d'une main LEAP et d'un capteur tactile 9DTact, en réel comme en simulation, il a été teste auprès de neuf participants sur six taches a fort contact, avec et sans retour haptique. Resultat: le taux de réussite progresse de 2,2 a 15,6 points de pourcentage dans toutes les taches, l'effet sur le temps d'exécution variant selon la tache, et les utilisateurs rapportent une clarté de contact et une confiance de préhension significativement meilleures (test de Wilcoxon, p<0,05). Un proxy tactile base sur camera de profondeur, intègre dans Isaac Sim, permet aussi d'entrainer des politiques visuo-tactiles a partir des démonstrations collectées, avec un gain de 17 points sur une tache d'insertion de cheville (peg-in-hole) par rapport a une politique uniquement visuelle. Ce travail cible un goulot d'étranglement connu de l'apprentissage par démonstration: le matériel de téléopération bon marche capture mal les interactions de contact fin, ce qui dégradé la qualité des données servant a entrainer des politiques de manipulation, y compris les modèles vision-langage-action déployés a plus grande échelle. En montrant qu'un retour haptique a faible cout améliore a la fois la téléopération humaine et la politique entraînée en aval, l'étude plaide pour intégrer systématiquement le tactile dans les pipelines de collecte de données plutôt que de reposer sur la seule vision. A 550 dollars, bien en dessous des systèmes haptiques industriels, l'approche pourrait devenir accessible a un plus grand nombre de laboratoires et d'intégrateurs travaillant sur la manipulation fine, la ou l'écart entre démonstrations en laboratoire et robustesse en conditions réelles demeure large. ViHaTeleop s'inscrit dans les travaux récents sur la téléopération a bas cout pour l'apprentissage par imitation, motives par la difficulté de collecter des démonstrations de qualité pour des taches fines sans matériel haptique onéreux. Publie en preprint sur arXiv (2608.16572v1), le système reste un prototype de recherche valide en laboratoire sur des taches contrôlées, et non un produit commercialise ou déployé en production. Aucun acteur français ou européen n'apparait dans l'étude, dont les auteurs ne précisent ni calendrier de diffusion open-source du matériel et du code, ni suite annoncee au-delà de cette validation préliminaire.

RecherchePaper
1 source