Aller au contenu principal
HUGS : synthèse unifiée de préhension dextérique guidée par des priors humains, à travers modes et échelles
RecherchearXiv cs.RO 

HUGS : synthèse unifiée de préhension dextérique guidée par des priors humains, à travers modes et échelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Le laboratoire à l'origine de ce travail de recherche présente HUGS (Human-prior-guided Unified Dexterous Grasp Synthesis), une méthode qui unifie la synthèse de prises dextres robotiques à travers différentes échelles d'objets et différents modes de contact, de la pince à deux doigts à la prise bimanuelle. Plutôt que de recopier directement des démonstrations humaines, le système apprend un a priori conditionné par l'objet à partir d'un jeu de données compact de 1,8K prises collectées sur 304 objets réels, couvrant une large gamme de tailles et de modes de contact. Cet a priori guide ensuite une optimisation qui privilégie la fermeture de force (force-closure), en proposant de façon adaptative les modes de contact et les initialisations de poignet les plus pertinents. Résultat concret : les chercheurs ont synthétisé 3,2 millions de prises robotiques réparties sur 157 000 scènes, avec des objets dont la demi-diagonale varie de 2 à 30 centimètres, allant d'une vis à un grand carton.

Cette approche s'attaque à un problème récurrent en robotique dextre : les méthodes existantes s'appuient sur des contacts attendus et des heuristiques d'initialisation conçues manuellement, ce qui limite soit le taux de réussite, soit la diversité des prises générées. En démontrant que des modèles entraînés sur ce jeu de données synthétique choisissent de façon autonome le mode de contact adapté à chaque objet dans le monde réel, HUGS apporte un élément de preuve supplémentaire que l'apprentissage à partir de données synthétiques à grande échelle peut réduire l'écart entre simulation et réalité, un point de friction classique pour les intégrateurs qui cherchent à déployer des mains robotiques polyvalentes en entrepôt ou en usine.

Ce travail s'inscrit dans une tendance plus large de la recherche en manipulation robotique, où la génération de données synthétiques massives sert à contourner la rareté des démonstrations humaines réelles, coûteuses à collecter à cette échelle. En s'appuyant sur des préférences de préhension humaines plutôt que sur un simple retargeting geste par geste, les auteurs se positionnent face aux approches purement heuristiques ou purement basées sur l'imitation. Les prochaines étapes attendues concernent le passage à l'échelle sur des mains robotiques physiques variées et l'intégration de ces prises synthétiques dans des pipelines d'apprentissage bout-en-bout pour la manipulation générale.

Dans nos dossiers

À lire aussi

Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée
1arXiv cs.RO 

Passage à l'échelle de la manipulation d'appareils guidée par manuel, avec synthèse de données et planification unifiée

Des chercheurs ont publié le 18 août 2026 sur arXiv (référence 2608.15863v1) une étude intitulée "Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning", présentant MAGE, un pipeline de synthèse de données conçu pour entraîner des robots à manipuler des appareils électroménagers en suivant leurs manuels d'utilisation. MAGE s'appuie sur une architecture inédite baptisée Hierarchical Appliance Graph (HAG), qui génère automatiquement des annotations de pièces, des plans d'action à long horizon et des données de correction en boucle fermée directement à partir des manuels d'appareils. Les auteurs en ont tiré UseAppliance, présenté comme le premier jeu de données à grande échelle pour la planification de manipulation d'électroménager ancrée dans la documentation constructeur : 22 catégories d'appareils, plus de 89 000 annotations de pièces, plus de 53 000 tâches de manipulation et plus de 33 000 étapes d'ajustement en boucle fermée. Sur cette base, l'équipe a développé AppliancePlan, un modèle de bout en bout de seulement 7 milliards de paramètres, testé sur le benchmark RealAppliance-Bench où il dépasserait de plus de dix fois la meilleure référence existante en planification en boucle ouverte, avec des expériences robotiques réelles menées sur six appareils domestiques. Pour l'industrie robotique, ce travail cible un goulot d'étranglement précis : l'absence de jeux de données suffisamment diversifiés et orientés tâche pour entraîner des modèles capables de planification robuste face aux imprévus, un problème qui freine le déploiement de robots polyvalents dans des environnements domestiques réels. La confirmation d'un transfert sim-to-real effectif, même à petite échelle (six appareils), constitue un signal utile pour les intégrateurs qui cherchent à évaluer si les architectures type VLA passent réellement du laboratoire au terrain, plutôt qu'un pur exercice de simulation. Ce projet s'inscrit dans une dynamique de recherche plus large sur la planification à long horizon pour la robotique domestique généraliste, où le manque de données annotées reste un frein structurel identifié par plusieurs laboratoires académiques. Les auteurs présentent leurs résultats comme une étape vers une robotique domestique généraliste, sans toutefois annoncer de calendrier de commercialisation ni de partenariat industriel à ce stade.

RecherchePaper
1 source
ConGraspXL : synthèse de mouvements de préhension dextérique contrôlables sous contraintes
2arXiv cs.RO 

ConGraspXL : synthèse de mouvements de préhension dextérique contrôlables sous contraintes

Un article publié sur arXiv (2609.16319v1, catégorie "nouveau") présente ConGraspXL, un système de synthèse de mouvements de préhension dextre pour mains robotiques, conçu comme extension du système précédent GraspXL. GraspXL permettait déjà une synthèse de saisie généralisable à des objets variés et à différentes morphologies de main, mais sans possibilité de contrôler précisément la façon dont la prise s'exécute. ConGraspXL ajoute cette contrôlabilité en conditionnant la génération de mouvement sur des contraintes définies par la tâche: direction d'approche de la main, zones de contact souhaitées sur l'objet, trajectoire imposée au poignet, ou pose fonctionnelle de la main, par exemple tenir un outil dans la bonne orientation pour l'utiliser. Techniquement, les auteurs introduisent une formulation hiérarchique des contraintes, une interface à résidu masqué permettant de combiner librement plusieurs contraintes simultanément, ainsi que des centres de main dynamiques et un guidage du poignet en boucle ouverte pour améliorer la précision du contrôle. L'intérêt pour l'industrie tient à un problème concret: la plupart des générateurs de mouvements de préhension appris à grande échelle savent produire une prise plausible sur un objet inconnu, mais ne permettent pas de spécifier comment cette prise doit se faire pour remplir une tâche précise, par exemple attraper une tasse par l'anse plutôt que par le corps. ConGraspXL cherche à combler cet écart en conservant la capacité de généralisation de GraspXL tout en ajoutant un contrôle fin, ce qui en fait, selon les auteurs, un contrôleur de préhension bas niveau "prêt à l'emploi" utilisable comme brique dans des systèmes plus larges: complétion de saisie corps entier, préhension fonctionnelle, ou imitation de mouvements humains, des cas d'usage directement pertinents pour l'apprentissage par imitation et les pipelines de téléopération qui alimentent les modèles vision langage action des mains robotiques dextres. L'abstract ne fournit toutefois aucun chiffre de performance, de comparatif ou de temps de calcul, ce qui empêche d'évaluer l'ampleur réelle du gain par rapport à GraspXL ou à des méthodes concurrentes. Le travail s'inscrit dans la lignée directe de GraspXL, présenté comme une méthode de synthèse de préhension scalable mais non contrôlable, dont ConGraspXL constitue la suite logique. Le papier ne précise ni les auteurs, ni le laboratoire ou l'entreprise d'origine, ni de calendrier de publication de code ou de modèle, ce qui correspond au stade d'un preprint tout juste déposé plutôt qu'à un produit ou un outil diffusé publiquement. Aucun acteur français ou européen n'apparaît dans ce travail. Les usages évoqués, complétion de saisie corps entier, préhension fonctionnelle et imitation de mouvement humain, restent présentés comme des applications aval possibles plutôt que des démonstrations déjà réalisées, et l'abstract ne précise pas si les résultats ont été validés sur du matériel physique ou uniquement en simulation, une distinction pourtant déterminante pour juger de la maturité réelle de l'approche.

RecherchePaper
1 source
Génération de préhensions dextériques guidées et conscientes du bras à partir de modèles de préhension agnostiques au bras
3arXiv cs.RO 

Génération de préhensions dextériques guidées et conscientes du bras à partir de modèles de préhension agnostiques au bras

Une équipe de recherche publie sur arXiv (arXiv:2608.16351v1, catégorie "new") un nouveau cadre de génération de prises dextres tenant compte des contraintes liées au bras porteur, un problème clé pour la manipulation robotique en conditions réelles : évitement de collision entre bras et environnement, prises en limite d'espace de travail, saisies consécutives. Contrairement aux modèles de prise dits "hand-centric", qui ne considèrent que la pose de la main flottante, ou aux méthodes "arm-aware" classiques, qui reposent soit sur du réjection sampling coûteux en échantillons soit sur un réentraînement spécifique à chaque bras, l'approche proposée réutilise des modèles de prise pré-entraînés indépendants du bras et n'intègre les contraintes du bras et de l'environnement qu'au moment de l'inférence. Techniquement, le problème est formulé comme une optimisation conjointe de la pose de la main et de la configuration du bras, avec des gradients en forme close pour les contraintes liées au bras ; en représentant la distribution des poses de main par un modèle de diffusion, les auteurs montrent que cette optimisation par gradient équivaut à un échantillonnage de diffusion guidé. L'évaluation couvre 10 000 objets répartis sur 6 scénarios. Ce travail cible un angle mort fréquent en manipulation dextre : la plupart des générateurs de prises sont entraînés hors contexte du bras porteur, creusant un écart entre démonstration en laboratoire et déploiement sur un robot intégré. Pour les équipes R&D et intégrateurs, l'intérêt tient au découplage entre modèle de prise générique et contraintes spécifiques appliquées à l'inférence, ce qui évite un réentraînement à chaque nouveau bras ou nouvelle cellule de travail et promet une meilleure portabilité entre plateformes. Les auteurs rapportent une probabilité significativement plus élevée de générer des prises faisables en configuration fortement contrainte que les approches existantes, un résultat qui reste à confirmer indépendamment mais qui appuie la piste des méthodes guidées par diffusion plutôt que le simple filtrage post-hoc des échantillons. La contribution s'inscrit dans la lignée des modèles de prise dextre basés sur la diffusion, déjà utilisés pour générer des poses de main plausibles à partir de la géométrie d'objets, mais qui traitaient rarement le bras comme contrainte de premier ordre. Il s'agit d'un preprint de recherche, sans essai sur robot physique ni partenariat industriel mentionné : le code et le matériel supplémentaire sont publiés sur arm-aware-dexgrasp.github.io. Aucune plateforme robotique ni entreprise commerciale n'est citée dans l'article, ce qui en fait pour l'instant une contribution méthodologique destinée à être reprise et testée par d'autres laboratoires ou intégrateurs sur leurs propres bras et mains robotiques.

RecherchePaper
1 source
Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique
4arXiv cs.RO 

Modélisation unifiée vision-toucher-action à partir de démonstrations humaines pour la manipulation dextérique

Des chercheurs proposent UVTA, un cadre qui exploite des démonstrations humaines enregistrées avec retour tactile pour améliorer les politiques de manipulation dextre des robots. L'équipe a d'abord construit un système de capture de mouvement tactile, qui enregistre de façon synchrone les images, les signaux tactiles et les mouvements de la main. Avec cet outil, elle a constitué le jeu de données UVTA, qui couvre cinq tâches riches en contacts. Il comprend 1 000 démonstrations humaines et 150 démonstrations robot par tâche. Le modèle associé, un Unified Visual-Tactile-Action Model, projette l'humain et le robot dans des représentations tactiles et d'action alignées. Il prédit conjointement les trajectoires futures d'action et de toucher. Les démonstrations humaines supervisent ainsi l'apprentissage de représentations sensibles au contact, et seules les actions du robot sont exécutées au déploiement. Lors d'évaluations sur robot réel, sur les cinq tâches, la méthode atteint 70 % de réussite moyenne. La meilleure base de comparaison visuo-tactile plafonne à 29 %, et une ablation d'architecture à 42 %. L'enjeu tient au goulot d'étranglement des données tactiles. La téléopération de mains dextres ne renvoie à l'opérateur qu'un retour tactile limité, ce qui rend les démonstrations robot riches en toucher difficiles à collecter à grande échelle. Les auteurs contournent le problème avec l'hypothèse que la main change mais que la physique de l'interaction reste la même. Les données humaines deviennent alors une source de supervision plus abondante et plus variée. Les performances progressent avec le nombre de démonstrations humaines et ne saturent pas à 1 000 par tâche. Cela suggère qu'une montée en volume pourrait encore améliorer les résultats, sans que le papier le démontre au-delà. Pour les intégrateurs et les équipes qui développent des politiques de préhension fine, l'idée est de déplacer l'effort de collecte du robot vers l'humain, moins coûteux. Elle vise les tâches où la vision seule échoue, comme l'insertion, la manipulation en occlusion ou le contrôle de force. Il s'agit d'un travail académique, pas d'un produit, et il faut lire les chiffres avec prudence. Le score de 70 % porte sur seulement cinq tâches, avec 150 démonstrations robot par tâche, dans un cadre de laboratoire. Le résumé ne précise ni la main utilisée, ni les capteurs tactiles, ni le nombre d'essais, ni la nature exacte des tâches. L'écart avec les bases de comparaison (29 % et 42 %) est net, mais il dépend de choix de baselines que seul le texte complet permet d'apprécier. Le papier s'inscrit dans un courant de recherche qui cherche à apprendre la manipulation à partir de vidéos et de gants de capture humains, pour dépasser la téléopération. Il ajoute ici la modalité tactile, encore peu présente dans les grands modèles vision-langage-action (VLA). La version 2 de l'article sur arXiv et une page projet (uni-vta.github.io) sont disponibles. Aucun déploiement industriel ni calendrier n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source