Aller au contenu principal
GraspGraphNet : génération de préhensions dextériques multi-embodiment par graphe structuré
RecherchearXiv cs.RO 

GraspGraphNet : génération de préhensions dextériques multi-embodiment par graphe structuré

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Trois chercheurs (le papier ne précise pas l'affiliation dans le résume) publient GraspGraphNet, un framework de génération de prises dexteres capable de fonctionner sur plusieurs mains robotiques différentes a partir d'un seul modèle. Chaque main est représentée comme un graphe cinématique dérivé directement de son fichier URDF, ce qui permet au système de générer directement des poses de paume et des configurations articulaires exécutables, sans étape de retargeting ni de résolution de cinématique inverse en post-traitement. L'architecture combine un encodage hiérarchique de la surface de l'objet, une cinématique directe différentiable et un mécanisme de message passing dynamique sur les arêtes reliant robot et objet, le tout pilote par du conditional flow matching applique directement dans l'espace des poses et des états articulaires. Entraine conjointement sur trois mains aux morphologies très différentes (Barrett Hand, Allegro Hand, Shadow Hand), le modèle partage atteint un taux de réussite moyen de 83,48% sur un benchmark de 40 objets, avec un temps d'inférence de seulement 40 millisecondes par prise.

L'intérêt principal tient a la généralisation inter-mains sans reentrainement: applique sans adaptation a des variantes de mains avec des doigts retires, le même modèle conserve 72,70% de réussite. Pour l'industrie de la manipulation robotique, cela s'attaque a un vrai point de friction: la génération de prises est aujourd'hui largement spécifique a chaque main, obligeant intégrateurs et laboratoires a entrainer ou retarger un modèle par type de pince ou de main dexterement différente. Un modèle unique capable de s'adapter a la topologie cinématique réduirait le cout d'ingénierie a chaque changement de matériel. Ces chiffres restent toutefois issus d'un benchmark contrôle en simulation ou en laboratoire, pas d'un déploiement industriel réel, et méritent d'être confirmes a plus grande échelle et sur du matériel varie.

Le problème adresse ici, la différence de topologie cinématique, de dimensions d'actionnement et d'espaces de commande natifs entre mains robotiques, est un frein connu a la généralisation en manipulation dexterement, un peu comme les modèles VLA généralistes (Pi-0, GR00T N2, Helix) cherchent a généraliser le contrôle corps entier plutôt que la seule prise. GraspGraphNet se positionne comme une brique complémentaire, focalisée sur la prise plutôt que sur la politique complète, et les auteurs annoncent une page projet pour la suite des travaux, sans calendrier de déploiement précise a ce stade.

À lire aussi

EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe
1arXiv cs.RO 

EAGG : génération de saisie alignée sur l'embodiment par conditionnement géométrique sur graphe

Des chercheurs présentent EAGG (Embodiment-Aligned Grasp Generation via Geometry-Aware Graph Conditioning), un modèle de génération de prises robotiques multi-effecteur publié en prépublication sur arXiv (arXiv:2506.18092). L'architecture représente chaque effecteur terminal via un graphe topologique et un espace de contrôle bas-dimensionnel propre à chaque morphologie, qu'il s'agisse de pinces parallèles classiques ou de mains dextères à plusieurs doigts. Un module backbone figé convertit l'état articulé courant en tokens géométriques réutilisables, qui sont rafraîchis de façon itérative tout au long du processus d'échantillonnage via un mécanisme baptisé iterative geometry injection. Sur le benchmark MultiGripperGrasp, EAGG atteint 56,17 % de taux de succès moyen sur six effecteurs d'entraînement, soit un écart de seulement 1,10 point de pourcentage par rapport à des modèles spécialisés entraînés séparément pour chaque préhenseur. L'injection géométrique itérative réduit par ailleurs la distance médiane de contact de 0,239 cm à 0,189 cm. Le code est disponible en open source sur GitHub. Ce résultat s'attaque à l'un des verrous les plus concrets pour les intégrateurs industriels : la nécessité de réentraîner ou d'affiner un modèle de saisie à chaque changement de préhenseur. L'approche dominante consiste aujourd'hui soit à entraîner un modèle par géométrie d'effecteur (coûteux en données et en compute), soit à encoder l'identité de l'effecteur via un descripteur statique, ce qui dégrade le transfert dès que la topologie ou le couplage d'actionnement diverge significativement. EAGG montre qu'encoder explicitement la structure morphologique dans un générateur partagé, plutôt que de masquer les différences inter-effecteurs, améliore à la fois la performance générale et la transférabilité zero-shot vers des préhenseurs non vus lors de l'entraînement. C'est un argument de poids pour les équipes robotiques cherchant à mutualiser les politiques de saisie sur une flotte multi-effecteurs. Ce travail s'inscrit dans la dynamique plus large de politiques robotiques universelles que poursuivent simultanément Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, ou Figure AI avec Helix, tous confrontés au même défi de transfert inter-morphologie. EAGG se concentre sur le sous-problème de la saisie et propose une solution fondée sur les graphes, là où d'autres approches misent sur des encodages continus ou des plongements latents partagés. Il s'agit pour l'instant d'une contribution académique sans déploiement industriel annoncé ni partenariat applicatif déclaré, et les chiffres de performance sont à lire dans le cadre contrôlé du benchmark MultiGripperGrasp, ce qui laisse ouverte la question du sim-to-real gap en conditions réelles.

RechercheActu
1 source
Génération de préhensions dextériques guidées et conscientes du bras à partir de modèles de préhension agnostiques au bras
2arXiv cs.RO 

Génération de préhensions dextériques guidées et conscientes du bras à partir de modèles de préhension agnostiques au bras

Une équipe de recherche publie sur arXiv (arXiv:2608.16351v1, catégorie "new") un nouveau cadre de génération de prises dextres tenant compte des contraintes liées au bras porteur, un problème clé pour la manipulation robotique en conditions réelles : évitement de collision entre bras et environnement, prises en limite d'espace de travail, saisies consécutives. Contrairement aux modèles de prise dits "hand-centric", qui ne considèrent que la pose de la main flottante, ou aux méthodes "arm-aware" classiques, qui reposent soit sur du réjection sampling coûteux en échantillons soit sur un réentraînement spécifique à chaque bras, l'approche proposée réutilise des modèles de prise pré-entraînés indépendants du bras et n'intègre les contraintes du bras et de l'environnement qu'au moment de l'inférence. Techniquement, le problème est formulé comme une optimisation conjointe de la pose de la main et de la configuration du bras, avec des gradients en forme close pour les contraintes liées au bras ; en représentant la distribution des poses de main par un modèle de diffusion, les auteurs montrent que cette optimisation par gradient équivaut à un échantillonnage de diffusion guidé. L'évaluation couvre 10 000 objets répartis sur 6 scénarios. Ce travail cible un angle mort fréquent en manipulation dextre : la plupart des générateurs de prises sont entraînés hors contexte du bras porteur, creusant un écart entre démonstration en laboratoire et déploiement sur un robot intégré. Pour les équipes R&D et intégrateurs, l'intérêt tient au découplage entre modèle de prise générique et contraintes spécifiques appliquées à l'inférence, ce qui évite un réentraînement à chaque nouveau bras ou nouvelle cellule de travail et promet une meilleure portabilité entre plateformes. Les auteurs rapportent une probabilité significativement plus élevée de générer des prises faisables en configuration fortement contrainte que les approches existantes, un résultat qui reste à confirmer indépendamment mais qui appuie la piste des méthodes guidées par diffusion plutôt que le simple filtrage post-hoc des échantillons. La contribution s'inscrit dans la lignée des modèles de prise dextre basés sur la diffusion, déjà utilisés pour générer des poses de main plausibles à partir de la géométrie d'objets, mais qui traitaient rarement le bras comme contrainte de premier ordre. Il s'agit d'un preprint de recherche, sans essai sur robot physique ni partenariat industriel mentionné : le code et le matériel supplémentaire sont publiés sur arm-aware-dexgrasp.github.io. Aucune plateforme robotique ni entreprise commerciale n'est citée dans l'article, ce qui en fait pour l'instant une contribution méthodologique destinée à être reprise et testée par d'autres laboratoires ou intégrateurs sur leurs propres bras et mains robotiques.

RecherchePaper
1 source
Génération rapide de préhensions via MeanFlow contraint par groupes de Lie
3arXiv cs.RO 

Génération rapide de préhensions via MeanFlow contraint par groupes de Lie

Un preprint publie sur arXiv (arXiv:2608.26076v1) présente Lie Group-constrained MeanFlow, une méthode de synthèse de prise (grasp synthesis) pour bras robotiques. Elle applique MeanFlow, une technique générative récente, sur le groupe de Lie produit SO(3) x R3, qui encode conjointement orientation et position d'une prise dans un seul espace géométrique. L'entrainement combine une condition de consistance semi-groupe purement algébrique avec un flow matching riemannien conditionnel sur ce groupe, qui ancre la vitesse moyenne du modèle a la distribution réelle des prises. Sur le jeu de données ACRONYM, la méthode génère des prises fiables en 5 évaluations de réseau au maximum, pour une latence d'inférence de l'ordre de la milliseconde, soit un gain de vitesse allant jusqu'a 39 fois par rapport aux modèles de diffusion et de flow-matching de référence, a qualité de prise équivalente. Les auteurs rapportent également un transfert direct vers des essais de préhension réelle sur robot, sans reentrainement ni adaptation de domaine, avec une robustesse maintenue face au bruit d'observation. Ce résultat s'attaque a un goulot d'étranglement connu du secteur du grasping: les modèles de diffusion capturent bien la multimodalité des prises valides sur un objet, mais leurs dizaines d'étapes d'échantillonnage restent trop lentes pour les cadences industrielles du bin-picking ou de la préparation de commandes. Ramener ce nombre a cinq évaluations sans perte de qualité rapproche les pipelines génératifs des contraintes temps réel attendues par les intégrateurs. Le maintien des performances en conditions réelles, avec bruit de capteur et sans reentrainement, répond aussi a une critique fréquente des démonstrations purement simulées, l'écart sim-to-real restant l'un des principaux freins a la mise en production des pipelines de perception-action. La méthode prolonge les travaux récents de distillation des modèles de diffusion en peu d'étapes, dont MeanFlow est une variante; son apport propre est de l'appliquer rigoureusement a un espace non euclidien, celui des rotations SO(3), que de nombreuses approches antérieures traitaient par des paramétrisations approximatives plutôt que par une géométrie riemannienne native. Les points de comparaison cites restent les modèles de diffusion et de flow-matching de référence évalués sur ACRONYM, jeu de données standard du domaine. A ce stade, il s'agit d'une publication de recherche non revue par les pairs et non d'un produit déployé : aucun partenariat industriel, pilote ou calendrier n'est mentionne, la validation réelle se limitant a des essais de préhension en laboratoire.

RecherchePaper
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
4arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source