Aller au contenu principal
RecherchearXiv cs.RO 

DEAL-Grasp : représentation d'alignement découplée pour une préhension dextérique tenant compte de la géométrie

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publié sur arXiv le 24 septembre 2026 sous la référence 2609.28131, l'article présente DEAL-Grasp, une méthode de génération de prises dextres pour mains articulées, robotiques ou virtuelles, destinée à la réalité virtuelle, l'intelligence incarnée et les humains numériques. Plutôt que de mélanger mouvement rigide global et articulation des doigts dans un même espace comme le font les méthodes existantes, ce qui produit des contacts instables et physiquement implausibles, DEAL-Grasp sépare les deux : la pose de la main est recalculée par un alignement de Procrustes en forme close, sans optimisation itérative, tandis que l'articulation des doigts est préservée. La génération repose sur du flow matching avec régularisation physique pendant l'entraînement, sans optimisation ni guidage physique requis à l'inférence. Sur les benchmarks MultiDex et RealDex, ce dernier testé en zero-shot, la méthode affiche un fort taux de réussite sous perturbation de force, une pénétration minimale entre main et objet, une grande diversité de prises générées, et une latence d'inférence nettement inférieure aux méthodes concurrentes fondées sur l'optimisation.

Ce résultat s'attaque à un vrai goulot d'étranglement de la manipulation robotique et de l'animation numérique : la plupart des générateurs de prises dextres nécessitent une optimisation physique coûteuse après génération pour corriger des contacts aberrants, ce qui freine leur usage en temps réel. En supprimant cette étape grâce à un calcul en forme close, DEAL-Grasp réduit la latence, un atout pour la téléopération, la simulation et les mains robotiques multi-doigts des humanoïdes. Cela confirme la montée du flow matching comme alternative à la diffusion pour générer des comportements robotiques rapides et physiquement plausibles. Les résultats restent toutefois limités à des benchmarks académiques et à la simulation ; rien n'indique à ce stade un déploiement sur robot physique.

Le travail s'inscrit dans la lignée des méthodes de synthèse de prises par régression ou diffusion, qui couplent pose globale et articulation et recourent à une optimisation physique post-hoc ou à un guidage auxiliaire pour stabiliser les contacts, une contrainte que DEAL-Grasp cherche précisément à éliminer. Il rejoint aussi la tendance à l'adoption du flow matching dans les politiques de contrôle robotique, technique également employée par des modèles VLA comme Pi-0. MultiDex et RealDex servent de bancs d'essai standards du domaine. Publié comme preprint non encore évalué par les pairs, avec code et page projet en ligne, le travail n'annonce pour l'instant aucune validation sur mains robotiques physiques ni calendrier de déploiement.

À lire aussi

InterMASH : une représentation géométrique unifiée pour la synthèse de préhension
1arXiv cs.RO 

InterMASH : une représentation géométrique unifiée pour la synthèse de préhension

La synthèse de préhension (grasp synthesis), qui vise à générer des interactions main-objet stables et physiquement plausibles, reste freinée par l'absence de représentation commune entre mains humaines et mains robotiques, en raison de leurs différences de morphologie et de modélisation de surface. Un nouveau papier de recherche, publié sur arXiv sous la référence 2609.18504, propose InterMASH, une représentation géométrique unifiée fondée sur des ancres fixées à la surface de sphères qui établissent une correspondance entre différentes morphologies de main. À chaque ancre, des harmoniques sphériques de faible degré encodent de façon compacte la géométrie locale de la main, celle de l'objet et le contact entre les deux, formant une séquence de tokens explicite et interprétable. Sur cette base, les auteurs entraînent un Diffusion Transformer conditionnel qui opère directement dans cet espace pour générer conjointement la géométrie de la main et les points de contact. Le système atteint des performances comparables à l'état de l'art sur les métriques de faisabilité physique d'un benchmark à grande échelle basé sur la main robotique ShadowHand, permet un entraînement conjoint sur plusieurs types de mains, et montre qu'un fine-tuning cross-embodiment avec des données de préhension humaine améliore le taux de succès et la diversité des préhensions générées pour des mains robotiques. L'intérêt pour l'industrie tient au format de représentation lui-même: les approches précédentes reposaient soit sur des cartes de contact, soit sur des descripteurs implicites denses, jugés incomplets ou coûteux en calcul et redondants. En rendant la représentation nativement tokenisée et compatible avec les architectures de diffusion transformer désormais standard en robotique générative, InterMASH facilite l'entraînement de modèles de manipulation sur des données hétérogènes, humaines et robotiques combinées. Pour les chercheurs en manipulation dextre et les concepteurs de politiques type VLA, le résultat le plus concret est la preuve que des données de préhension humaine, généralement plus abondantes et moins coûteuses à collecter que des données robotiques réelles, peuvent effectivement transférer vers de meilleures performances robotiques, une piste régulièrement évoquée pour réduire la dépendance à la téléopération ou à la simulation coûteuse. Il s'agit d'une publication de recherche fraîchement mise en ligne, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement: l'abstract ne mentionne aucune date de disponibilité de code au-delà de la page projet dédiée, inter-mash.github.io. Le travail s'inscrit dans la lignée des efforts combinant modélisation de la main humaine et manipulation robotique dextre, avec pour référence de comparaison le benchmark ShadowHand, largement utilisé dans la recherche académique sur la préhension. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source
GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA
2arXiv cs.RO 

GWM-VLA : une modélisation latente du monde tenant compte de la géométrie pour le VLA

Publié sur arXiv sous la référence 2608.07619 (août 2026), GWM-VLA est un nouveau cadre de modélisation latente du monde pour les modèles vision-langage-action (VLA) utilisés en manipulation robotique. L'architecture combine trois éléments : un module d'encodage multi-vues géométriquement conscient, nommé VGGT-Ω, qui agrège à chaque pas de temps les flux de plusieurs caméras pour construire un état multi-vues cohérent ; un modèle du monde latent qui prédit uniquement les tokens de patch de l'étape suivante pour une vue cible unique, la caméra de poignet du bras robotique dans les expériences, plutôt que de reconstruire l'intégralité de la scène multi-vues ; et une représentation d'action latente partagée qui conditionne à la fois ce modèle du monde et une tête d'action par flow-matching, entraînée simultanément par supervision de prédiction latente et par les actions robotiques réelles. Les auteurs testent le système en simulation et sur robot réel, sans détailler de chiffres de performance dans le résumé public. L'enjeu vise une faiblesse connue des VLA : leurs performances de manipulation, solides en conditions contrôlées, se dégradent souvent face à des changements visuels ou environnementaux comme l'éclairage, la position de caméra ou l'arrière-plan. La plupart des modèles du monde latents existants encodent chaque vue caméra indépendamment et prédisent la dynamique globale de la scène sans modéliser explicitement les relations géométriques entre vues, ce qui fragilise la robustesse. En imposant une cohérence géométrique multi-vues dès l'encodage, GWM-VLA s'inscrit dans les efforts récents pour combler l'écart entre démonstrations en laboratoire et déploiement réel, un point sensible pour les intégrateurs qui évaluent des politiques VLA de type Pi-0, GR00T N2 ou Helix pour des lignes de production ou de la logistique, où la variabilité des scènes est la norme plutôt que l'exception. GWM-VLA s'ajoute à une vague de recherches associant modélisation du monde et apprentissage d'actions pour renforcer la généralisation des politiques robotiques, un axe explore en parallèle par plusieurs laboratoires travaillant sur les architectures VLA à grande échelle. L'article ne précise ni l'affiliation institutionnelle des auteurs ni de comparaison chiffrée avec des bases de référence publiées, ce qui en fait pour l'instant une contribution académique en preprint, non revue par les pairs, plutôt qu'un produit ou un déploiement industriel. Aucune date de publication en conférence, aucun partenariat industriel ni feuille de route de déploiement ne sont mentionnés ; la validation indépendante de la robustesse annoncée reste donc à établir par la communauté.

RecherchePaper
1 source
De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
3arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
Évolution antérieure et alignement de tâche pour la préhension aérienne
4arXiv cs.RO 

Évolution antérieure et alignement de tâche pour la préhension aérienne

Un article publié le 17 septembre 2026 sur arXiv (référence 2609.18153) détaille une nouvelle méthode pour la préhension aérienne, cette capacité qu'ont les rapaces à capturer une proie en vol grâce à des manœuvres hautement coordonnées. Les chercheurs partent d'un constat sur les approches existantes fondées sur l'optimisation de trajectoire: le problème mathématique posé est fortement non convexe et très sensible aux conditions initiales, ce qui rend difficile l'obtention de solutions de bonne qualité avec un budget de calcul limité, et les objectifs numériques utilisés jusqu'ici sont des abstractions conçues par des humains qui ne capturent pas forcément tout ce qui détermine la réussite réelle de la saisie. Leur réponse combine trois briques: un "prior" de trajectoire appris à partir de mouvements déjà optimisés, un processus d'évolution basé sur la méthode CEM (cross-entropy method) qui teste des points de départ échantillonnés avec l'optimiseur réellement utilisé et ne conserve que les meilleurs comme nouvelles données d'entraînement, et un "Execution-Aware Critic" qui apprend à partir des résultats de contact, de soulèvement de l'objet et de complétion de la tâche pour prédire si une trajectoire optimisée réussira une fois exécutée physiquement. Une fois entraîné et figé, ce critique fait aussi office de coût de préhension différentiable qui influence directement la génération de trajectoire. Les auteurs rapportent des essais en simulation et sur système réel montrant une meilleure fiabilité d'optimisation, plus de cohérence entre trajectoires et de meilleures performances de saisie. Pour l'industrie robotique, ce travail s'attaque à un verrou classique de la planification par optimisation: la dépendance à l'initialisation, qui oblige souvent à relancer le solveur de nombreuses fois ou à accepter des trajectoires sous-optimales sous contrainte de temps de calcul. En faisant apprendre au système ce qui distingue une trajectoire viable d'une trajectoire qui échouera à l'exécution, plutôt que de se fier uniquement à des critères mathématiques fixés a priori, l'approche illustre une tendance plus large du secteur: hybrider planification analytique classique et apprentissage à partir de données d'exécution réelle, au lieu d'opposer les deux paradigmes. Il faut toutefois noter que l'abstract ne fournit aucun chiffre de taux de réussite, de temps de cycle ni d'échelle de déploiement: il s'agit d'un travail de recherche en amont, validé en simulation et par des essais réels limités, pas d'un système prêt pour un déploiement industriel. Ce papier s'inscrit dans la lignée des travaux sur la manœuvrabilité agile des drones et la manipulation aérienne, un champ de recherche actif depuis plusieurs années autour de la génération de trajectoires pour capturer des objets en mouvement ou en position complexe. Aucune entreprise ni laboratoire n'est nommé dans le résumé, et aucun acteur français ou européen du secteur n'est mentionné dans cette publication. Les suites logiques d'un tel travail seraient une extension à des scénarios de préhension plus variés, des tests sur davantage de plateformes matérielles, et une comparaison directe avec d'autres méthodes d'optimisation de trajectoire pour la préhension aérienne, mais aucune de ces étapes n'est annoncée à ce stade.

RecherchePaper
1 source