Aller au contenu principal
RecherchearXiv cs.RO 

DexPolicy : exploration planifiée pour la manipulation dextre guidée par trajectoires

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du groupe AIGeeksGroup publient sur arXiv (2610.00360) DexPolicy, une méthode qui traite l'amplitude du bruit d'action comme une fonction explicite du nombre de pas d'entraînement, décroissant d'une exploration large vers une exploration étroite. Elle est testée dans le cadre de ViViDex, où l'apprentissage par renforcement (RL) affine des trajectoires main-objet extraites de vidéos humaines. Dans ce cadre, les runs PPO de référence finissent après 5 millions de pas près de leur bruit initial. La perte, l'architecture, la récompense et l'optimiseur restent identiques. Trois variantes sont comparées : PPO, une continuation GRPO sans critique et une version de PPO à politique paramétrée par flow (FPO). En simulation, sur cinq objets YCB et trois graines, le succès déterministe moyen passe de 49,4 % à 68,1 % pour FPO, de 14,1 % à 45,4 % pour GRPO et de 32,0 % à 35,7 % pour PPO. Sur robot réel, un bras RealMan RM75 équipé d'une main Inspire RH56, 360 essais sur trois objets font passer le succès moyen de 25,0 % à 85,0 % (FPO), de 10,0 % à 63,3 % (GRPO) et de 8,3 % à 43,3 % (PPO), avec un modèle entraîné par couple objet-méthode. Le code est publié.

Le résultat intéresse les équipes qui cherchent à rendre le RL dextre fiable. Le bruit qui aide à découvrir les contacts doigt-objet gêne ensuite le contrôle fin de l'objet. Le gain vient d'un seul paramètre, ce qui en fait un levier peu coûteux à reproduire. Le gain est très inégal selon l'algorithme : il est marginal pour PPO en simulation (+3,7 points) et massif pour FPO et GRPO. Les auteurs notent aussi que le retour d'entraînement, le succès déterministe et la tolérance au bruit d'exécution se dissocient. Ils en déduisent qu'un calendrier d'exploration se juge sur le succès terminal dans les conditions d'exécution visées, tâche par tâche. Pour un intégrateur, c'est un rappel que les courbes d'entraînement ne prédisent pas la performance réelle. Le calendrier retenu pour PPO bat aussi une simple décroissance linéaire aux mêmes bornes sur trois objets, mais l'écart n'est établi que sur ces trois objets.

Il faut toutefois relativiser la portée. La validation réelle porte sur trois objets, une seule plateforme et un modèle par condition, sans test de généralisation à des objets inédits. Les échantillons sont petits : 360 essais répartis sur trois méthodes, avant et après calendrier, et trois objets. Le travail prolonge ViViDex, qui apprend la manipulation à partir de vidéos humaines, dans un champ où les politiques dextres par RL et les approches VLA ou par diffusion et flow se multiplient. Aucun acteur industriel européen n'est impliqué. Il s'agit d'un preprint, sans déploiement ni produit annoncé, et les prochaines étapes dépendront d'une réplication sur d'autres mains, d'autres tâches et d'objets hors du jeu YCB.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

ContactExplorer : exploration guidée par contacts pour la manipulation dextérique polyvalente
1arXiv cs.RO 

ContactExplorer : exploration guidée par contacts pour la manipulation dextérique polyvalente

Des chercheurs ont publié sur arXiv (identifiant 2603.10971v2) ContactExplorer, une méthode d'exploration par apprentissage par renforcement conçue pour les tâches de manipulation dextère avec des mains robotiques multi-doigts. Le principe central est de représenter le contact comme l'intersection géométrique entre les points de surface d'un objet et les points-clés de la main, ce qui permet au système de découvrir automatiquement quels doigts interagissent avec quelles régions d'un objet. ContactExplorer maintient un compteur de contacts conditionné sur des états d'objet discrétisés obtenus via des codes de hachage appris (hash codes), traçant la fréquence à laquelle chaque doigt explore chaque région de surface. Ce compteur est exploité selon deux mécanismes complémentaires : une récompense de couverture de contact basée sur le décompte, qui pousse l'agent vers des patterns de contact inédits, et une récompense d'atteinte à base d'énergie (energy-based reaching reward), qui guide la main vers les zones encore sous-explorées. L'intérêt de cette approche réside dans un problème structurel de la manipulation dextère : contrairement à la navigation ou à la locomotion, où l'exploration par nouveauté d'état suffit souvent, la manipulation physique fine exige des interactions contact riches et stables, que les signaux de nouveauté classiques gèrent mal (instabilité du signal de contact, inefficacité des signaux de distance, dépendance aux a priori spécifiques à la tâche). Les résultats expérimentaux sur un ensemble diversifié de tâches montrent que ContactExplorer améliore substantiellement l'efficacité d'échantillonnage et les taux de succès par rapport aux méthodes d'exploration existantes. Surtout, les patterns de contact appris en simulation se transfèrent de manière robuste au monde réel, ce qui est une validation non triviale du sim-to-real dans un domaine où ce gap reste un obstacle majeur. Ce travail s'inscrit dans un effort de recherche plus large visant à rendre l'exploration en RL agnostique aux tâches pour la manipulation dextère, un domaine où des équipes comme DeepMind (OpenAI Dactyl, 2019), Stanford, CMU et Berkeley ont accumulé des travaux fondateurs. ContactExplorer se distingue par son absence de priors spécifiques à la tâche, un point fort pour la généralisation. Publié sous forme de preprint arXiv (version 2, donc révisé), le travail n'a pas encore franchi le stade de la revue par les pairs ; une page projet est disponible à contact-explorer.github.io, mais aucun déploiement industriel ni partenariat commercial n'est annoncé à ce stade.

RecherchePaper
1 source
AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM
2arXiv cs.RO 

AntiGrounding : des trajectoires robotiques exécutables comme prompts visuels pour la manipulation guidée par VLM

AntiGrounding, un framework de sélection visuelle d'actions pour la manipulation robotique guidée par des modèles vision-langage, est détaille dans une version mise a jour d'un article arXiv (2506.12374v3). Chaque trajectoire courte retenue après filtrage de faisabilité sert a la fois de plan de mouvement exécutable et de prompt visuel rendu, évalué par un question-réponse visuel multi-vues qui note sécurité, alignement avec la tache, efficacité et plausibilité physique. Ces scores, agrégés par fusion pondérée des vues, guident les propositions de trajectoire suivantes; des contrôles séparés gèrent orientation et pince, et un jumeau numérique valide les segments choisis avant exécution par le robot réel. Sur huit taches de manipulation en conditions réelles, AntiGrounding associe a un seul évaluateur, désigne GPT-6 Astra, atteint 71,25% de réussite, contre 50,00% pour le modèle pi0.5 et 47,50% pour une base de référence de type PIVOT évaluée avec le même VLM. L'intérêt pour le secteur tient a l'alternative proposee aux modèles VLA généralistes entraines de bout en bout, comme pi0.5, GR00T N2 ou Helix, qui associent directement instruction et action: ici le VLM sert d'évaluateur dans une boucle de recherche et de notation de trajectoires géométriques, approche plus auditable pour la sécurité avant un déploiement industriel. L'écart avec pi0.5 (50,00%) sur les mêmes huit taches rappelle que les politiques VLA généralistes restent en dessous des attentes en conditions réelles, nuançant l'idée d'un sim-to-real déjà résolu a grande échelle. Les auteurs précisent toutefois que la performance reste bornée par la fidélité du jumeau numérique et par les aléa de l'interaction physique: il s'agit d'un travail de recherche publie sur arXiv, non d'un produit commercialise ni déployé en usine. Le travail s'inscrit dans la lignée des recherches combinant grands modèles vision-langage et planification robotique, aux cotes de politiques VLA comme pi0 et pi0.5 de Physical Intelligence ou GR00T N2 de NVIDIA, et se distingue de la méthode concurrente PIVOT en confiant au VLM un rôle de juge plutôt que de générateur direct d'action. Aucun acteur français ou européen, tel Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools, n'apparait dans ces travaux, qui restent pour l'instant un résultat de laboratoire sur huit taches, sans calendrier de pilote industriel annonce.

RechercheActu
1 source
FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage
3arXiv cs.RO 

FRAM : sélection de traits visuels guidée par la trajectoire pour manipulation robotique légère conditionnée au langage

Une équipe de recherche présente FRAM (Future Representation Action Model), un modèle vision-langage-action compact pour la manipulation robotique, dans une prépublication arXiv (2609.30965, fin septembre 2026). FRAM relie la trajectoire future de l'effecteur terminal à l'image courante : les coordonnées prédites servent de pointeurs spatiaux pour extraire les caractéristiques visuelles locales liées au mouvement. Les étiquettes de trajectoire sont générées automatiquement à partir des démonstrations et de la géométrie caméra, sans annotation manuelle. Avec 138,7 millions de paramètres, encodeur de langage figé compris, FRAM atteint 92,2 % de réussite moyenne sur les quatre suites LIBERO, contre 94,2 % pour Pi-0 de Physical Intelligence (3,3 milliards de paramètres, soit 24 fois plus), et 67,3 % sur LIBERO-Plus sans entraînement additionnel. Sur un robot réel à deux bras UR5e, il empile des gobelets avec les seules caméras de poignet, en choisissant et en changeant de bras selon les besoins. Ce résultat contredit l'idée reçue que la performance des modèles vision-langage-action dépend d'abord de leur taille : FRAM approche les scores de Pi-0 avec une fraction de ses paramètres, ce qui allège le calcul embarqué et facilite un déploiement sur du matériel moins coûteux, un point clé pour les intégrateurs cherchant à s'affranchir du cloud. L'étiquetage automatique des trajectoires supprime aussi une annotation manuelle coûteuse, frein habituel au passage à l'échelle des données de démonstration. Les scores sur LIBERO-Plus et la démonstration sur robot réel apportent un élément de réponse, mesuré toutefois sur un nombre restreint de tâches, à la question récurrente de l'écart entre démonstrations en laboratoire et robustesse réelle. FRAM s'inscrit dans un champ dominé par la course à l'échelle, incarnée par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, et par des humanoïdes comme Optimus de Tesla ou Figure 03, qui misent sur des milliards de paramètres pour généraliser. Cette prépublication, dont le statut de relecture par les pairs n'est pas précisé, défend la direction inverse de politiques compactes et spécialisées. Aucun partenaire industriel ni plan de déploiement commercial n'est mentionné : les résultats restent limités à des benchmarks simulés et à un seul bras collaboratif en laboratoire. L'étape suivante logique consisterait à étendre l'approche à davantage de tâches, de robots et de configurations de caméras avant d'envisager une intégration en production.

RechercheActu
1 source
ProxiDex : une politique de proximité guidée par la dynamique pour la manipulation dextérique
4arXiv cs.RO 

ProxiDex : une politique de proximité guidée par la dynamique pour la manipulation dextérique

Des chercheurs ont publié le 16 septembre 2026 sur arXiv (2609.16586) ProxiDex, un framework de manipulation dextre multi-doigts qui traite la proximité main-objet comme un état d'interaction. Le système reconstruit des nuages de points de la zone de contact et convertit les distances géométriques en indices de proximité, une représentation indépendante du matériel, utilisée aussi comme retour immersif en téléopération VR ; un modèle couplé avant-arrière prédit les états latents futurs à partir des actions et en déduit les variations de proximité, afin de stabiliser la politique quand la main masque la caméra. En simulation et en conditions réelles, sur des objets standards, inédits et sous perturbation, les auteurs rapportent des gains de taux de réussite et de robustesse face à des méthodes de référence, sans publier de chiffres précis dans le résumé. L'enjeu visé est l'incertitude de contact, un point faible connu des politiques de manipulation dextre : la caméra est occultée par la main pendant la préhension, et les capteurs tactiles imposent des modalités propres à chaque matériel ainsi qu'un calibrage coûteux qui freine le transfert d'une plateforme à une autre. En proposant une représentation géométrique agnostique au matériel, ProxiDex vise à réduire cette dépendance tout en gardant un signal utile quand la vision faiblit, un enjeu direct pour les intégrateurs devant faire tourner la même politique sur des mains robotiques différentes. Il s'agit toutefois d'une contribution académique sur arXiv, sans partenaire industriel ni déploiement sur robot commercial mentionné, ce qui invite à la prudence avant toute extrapolation vers un produit. Ce travail s'inscrit dans un fil de recherche actif sur les politiques apprises pour mains robotiques multi-doigts, partagé entre approches purement visuelles, pénalisées par les occlusions, et approches tactiles, qui exigent des capteurs dédiés et un réglage par plateforme ; ProxiDex se positionne comme une alternative fondée sur la géométrie de proximité plutôt que sur le contact physique mesuré. Le résumé ne précise ni affiliation institutionnelle ni calendrier de suite, les auteurs renvoyant vers le site proxidex.github.io pour des visualisations complémentaires. La prochaine étape attendue reste l'évaluation par les pairs et une éventuelle reprise du principe dans des politiques génériques de manipulation, où la robustesse au contact demeure un verrou pratique pour un déploiement industriel.

RecherchePaper
1 source