Aller au contenu principal
Manipulation prensile et non prensile simultanées : une approche pratique des tâches dextres multi-étapes
RecherchearXiv cs.RO 

Manipulation prensile et non prensile simultanées : une approche pratique des tâches dextres multi-étapes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent DexMulti, une méthode d'apprentissage pour mains robotiques dextres capables de manipulation concurrente préhensile et non préhensile, c'est-à-dire tenir un objet tout en agissant sur un second. L'article, publié sur arXiv (2603.11655, version révisée), a été testé sur trois tâches multi-étapes représentatives de gestes du quotidien : saisir et tirer, saisir et ouvrir, saisir et saisir. Les essais ont été menés sur deux mains robotiques différentes, Allegro et LEAP, pour un total de plus de 1 000 essais en conditions réelles. Avec seulement 3 à 4 démonstrations par objet, DexMulti atteint un taux de réussite moyen de 66 % sur les objets d'entraînement, soit 2 à 3 fois mieux que les politiques de diffusion utilisées comme référence, tout en nécessitant nettement moins de données. La méthode généralise aussi à des objets jamais vus et à des variations spatiales allant jusqu'à 25 centimètres.

L'intérêt de ces résultats tient moins à la performance brute qu'à l'efficacité d'apprentissage : la manipulation dextre multi-objets et riche en contacts est réputée gourmande en données pour les politiques de bout en bout, ce qui freine leur déploiement réel. En démontrant qu'une poignée de démonstrations par objet suffit à obtenir un comportement robuste et généralisable, ces travaux répondent directement à l'un des goulots d'étranglement identifiés dans l'apprentissage par imitation pour la robotique dextre, un enjeu qui concerne aussi bien les laboratoires de recherche que les intégrateurs cherchant à déployer des mains robotiques dans des tâches industrielles ou domestiques variées sans réentraînement massif à chaque nouvel objet.

Plutôt que d'entraîner une politique monolithique, DexMulti décompose les démonstrations en compétences centrées sur l'objet, dotées de frontières temporelles claires, puis les récupère et les aligne sur l'état observé de l'objet via un estimateur qui suit son centre et son orientation, avant de les exécuter selon un paradigme de récupération-alignement-exécution. Cette architecture s'inscrit dans une tendance plus large de la recherche en manipulation dextre, qui cherche des alternatives aux politiques de diffusion et aux modèles vision-langage-action entraînés de bout en bout, jugés trop coûteux en données pour certaines tâches contraintes. Les auteurs annoncent vouloir étendre l'approche à un plus grand nombre de tâches et de configurations d'objets dans de futurs travaux.

À lire aussi

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation
1arXiv cs.RO 

DexVerse : un référentiel modulaire pour la manipulation dextre multi-tâche et multi-incarnation

Un consortium de chercheurs présente DexVerse, un benchmark modulaire à grande échelle pour la manipulation dextre multi-tâches et multi-embodiments. L'ensemble couvre 100 tâches réparties sur des compétences variées : saisie et déplacement d'objets, interaction avec des objets articulés, usage fonctionnel d'outils, coordination bimanuelle, contrôle non préhensile, comportements riches en contact, exécution multi-objectifs et tâches longues à plusieurs étapes. Le système prend en charge 3 bras robotiques et 6 mains dextres différentes, et reste extensible à de nouvelles tâches, de nouveaux actifs et de nouveaux embodiments. Pour tester la généralisation visuomotrice, DexVerse propose des variations visuelles paramétrables (textures, arrière-plans, éclairage, points de vue caméra). Les auteurs fournissent aussi une interface de téléopération en réalité virtuelle ainsi que 3 180 démonstrations avec observations synchronisées : données proprioceptives, images RGB, profondeur, nuages de points et états. Quatre méthodes représentatives ont été évaluées sur 19 tâches : Diffusion Policy, DP3, OpenVLA et π0.5. Les résultats révèlent des difficultés importantes de généralisation entre tâches et de robustesse visuomotrice, même pour ces politiques d'apprentissage jugées à la pointe. Pour l'industrie robotique, ce constat vient nuancer l'enthousiasme actuel autour des modèles VLA (vision-langage-action) présentés comme des solutions généralistes prêtes à l'échelle : DexVerse montre que la performance chute nettement dès que les conditions visuelles ou la nature de la tâche s'écartent du contexte d'entraînement. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent des politiques de manipulation dextre avant déploiement industriel : la démonstration en laboratoire ne garantit pas la robustesse en conditions réelles variables. DexVerse s'inscrit dans une lignée de benchmarks robotiques cherchant à dépasser les évaluations sur tâche isolée, un manque identifié dans les jeux d'essai existants, limités en diversité de tâches, de couverture d'embodiments ou de variation visuelle contrôlable. En couvrant simultanément plusieurs bras, plusieurs mains et un large éventail de conditions, il se positionne comme un terrain d'essai de référence pour comparer des approches comme Diffusion Policy ou les modèles de la famille π face à des architectures VLA telles qu'OpenVLA. La page du projet est disponible à l'adresse ycyao216.github.io/DexVerse.site, laissant présager de futures évaluations élargies et l'ajout d'autres méthodes et tâches.

RecherchePaper
1 source
DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main
2arXiv cs.RO 

DexCompose : réutiliser des politiques dextériques pour la manipulation multi-tâche avec une seule main

DexCompose est un framework de composition de politiques robotiques présenté dans une prépublication arXiv (identifiant 2606.28323) en juin 2026. Son objectif : permettre à une main robotique dextère d'enchaîner plusieurs tâches sans réentraîner les politiques existantes depuis zéro. Le système atteint un taux de succès composite moyen de 77,4 % sur 16 tâches combinées, construites en croisant quatre compétences de rétention d'objet avec quatre interactions aval. L'ensemble de l'évaluation est conduit en simulation ; aucune validation sur hardware réel n'est présentée dans ce papier. Le problème central que DexCompose attaque est celui de l'interférence destructive entre politiques : lorsqu'une main doit simultanément maintenir une prise (tâche 1) et exécuter une nouvelle action (tâche 2), les deux politiques se disputent le contrôle des mêmes doigts, avec des conflits de modes de contact qui dégradent les deux. La réponse proposée est une notion de propriété d'action au niveau du doigt (finger-level action ownership) : le système identifie d'abord quels doigts sont nécessaires au maintien du résultat de la première compétence via des tests de relâche sur des masques candidats, puis entraîne deux modules résiduels asymétriques. Un stabilisateur résiduel borné préserve la tâche en cours ; un résiduel contextuel n'adapte la politique aval que dans le sous-espace d'action assigné à la nouvelle tâche. Pour les ingénieurs en manipulation, cela réduit potentiellement le coût de réentraînement à chaque nouvelle combinaison de tâches, sans toucher aux politiques de base préentraînées. La manipulation dextère multi-tâches avec une seule main est un problème ouvert depuis des années, les approches classiques de chaînage de politiques (policy chaining) échouant précisément sur ces conflits de contact. Des groupes chez Stanford, CMU ou Google DeepMind travaillent sur des architectures voisines, et des mains commerciales comme la Shadow Hand ou l'Allegro Hand constituent les bancs de test habituels du domaine. DexCompose se positionne comme une alternative structurée au fine-tuning complet ou aux hiérarchies de contrôleurs. Le gap sim-to-real sur la manipulation dextère reste cependant le défi non résolu de la discipline, et ce papier, encore en prépublication, n'y répond pas : une validation physique sur hardware réel constituerait l'étape déterminante avant toute considération industrielle.

RecherchePaper
1 source
ShapeGrasp : complétion de forme et préhension visuo-haptiques simultanées pour une manipulation robotique améliorée
3arXiv cs.RO 

ShapeGrasp : complétion de forme et préhension visuo-haptiques simultanées pour une manipulation robotique améliorée

ShapeGrasp est un pipeline de manipulation robotique itératif présenté en mai 2025 sur arXiv (2605.02347), qui couple reconstruction de forme 3D implicite avec planification de saisie par simulation physique. À partir d'une seule image RGB-D, le système infère la forme complète d'un objet partiellement occulté (nuage de points ou maillage triangulaire), génère des candidats de saisie par simulation de corps rigides, puis exécute la prise jugée optimale. Après chaque tentative, les contacts tactiles enregistrés et le volume occupé par le préhenseur sont fusionnés pour affiner le modèle 3D de l'objet. En cas d'échec, le système re-estime la pose et re-planifie depuis la forme mise à jour. Validé sur deux robots distincts et deux types de préhenseurs, l'approche atteint 84 % de taux de succès avec un préhenseur à trois doigts et 91 % avec un préhenseur à deux doigts, tout en améliorant la qualité de reconstruction 3D sur l'ensemble des métriques retenues. La manipulation d'objets inconnus ou partiellement visibles reste un verrou majeur en robotique industrielle. La plupart des systèmes de grasping actuels reposent sur une estimation visuelle initiale figée, sans correction post-tentative. ShapeGrasp introduit une boucle de raffinement perceptif où chaque échec enrichit la représentation géométrique de l'objet, reproduisant ainsi la stratégie d'exploration tactile humaine face à un objet non familier. Les auteurs affirment qu'il s'agit de la première approche à mettre à jour une représentation de forme après une saisie réelle, et non en simulation, ce qui comble un écart important entre résultats de labo et conditions opérationnelles réelles. Pour les intégrateurs industriels, cette correction itérative réduit la dépendance aux modèles CAO préalables et aux conditions d'éclairage maîtrisées, deux contraintes structurantes dans les environnements de production variables. La complétion de forme pour la manipulation robotique croise vision 3D (réseaux d'occupation implicite, PointNet) et perception tactile (capteurs GelSight, Digit). Des systèmes concurrents comme Contact-GraspNet ou GraspNeRF opèrent sur des représentations visuelles statiques, sans exploitation du retour haptique post-saisie. ShapeGrasp s'inscrit dans une tendance plus large de systèmes multimodaux couplant vision et proprioception, visible également dans les plateformes humanoïdes récentes (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA). Le travail est actuellement un preprint arXiv non encore soumis à une conférence majeure du domaine (ICRA, IROS, RSS), et les conditions expérimentales détaillées, notamment les familles d'objets testés, les vitesses de cycle et les contraintes d'environnement, n'ont pas encore été publiées dans leur intégralité.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
4arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source