Aller au contenu principal
Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet
RecherchearXiv cs.RO 

Web2Grasp : apprendre la préhension fonctionnelle à partir d'images web d'interactions main-objet

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté sur arXiv (réf. 2505.05517) Web2Grasp, une méthode qui permet à des mains robotiques multi-doigts d'apprendre des saisies fonctionnelles à partir d'images web montrant des interactions main-objet humaines (HOI, hand-object interaction). Un modèle de reconstruction 3D pré-entraîné extrait des maillages HOI depuis des images RGB brutes ; un filtrage géométrique couplé à une simulation physique dans IsaacGym élimine ensuite les saisies infaisables et ne conserve que celles résistant à une perturbation externe. En simulation, le système atteint 75,8 % de réussite sur des objets tirés du dataset web et généralise à des objets non vus lors de l'entraînement. En conditions réelles, testé sur les mains robotiques LEAP Hand et Inspire Hand, il affiche 77,5 % de réussite sur 12 objets incluant des géométries difficiles : seringue, flacon spray, couteau et pince longue (tongs).

L'enjeu dépasse la simple prise en main : le "functional grasping" signifie que le robot saisit l'objet comme un humain l'utiliserait (couteau par le manche, spray par le corps), contrairement aux "power grasps" génériques qui dominent encore la littérature de manipulation robotique. La quasi-totalité des approches existantes nécessite des démonstrations en domaine spécifique, coûteuses à collecter objet par objet ; Web2Grasp court-circuite ce goulot en exploitant les images web comme supervision faible à coût quasi nul. Les 77,5 % en conditions réelles sur des formes atypiques sont encourageants, mais les conditions exactes d'évaluation (orientation initiale, variabilité d'éclairage, nombre d'essais par objet) ne sont pas précisées dans le résumé, ce qui invite à consulter le papier complet avant toute conclusion sur la robustesse industrielle.

La préhension fonctionnelle reste un problème ouvert : les datasets annotés manuellement comme DexYCB ou ContactPose sont onéreux à produire à grande échelle. L'exploitation d'interactions "in the wild" s'inscrit dans la tendance des VLA (vision-language-action models) comme Pi-0 ou OpenVLA, qui cherchent à réduire la dépendance aux démonstrations robotiques coûteuses. Web2Grasp s'oppose directement à des approches comme DexGraspNet ou UniDexGrasp, ainsi qu'aux pipelines basés sur la téléopération (travaux Dex-Pilot, Apple Research), en supprimant entièrement le besoin de démonstrations effectuées sur robot. La suite logique serait l'intégration dans des pipelines de manipulation complets (pick-and-place, assemblage orienté tâche) ; le site projet actif à web2grasp.github.io indique que les développements se poursuivent.

À lire aussi

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents
1arXiv cs.RO 

AGILE : reconstruction des interactions main-objet à partir de vidéo par génération à base d'agents

Une équipe de chercheurs a présenté AGILE (arXiv:2602.04672v3), un framework de reconstruction d'interactions dynamiques main-objet à partir de vidéos monoculaires, ciblant deux applications majeures : la collecte de données pour la manipulation dextère en robotique et la création de jumeaux numériques pour la simulation et la réalité virtuelle. La méthode s'attaque à deux verrous techniques qui paralysent les approches existantes : d'une part, le rendu neuronal classique produit sous forte occultation des géométries fragmentées, inutilisables directement en simulation physique ; d'autre part, l'initialisation par Structure-from-Motion (SfM) est notoriellement fragile sur des vidéos captées en conditions réelles. AGILE bascule du paradigme de reconstruction vers ce que les auteurs appellent une "génération agentique" : un Vision-Language Model (VLM) pilote un modèle génératif pour synthétiser un mesh objet complet, fermé (watertight) et texturé haute fidélité, sans dépendre du contenu vidéo occulté. Une stratégie dite "anchor-and-track" initialise la pose de l'objet sur une unique frame d'interaction via un modèle fondation, puis propage cette pose temporellement en exploitant la similarité visuelle entre l'asset généré et les frames vidéo. Une optimisation finale dite contact-aware intègre des contraintes sémantiques, géométriques et de stabilité d'interaction pour garantir la plausibilité physique. Sur les benchmarks HO3D, DexYCB et ARCTIC, AGILE surpasse les baselines en précision géométrique globale. L'intérêt industriel de cette approche réside dans la production d'assets directement exploitables en simulation, une propriété validée par les auteurs via du retargeting real-to-sim pour des applications robotiques. C'est précisément le point de friction qui freinait l'adoption des pipelines de reconstruction vidéo dans les boucles d'entraînement de politiques de manipulation : les meshes obtenus par NeRF ou reconstruction multi-vues classique nécessitaient un travail de remaillage manuel avant d'être injectables dans un moteur physique comme MuJoCo ou Isaac Sim. En contournant le SfM, AGILE devient également utilisable sur des données de terrain non contrôlées, ce qui ouvre la voie à la collecte passive de démos humaines à grande échelle, un prérequis pour les approches VLA (Vision-Language-Action) qui peinent encore à obtenir suffisamment de trajectoires dextères annotées. Le problème de la reconstruction main-objet est étudié depuis plusieurs années, avec des datasets de référence comme HO-3D (2020) et DexYCB (2021), et des méthodes basées sur les modèles paramétriques MANO pour la main. L'originalité d'AGILE est de déporter la reconstruction de l'objet vers une génération guidée, plutôt que de l'estimer directement depuis le signal vidéo dégradé. Les concurrents directs sont les méthodes NeRF-based adaptées aux scènes dynamiques (D-NeRF, HO-NeRF) et les pipelines SfM+MVS classiques, tous sensibles aux occultations. Du côté des acteurs industriels, cette direction intéresse directement les équipes travaillant sur la télé-opération et l'imitation learning pour bras robotiques dextères, notamment chez Dexterous Robotics, Physical Intelligence (Pi) ou les labos académiques proches de Figure et Apptronik. Le projet dispose d'une page dédiée (agile-hoi.github.io) ; aucun code ni dataset supplémentaire n'est annoncé à ce stade.

RecherchePaper
1 source
Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet
2arXiv cs.RO 

Weave : apprentissage de la loco-manipulation dextérique du corps entier par interactions humain-objet

Une équipe de recherche publie sur arXiv, le 16 septembre 2026 (arXiv:2609.16683), Weave, un framework pour apprendre à des robots humanoïdes la loco-manipulation dextre en corps entier à partir de démonstrations humaines capturées. Ces interactions humain-objet sont converties en références exécutables par le robot via un retargeting sensible aux contacts et une complétion du mouvement d'approche. Une politique consciente des contacts et de la géométrie commande ensuite simultanément 29 articulations corporelles et 12 articulations de doigts actionnées, sur plusieurs objets et séquences d'interaction. Sur neuf objets testés, le taux de réussite atteint 92,5 % pour les interactions entraînées et 65,0 % pour des séquences totalement inédites, sans entraînement supplémentaire. Les auteurs publient aussi environ 9 000 exécutions physiques réelles, soit près de 23 heures de trajectoires robot-objet annotées en contacts. Coordonner équilibre, locomotion et contact dextre des doigts reste l'un des obstacles majeurs pour faire passer les humanoïdes de la démonstration scriptée à la manipulation réelle d'objets variés, un enjeu direct pour les intégrateurs visant l'entrepôt ou l'usine. En retargetant des captures de mouvement humain vers l'embodiment du robot, Weave s'attaque frontalement au fossé entre démonstration et contrôle réel. Le score de 65 % sur des séquences jamais vues, même limité à neuf objets, suggère que la politique apprend des primitives de contact réutilisables plutôt que de simples trajectoires mémorisées, une distinction clé face aux démonstrations vidéo soigneusement sélectionnées courantes dans le secteur. Le jeu de données publié constitue par ailleurs une ressource comparable, dans son esprit, aux corpus servant à entraîner des modèles vision-langage-action comme Pi-0 ou GR00T N2. Il s'agit d'un travail de recherche en preprint, sans partenaire industriel ni plateforme robotique nommée dans le résumé, pas encore relu par les pairs : une démonstration de laboratoire, non un produit déployé ni un pilote commercial. Weave s'inscrit dans la vague de recherches sur l'apprentissage par imitation à partir de capture de mouvement humain, aux côtés d'initiatives comme Helix chez Figure ou les politiques de Physical Intelligence, qui visent toutes à résoudre le transfert humain-vers-robot pour la manipulation dextre. Aucun calendrier de déploiement n'est annoncé ; la suite logique, ouverte par la publication du jeu de données, est son adoption par d'autres équipes pour entraîner ou évaluer leurs propres politiques d'interaction, plutôt qu'un lancement produit à court terme.

RecherchePaper
1 source
IntentNav : apprendre la navigation spatiale vers des objets à partir de démonstrations humaines
3arXiv cs.RO 

IntentNav : apprendre la navigation spatiale vers des objets à partir de démonstrations humaines

Une équipe de recherche anonyme a soumis le 9 juin 2026 un préprint arXiv (2606.08029) présentant IntentNav, un framework d'imitation spatiale et visuelle pour la navigation autonome par objets (ObjectNav). La tâche consiste à envoyer un robot chercher un objet non observé dans un environnement inconnu, sans carte préalable, en décidant en temps réel où explorer sous observabilité partielle. L'architecture repose sur deux briques complémentaires : une mémoire BEV (Bird's Eye View) qui encode les régions explorées, les frontières inexplorées et l'historique de trajectoire, et une mémoire visuelle égocentrique qui associe des indices sémantiques à chaque frontière candidate. Un modèle de langage et de vision (VLM) est entraîné sur des démonstrations humaines pour sélectionner la prochaine frontière à explorer, guidé par un "Frontier-based Human-Intent Labeling" qui inspecte en avant les trajectoires humaines pour identifier quelle frontière explique le mieux la direction de recherche du démonstrateur. Les auteurs annoncent des performances état de l'art sur les benchmarks MP3D, HM3D-v1 et HM3D-v2. Le point le plus saillant pour les intégrateurs est le transfert zéro-shot : la même politique VLM, sans fine-tuning supplémentaire, est transférée à trois morphologies distinctes, robot à roues, quadrupède et humanoïde. Cela suppose que l'interface candidate-level fonctionne comme une couche d'abstraction suffisamment générique pour s'affranchir des particularités cinématiques propres à chaque plateforme. Pour un COO industriel, cela ouvre la perspective d'un seul modèle de navigation entraîné sur des démonstrations humaines capable de piloter des flottes hétérogènes sans retraining par morphologie. Réserve importante : la démonstration sim-to-real reste confinée aux benchmarks de simulation Matterport3D et HM3D ; aucun résultat sur hardware physique réel n'est rapporté dans le préprint, ce qui laisse entier le gap entre benchmark et déploiement terrain. IntentNav s'inscrit dans un champ actif où des approches concurrentes comme SemExp (Chaplot et al., 2020), ZSON (Majumdar et al., 2022) ou les méthodes VLM zéro-shot telles qu'EmbodiedGPT et OpenFMNav se disputent la tête des benchmarks HM3D. La contribution distinctive est l'extraction d'intention de haut niveau à partir d'actions humaines de bas niveau via le labeling de frontières, une alternative à l'apprentissage par renforcement pur qui souffre de la rareté des récompenses dans les grands espaces d'exploration. La soumission étant anonyme, affiliations et financements ne sont pas divulgués ; une page projet est référencée sans contenu pleinement accessible à ce stade.

RechercheOpinion
1 source
Apprentissage de la préhension pour atteindre des poses 6D générales avec un objet en main
4arXiv cs.RO 

Apprentissage de la préhension pour atteindre des poses 6D générales avec un objet en main

Des chercheurs ont publié sur arXiv (2609.13761) un système nommé POISE, pour Palm-relative Object reaching In SE(3), qui permet à une main robotique multi-doigts de déplacer un objet déjà saisi vers une pose cible en position et orientation, soit six degrés de liberté, sans le relâcher ni le regripper. L'architecture combine apprentissage par renforcement sim-to-real, initialisation par prises stables diversifiées, contrôle conditionné par la géométrie de l'objet et curriculum adaptatif de cibles 6D. En simulation, diversifier les prises initiales fait grimper la réussite sur des prises inédites de 40,1% à 51,5%, et la récupération après chute d'objet de 33,8% à 72,9%; le curriculum porte la réussite sur l'ensemble des poses possibles de 6,2% à 59,5%. Sur le robot physique, la récompense de maintien de prise fait passer la réussite d'une séquence de trois cibles de 20% à 80%; le système atteint ensuite des cibles 6D successives sans réinitialisation manuelle, sur plusieurs objets et orientations de poignet, en récupérant de perturbations externes. Ce travail comble un manque des méthodes de manipulation dextre actuelles, souvent limitées à la rotation continue ou à la translation isolée plutôt qu'au contrôle conjoint de position et d'orientation depuis une prise existante. Pour les intégrateurs industriels, cette capacité peut réduire les cycles de reprise de prise et les déplacements de bras lors du repositionnement de pièces en assemblage fin ou en logistique. L'écart entre 6,2% et 59,5% selon la présence du curriculum montre toutefois que le sim-to-real reste fragile sur cette tâche 6D complète. Il s'agit d'une prépublication non évaluée par les pairs, testée en laboratoire, sans main robotique commerciale nommée ni volume ou prix annoncés. La recherche s'inscrit dans le champ de la manipulation dextre multi-doigts, où les démonstrations publiques se limitent souvent à la réorientation par rotation ou à des repositionnements grossiers, plutôt qu'au contrôle simultané des six degrés de liberté. Elle se distingue des politiques génériques de type VLA, telles que celles associées aux modèles Pi-0 ou GR00T N2, en ciblant spécifiquement la sous-tâche de repositionnement en main plutôt qu'un contrôle de bout en bout. Les auteurs annoncent la publication du code sur un site dédié au projet, sans calendrier de pilote industriel ni partenaire matériel précisé, et aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source