Aller au contenu principal
RecherchearXiv cs.RO 

OmniDex : passage à l'échelle de la préhension à main dextérique dans des scènes encombrées variées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.11194) OmniDex, un benchmark et un modèle de préhension dextre pour scènes encombrées. Le jeu de données couvre plus de 2,6 millions de scènes et 0,4 milliard de vérités terrain de prises (« grasp ground truths ») spécifiques à chaque scène. Les auteurs ont d'abord sélectionné des objets 3D de haute qualité ainsi que des supports (tables, étagères et autres bases d'appui). Ils ont ensuite généré les scènes avec une stratégie « seed-and-filter » : on génère des agencements candidats, puis on filtre ceux qui sont physiquement valides. Cela évite l'optimisation lente, scène par scène, qui limitait jusqu'ici le passage à l'échelle. Chaque scène est associée à des observations sémantiques et géométriques riches. Le modèle OmniDex est génératif. Il combine un apprentissage « Soft Winner-Takes-All », qui traite la multimodalité des prises (plusieurs saisies valides pour un même objet), avec des contraintes physiques inspirées de la main humaine pendant l'entraînement. À l'inférence, un classement piloté par la physique sélectionne la meilleure prise, sans étape d'optimisation a posteriori. Les auteurs annoncent des performances à l'état de l'art et une bonne généralisation à travers des scènes, des points de vue et des objets inconnus.

Pour l'industrie, l'enjeu est la donnée. La préhension dextre est la brique de base des humanoïdes et des manipulateurs à main articulée, mais la collecte réelle coûte cher et les jeux de données en simulation portaient surtout sur des objets isolés, alors que les cas d'usage (bacs, étagères, postes de tri) sont encombrés. Un corpus de cette taille, produit sans optimisation par scène, suggère que la simulation peut fournir des volumes comparables à ceux de la vision par ordinateur. La suppression de la post-optimisation compte aussi pour les intégrateurs, car cette étape ajoute de la latence au temps de cycle. Il faut toutefois rester prudent. L'étude est un preprint, et les résultats sont mesurés en simulation. Le papier ne fournit, dans ce résumé, ni taux de réussite chiffrés, ni validation sur matériel réel, ni temps d'inférence. Le fossé sim-to-real reste donc la vraie question, notamment pour la « précision du dernier millimètre » que les auteurs jugent défaillante chez les modèles génératifs actuels.

Ce travail s'inscrit dans une série de benchmarks de préhension à grande échelle, qui ont d'abord traité les pinces parallèles puis les mains dextres sur objets seuls. Les modèles génératifs (diffusion, flow matching) y dominent, mais ils souffrent de prises imprécises qui exigent un affinage coûteux. OmniDex veut montrer qu'un classement physique peut remplacer cet affinage. Les acteurs concurrents sont les équipes qui préparent des politiques VLA pour humanoïdes et mains dextres, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0. Elles pourraient exploiter ce type de données comme pré-entraînement ou comme module de préhension. Aucun calendrier de diffusion du code ou du jeu de données n'est précisé ici. Le test décisif sera une démonstration sur main réelle en bac encombré, avec des taux de réussite publiés.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique
1arXiv cs.RO 

De la préhension à la dextérité : pré-entraînement à grande échelle pour la manipulation dextérique

Des chercheurs publient sur arXiv un nouveau papier intitulé "From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation", qui s'attaque à un problème precis de la manipulation dextre robotique: utiliser un simple geste de préhension pour ensuite manipuler un outil articulé (actionner une gâchette, tourner une molette, ouvrir une pince) plutôt que de simplement le saisir et le poser. L'équipe construit un jeu de données de 355 000 trajectoires à partir d'annotations de préhension dextre à grande échelle, utilisé pour préentraîner un contrôleur bas niveau conditionné par objectif, lui-même piloté par un module haut niveau qui prédit les sous-objectifs de la main. Ce contrôleur est ensuite affiné sur des démonstrations spécifiques à chaque tâche. Pour évaluer l'approche, les auteurs introduisent DexCraft, un banc d'essai en simulation comportant six tâches d'usage d'outils articulés nécessitant une coordination fine des doigts. En conditions réelles, la méthode améliore le taux de réussite complet des tâches de 33,3 points de pourcentage par rapport à la référence DP3, et dépasse aussi les politiques de diffusion entraînées de bout en bout ainsi que les architectures hiérarchiques entraînées depuis zéro. L'intérêt pour l'industrie tient au fait que la plupart des grands jeux de données de préhension dextre existants n'avaient jusqu'ici servi qu'à générer des prises ou à faire du pick-and-place, une tâche relativement simple comparée à l'usage fonctionnel d'un outil, qui exige de maintenir le contact tout en actionnant une pièce mobile. Démontrer qu'un préentraînement sur des données de grasping generalise à ce type de manipulation contact-riche est un signal utile pour les équipes qui travaillent sur des mains robotiques multi-doigts, notamment dans le contexte des humanoïdes où la dextérité fine reste un goulot d'étranglement bien plus limitant que la locomotion. Cela va dans le sens d'une hypothèse défendue par plusieurs laboratoires: les grands corpus de démonstration, même génériques, peuvent servir de socle de préentraînement réutilisable plutôt que d'être collectés tâche par tâche. Ce travail s'inscrit dans la lignée des approches hiérarchiques d'apprentissage par imitation combinant planification haut niveau et contrôle bas niveau, un courant de recherche actif face aux politiques de diffusion de bout en bout comme DP3, utilisées ici comme référence de comparaison. Il s'agit à ce stade d'un résultat académique publié sur arXiv, testé en simulation via DexCraft et validé par des expériences réelles limitées, et non d'un système déployé commercialement. Les auteurs mettent à disposition des vidéos de démonstration sur leur page de projet, mais aucune date de mise en open source du code ni de partenariat industriel n'est mentionnée dans le résumé.

RecherchePaper
1 source
Dextérité extrinsèque émergente en scènes encombrées via l'apprentissage de politique sensible à la dynamique
2arXiv cs.RO 

Dextérité extrinsèque émergente en scènes encombrées via l'apprentissage de politique sensible à la dynamique

Des chercheurs ont publié DAPL (Dynamics-Aware Policy Learning), un cadre d'apprentissage par renforcement destiné à la manipulation non-préhensile en environnements encombrés. L'approche exploite la "dextérité extrinsèque" - la capacité d'un robot à utiliser les contacts avec l'environnement pour déplacer des objets sans les saisir directement - dans des configurations où plusieurs objets interagissent avec des dynamiques couplées. La nouveauté centrale est une représentation apprise des dynamiques de contact, construite via un modèle du monde explicite, qui conditionne ensuite la politique de RL sans recourir à des heuristiques codées manuellement ni à un reward shaping complexe. En simulation, DAPL surpasse de plus de 25 % les approches de manipulation préhensile, la télé-opération humaine et les politiques à représentation implicite, évaluées sur des scènes encombrées à densité variable non vues à l'entraînement. En conditions réelles, le taux de succès atteint environ 50 % sur dix scènes distinctes, avec un déploiement pilote en contexte épicerie pour valider le transfert sim-to-real. Ce résultat adresse un verrou concret en robotique de manipulation : la plupart des systèmes industriels actuels évitent le désordre ou le gèrent par des stratégies d'isolement d'objets, coûteuses en infrastructure. L'émergence de comportements de contact sans ingénierie manuelle des heuristiques représente un pas vers des robots capables de travailler dans des bacs en vrac, des rayons de supermarché ou des convoyeurs non triés. Le gain de 25 % en simulation est significatif, mais les 50 % de succès en conditions réelles appellent à la prudence : les détails sur le type d'objets, la densité exacte et la vitesse d'exécution ne sont pas fournis dans le résumé, ce qui rend difficile toute comparaison directe avec des systèmes comme Sparrow d'Amazon Robotics ou les approches de Covariant AI. La dextérité extrinsèque est un axe de recherche actif depuis une décennie, porté notamment par les groupes de Carnegie Mellon, MIT et ETH Zurich autour du pushing, du pivoting et de la singulation d'objets. DAPL s'inscrit dans cette continuité en ajoutant le world modeling explicite comme composant structurant du pipeline. Le preprint, disponible en version v2 sur arXiv (2603.09882), a été révisé depuis sa soumission initiale, signe d'un affinement des résultats ou des analyses sous revue par les pairs. Aucune timeline de déploiement commercial n'est annoncée ; l'étape logique serait une validation en entrepôt réel sur des volumes plus importants et avec des contraintes de cadence industrielle.

RecherchePaper
1 source
Modèles du monde à embodiment croisé : passage à l'échelle pour la manipulation dextérique
3arXiv cs.RO 

Modèles du monde à embodiment croisé : passage à l'échelle pour la manipulation dextérique

Résumé des risques : aucun outil nécessaire, ceci est une tâche de traduction/synthèse d'article. Voici le texte. Une équipe de recherche propose dans un article publié sur arXiv (2511.01177v3, version révisée) une nouvelle approche pour construire des modèles du monde partagés entre différentes morphologies de mains, robotiques comme humaines. Le problème posé est concret : les différences de cinématique et d'espaces d'action entre robots empêchent aujourd'hui de mutualiser les données d'entraînement et de transférer du contrôle d'un système à l'autre. Les chercheurs représentent les mains, humaines et robotiques, comme des ensembles de particules 3D, et définissent les actions comme des champs de déplacement de ces particules à l'extrémité effectrice. Cette abstraction géométrique s'affranchit des espaces articulaires propres à chaque plateforme tout en conservant la géométrie et le mouvement pertinents pour l'interaction physique. Le modèle du monde, basé sur des réseaux de graphes, est entraîné sur des données d'interaction aléatoires issues de mains robotiques simulées variées et de mains humaines réelles, puis couplé à du contrôle prédictif par modèle (MPC) pour piloter du matériel inédit. Les expériences, menées sur des tâches de manipulation d'objets rigides et déformables, dégagent trois résultats. D'abord, plus la diversité des morphologies utilisées à l'entraînement est grande, meilleure est la généralisation à des mains jamais vues. Ensuite, combiner données simulées et données réelles dans de bonnes proportions surpasse l'usage de l'une ou l'autre source seule. Enfin, un même modèle appris permet de contrôler efficacement des mains robotiques aux cinématiques et degrés de liberté (DOF) distincts. Pour le secteur, ces résultats intéressent directement la question du transfert de compétences entre plateformes hétérogènes, un verrou connu pour les approches VLA classiques qui restent souvent liées à un espace d'action fixe. Il s'agit d'un travail de recherche académique, pas d'un produit ni d'un déploiement industriel : aucune entreprise, aucun robot commercial n'est nommé, et les résultats sont obtenus en environnement contrôlé, majoritairement simulé. La méthode s'inscrit dans la lignée des travaux récents sur les modèles du monde et le contrôle prédictif appliqués à la manipulation dextre, un axe de recherche actif face aux limites de généralisation des politiques bout-en-bout entraînées par embodiment.

RecherchePaper
1 source
RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique
4arXiv cs.RO 

RoboTok : un moteur de données à l'échelle d'Internet pour la recherche de démonstrations humaines et l'apprentissage de la préhension dextérique

Un article publié sur arXiv (référence 2609.03199v1, catégorie « cross-listing » signalant un intérêt à la fois pour la robotique et la vision par ordinateur) présente RoboTok, un moteur de données conçu pour exploiter des vidéos humaines à l'échelle d'internet afin d'entraîner des politiques robotiques de manipulation dextre. Le système part d'une vidéo requête montrant une manipulation humaine, puis recherche dans de vastes collections de vidéos web des démonstrations pertinentes pour la même tâche. Techniquement, RoboTok apprend un espace de mouvement latent à partir de trajectoires 3D de la main, exprimées dans des repères centrés sur l'acteur estimés automatiquement, ce qui permet de comparer des gestes de manipulation malgré des différences de point de vue caméra, d'apparence de scène ou d'occlusions partielles de l'acteur. Cette représentation reste suffisamment compacte pour permettre une recherche efficace et une indexation continue sur des corpus vidéo de très grande taille. Les auteurs comparent RoboTok à des méthodes existantes de récupération de données robotiques, sur des benchmarks de recherche et sur la performance de politiques robotiques en aval, sans toutefois préciser dans le résumé les chiffres exacts de gain, ni les tâches ou plateformes robotiques testées. L'enjeu principal visé par ce travail est le goulot d'étranglement bien identifié de l'apprentissage robotique : collecter des données directement sur robot reste coûteux et ne permet pas de couvrir la longue traîne des tâches réelles rencontrées en manipulation. En proposant une méthode de récupération sensible à la pose de la main plutôt qu'à l'apparence brute, RoboTok cherche à transformer la vidéo web, ressource déjà abondante et en croissance continue, en une source de supervision exploitable et évolutive pour l'entraînement de politiques. Pour les intégrateurs et équipes de recherche en robotique dextre, cela s'inscrit dans une tendance plus large consistant à s'appuyer sur des données humaines non robotiques pour réduire la dépendance à la téléopération coûteuse, sans toutefois démontrer ici un déploiement matériel réel ni un produit commercialisé : il s'agit d'une contribution méthodologique et expérimentale, évaluée sur benchmarks académiques. Le papier se positionne dans la lignée des approches récentes de pré-entraînement robotique à partir de vidéos humaines à grande échelle, une direction de recherche active pour contourner la rareté des données robot réelles. Le résumé ne mentionne ni entreprise, ni laboratoire nommé, ni calendrier de suite ; il s'agit à ce stade d'une publication de recherche, pas d'une annonce produit ou d'un pilote industriel.

RecherchePaper
1 source