OmniDex : passage à l'échelle de la préhension à main dextérique dans des scènes encombrées variées
Des chercheurs publient sur arXiv (2610.11194) OmniDex, un benchmark et un modèle de préhension dextre pour scènes encombrées. Le jeu de données couvre plus de 2,6 millions de scènes et 0,4 milliard de vérités terrain de prises (« grasp ground truths ») spécifiques à chaque scène. Les auteurs ont d'abord sélectionné des objets 3D de haute qualité ainsi que des supports (tables, étagères et autres bases d'appui). Ils ont ensuite généré les scènes avec une stratégie « seed-and-filter » : on génère des agencements candidats, puis on filtre ceux qui sont physiquement valides. Cela évite l'optimisation lente, scène par scène, qui limitait jusqu'ici le passage à l'échelle. Chaque scène est associée à des observations sémantiques et géométriques riches. Le modèle OmniDex est génératif. Il combine un apprentissage « Soft Winner-Takes-All », qui traite la multimodalité des prises (plusieurs saisies valides pour un même objet), avec des contraintes physiques inspirées de la main humaine pendant l'entraînement. À l'inférence, un classement piloté par la physique sélectionne la meilleure prise, sans étape d'optimisation a posteriori. Les auteurs annoncent des performances à l'état de l'art et une bonne généralisation à travers des scènes, des points de vue et des objets inconnus.
Pour l'industrie, l'enjeu est la donnée. La préhension dextre est la brique de base des humanoïdes et des manipulateurs à main articulée, mais la collecte réelle coûte cher et les jeux de données en simulation portaient surtout sur des objets isolés, alors que les cas d'usage (bacs, étagères, postes de tri) sont encombrés. Un corpus de cette taille, produit sans optimisation par scène, suggère que la simulation peut fournir des volumes comparables à ceux de la vision par ordinateur. La suppression de la post-optimisation compte aussi pour les intégrateurs, car cette étape ajoute de la latence au temps de cycle. Il faut toutefois rester prudent. L'étude est un preprint, et les résultats sont mesurés en simulation. Le papier ne fournit, dans ce résumé, ni taux de réussite chiffrés, ni validation sur matériel réel, ni temps d'inférence. Le fossé sim-to-real reste donc la vraie question, notamment pour la « précision du dernier millimètre » que les auteurs jugent défaillante chez les modèles génératifs actuels.
Ce travail s'inscrit dans une série de benchmarks de préhension à grande échelle, qui ont d'abord traité les pinces parallèles puis les mains dextres sur objets seuls. Les modèles génératifs (diffusion, flow matching) y dominent, mais ils souffrent de prises imprécises qui exigent un affinage coûteux. OmniDex veut montrer qu'un classement physique peut remplacer cet affinage. Les acteurs concurrents sont les équipes qui préparent des politiques VLA pour humanoïdes et mains dextres, comme Figure avec Helix, NVIDIA avec GR00T ou Physical Intelligence avec Pi-0. Elles pourraient exploiter ce type de données comme pré-entraînement ou comme module de préhension. Aucun calendrier de diffusion du code ou du jeu de données n'est précisé ici. Le test décisif sera une démonstration sur main réelle en bac encombré, avec des taux de réussite publiés.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




