AnyViewDex : manipulation dextérique invariante au point de vue à partir d'observations RGB
Une équipe de recherche a publié fin 2026 un article arXiv (2609.20107v1) décrivant AnyViewDex, un pipeline d'entraînement pour la manipulation dextre robuste aux changements de point de vue caméra. Le système combine un alignement contrastif multi-vue avec une supervision géométrique 3D dite privilégiée, disponible uniquement en simulation: en régressant les coordonnées 3D absolues des objets pendant l'entraînement simulé, cet objectif auxiliaire évite l'effondrement spatial de l'embedding contrastif globalement agrégé. Au déploiement, la politique fonctionne en zero-shot avec seulement une caméra RGB monoculaire non calibrée et la proprioception, sans capteur de profondeur. L'approche a été validée à la fois par apprentissage par renforcement et par distillation élève-professeur, puis testée sur un bras xArm7 équipé d'une main LEAP à 16 degrés de liberté. Résultat mesuré: 76,7% de réussite de préhension sur huit objets inédits et six points de vue non calibrés, sur un total de 480 essais matériels et 2400 essais en comptant les conditions d'ablation.
Cette publication s'attaque à un point de friction connu de l'industrie de la manipulation dextre: les politiques visuomotrices actuelles sont très sensibles aux décalages de point de vue caméra, et les méthodes récentes compensent en s'appuyant sur du RGB-D ou des nuages de points explicites au moment du test, ce qui ajoute des dépendances matérielles, des contraintes de calibration et une fragilité face au bruit capteur en conditions réelles. En montrant qu'une caméra RGB monoculaire non calibrée suffit à conserver l'invariance de vue, AnyViewDex suggère une voie pour alléger le coût matériel et l'intégration des cellules robotiques dextres en usine, un enjeu direct pour les intégrateurs qui cherchent à limiter la calibration et la maintenance de capteurs 3D. Le taux de 76,7%, mesuré sur objets et vues jamais vus plutôt que sur un scénario choisi, reste un résultat partiel plutôt qu'une démonstration de fiabilité industrielle, mais il documente honnêtement une marge d'erreur réelle plutôt que des vidéos triées.
Le travail s'inscrit dans la vague plus large des politiques vision-langage-action et de manipulation généraliste (dans la lignée de systèmes comme Pi-0 ou GR00T N2) qui cherchent à réduire la dépendance à des capteurs 3D coûteux pour la manipulation fine multi-doigts. Il s'agit ici d'une contribution de recherche fraîchement annoncée sur arXiv, avec une page projet dédiée (anyviewdex.github.io), et non d'un produit commercialisé ou déployé en usine: aucune entreprise ni aucun partenaire industriel n'est mentionné dans l'article. Les prochaines étapes attendues pour ce type de travaux sont généralement une extension à davantage d'objets, de tâches et de plateformes robotiques, ainsi qu'une comparaison plus poussée avec les approches concurrentes fondées sur RGB-D avant toute intégration industrielle.
Dans nos dossiers




