AnyCamVLA : adaptation caméra zéro-shot pour des modèles vision-langage-action robustes au point de vue
Des chercheurs dévoilent AnyCamVLA (arXiv:2603.05868, version 2), une méthode d'adaptation caméra "zero-shot" pour les modèles vision-langage-action (VLA) de manipulation robotique. Le problème ciblé : un VLA pré-entraîné puis affiné pour un environnement donné perd fortement en performance dès que la caméra change de position, d'angle ou de focale, une situation fréquente en environnement non structuré. Sans nouvelles démonstrations, sans réentraînement de la politique et sans modification d'architecture, le système s'appuie sur un modèle feed-forward de synthèse de nouvelles vues pour reprojeter en temps réel l'image captée vers la configuration caméra utilisée à l'entraînement, en corrigeant à la fois les paramètres intrinsèques et extrinsèques. Sur le benchmark LIBERO, la méthode surpasse les approches concurrentes basées sur l'augmentation de données ou l'ajout de features 3D, et les auteurs rapportent des gains similaires en conditions réelles, y compris avec des caméras tenues à la main en mouvement libre.
L'enjeu dépasse la prouesse technique : la fragilité des VLA face au point de vue caméra est l'un des vrais obstacles au déploiement industriel à l'échelle, chaque site ou chaque robot installant ses capteurs différemment. Sans correction, il faut recollecter des données et réentraîner pour chaque configuration, ce qui contredit la promesse d'une politique généraliste entraînée une fois et déployée partout. Une couche plug-and-play compatible avec n'importe quelle politique RGB, sans toucher aux poids du modèle, intéresse directement les intégrateurs cherchant à réduire le coût d'adaptation site par site, l'un des écarts récurrents entre démonstrations VLA en laboratoire et robustesse réelle.
Le travail s'inscrit dans la vague de recherche sur les VLA généralistes pour la manipulation, aux côtés de systèmes comme Pi-0, OpenVLA, RT-2 ou GR00T N2, tous confrontés au même écart entre performance en laboratoire et conditions réelles. AnyCamVLA ne propose pas un nouveau VLA mais une brique de correction indépendante du modèle sous-jacent, complémentaire aux efforts d'entraînement multi-vues plutôt que concurrente. La sortie d'une version 2 sur arXiv suggère une itération après retours, mais aucun partenariat industriel, pilote ou intégration produit n'est annoncé à ce stade : il s'agit pour l'instant d'une contribution de recherche validée sur benchmark et en expérimentation réelle limitée.
Dans nos dossiers




