VersaCamVLA : des politiques VLA à caméra configurable pour la manipulation robotique
VersaCamVLA, un framework publié sur arXiv (2610.12451, première version), s'attaque à une faiblesse structurelle des modèles Vision-Language-Action (VLA) : leur dépendance à une configuration de caméras fixe pendant l'entraînement. Les auteurs proposent une interface de « scene tokens » qui convertit un ensemble variable de vues RGB avec pose connue en un nombre fixe de tokens latents de scène. Cette interface est apprise par prédiction de vue cible multi-signaux, et par une méthode d'échantillonnage baptisée Wrist-Augmented Pose Sampling (WAPS), qui exploite les mouvements naturels de la caméra poignet pour obtenir gratuitement de la diversité de poses. Au déploiement, un encodeur spatial léger injecte ces tokens compacts dans un VLA de base préentraîné, comme condition visuelle supplémentaire. Aucun capteur 3D explicite ni rendu de nouvelles vues n'est nécessaire. Les tests couvrent les benchmarks RoboTwin et LIBERO ainsi qu'une plateforme robotique réelle. Les auteurs affirment que VersaCamVLA dépasse les méthodes VLA antérieures et les références multi-vues directes, avec des performances stables quand le nombre de caméras change ou que leurs poses n'ont jamais été vues.
L'enjeu est très concret pour les intégrateurs. Un VLA entraîné avec une caméra tête et une caméra poignet à des positions précises perd en fiabilité dès qu'un opérateur déplace une caméra de quelques centimètres, ajoute une vue ou remplace un capteur. Cette fragilité est l'un des freins au passage de la démonstration au déploiement multi-sites, où la géométrie des cellules varie d'un client à l'autre. Découpler la représentation de la scène de l'apprentissage de l'action permet, en principe, de réutiliser un même modèle de base sans réentraînement par configuration, et de réduire les coûts de recalibration. L'approche, qui se greffe sur un VLA existant au lieu d'en exiger un nouveau, est un argument d'adoption. Elle suggère aussi que la généralisation aux changements de point de vue peut passer par une interface visuelle dédiée plutôt que par davantage de données de téléopération.
Il faut toutefois relativiser. Il s'agit d'un preprint non évalué par les pairs, dont les résultats reposent sur des benchmarks en simulation et sur une seule plateforme réelle. Le résumé ne chiffre ni les taux de réussite, ni l'amplitude des changements de pose testés, ni le coût de calcul supplémentaire. Ces points seront décisifs pour juger de l'intérêt industriel. Le travail s'inscrit dans la course à la robustesse des VLA, aux côtés de familles de modèles comme Pi-0 ou GR00T, dont les déclinaisons restent généralement entraînées sur des configurations de capteurs précises. Les prochaines étapes à surveiller sont la publication du code et des poids, des tests sur des VLA de base variés, et une validation en conditions réelles avec des variations de caméras mesurées, par exemple sur des lignes de picking ou d'assemblage.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




