CoRe-VLA : préserver la coordination entre vues dans les modèles VLA lors de changements de caméra
Des chercheurs proposent CoRe-VLA (arXiv 2609.37150), un cadre logiciel « plug-and-play » qui vise à corriger l'une des fragilités les mieux documentées des modèles vision-langage-action (VLA) : la chute de performance quand la caméra externe change de position. Le système reconstruit un nuage de points de la scène, puis re-rend l'observation depuis le point de vue utilisé à l'entraînement du VLA. Deux briques complètent le dispositif. Render-to-Camera (R2C) Restoration réduit les dégradations visuelles introduites par le rendu. Execution-Trajectory-Conditioned Alignment (ETCA) limite le temps d'inactivité du robot et les conflits de mouvement pendant l'exécution asynchrone. Les tests portent sur 5 tâches sur robot réel, ainsi que sur les benchmarks LIBERO-100 et LIBERO-Plus. Le résultat le plus cité : le taux de réussite de PI0.5 passe de 13,3 % à 83,3 % pour un décalage de caméra de 1,6 m en environnement réel. Les auteurs annoncent des gains substantiels sur plusieurs VLA courants.
L'intérêt tient à la méthode autant qu'au chiffre. Les approches existantes exigent de collecter des observations appariées de la même scène sous plusieurs angles, puis de fine-tuner le VLA ou d'entraîner un module d'adaptation visuelle. CoRe-VLA n'exige ni nouvelles données multi-vues ni ré-entraînement, et peut se greffer sur des modèles déjà en place. Pour un intégrateur, c'est un point sensible : dans une cellule réelle, une caméra se déplace après une maintenance, un choc ou une reconfiguration de poste. La fragilité aux changements de caméra est donc un frein direct au déploiement fiable. L'analyse des auteurs est également instructive. Ils décrivent une « rupture de coordination inter-vues » : privé de vue globale exploitable, le robot s'appuie trop sur la caméra poignet et exécute les sous-tâches dans le mauvais ordre. Cela suggère que la robustesse des VLA dépend moins de la perception brute que de l'équilibre entre vues. Il faut toutefois rester prudent : il s'agit d'un preprint, sans relecture par les pairs, sur seulement 5 tâches réelles, et le chiffre phare correspond à un scénario précis.
Ce travail s'inscrit dans le constat, répété par plusieurs études, que les VLA, devenus le paradigme dominant en intelligence incarnée, sont sensibles aux perturbations de point de vue. LIBERO-Plus a justement été conçu pour mesurer ce type de robustesse. Les solutions concurrentes reposent sur des données supplémentaires ou du fine-tuning, avec les coûts que cela implique. Le cadre reste à éprouver : la reconstruction de nuage de points ajoute une chaîne de calcul, et sa latence, son comportement en scène dynamique ou très encombrée et sa portabilité vers d'autres VLA devront être vérifiés. Le texte ne mentionne ni code publié, ni pilote industriel, ni calendrier de déploiement.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




