WARP-VLA : adaptation de la caméra de poignet pour une exécution robuste aux changements de point de vue dans les modèles vision-langage-action
WARP-VLA, un modèle décrit dans un preprint arXiv (2610.11508v1), s'attaque à une faiblesse connue des modèles Vision-Language-Action (VLA) pour la manipulation robotique : leur sensibilité à la configuration des caméras. Les auteurs ciblent en particulier la caméra montée au poignet, dont le point de vue se déplace avec le robot. Un léger écart de fixation suffit alors à modifier les indices géométriques fins dont dépend la politique. Leur solution repose sur une architecture Mixture-of-Experts (MoE) : chaque expert apprend une transformation de features propre à un type de vue, et un routeur les combine à partir d'informations de vue implicites. La politique peut ainsi être déployée sans fournir les paramètres extrinsèques de la caméra en entrée. Sur le benchmark LIBERO, le taux de succès moyen de pi-0.5 passe de 39,2 % à 78,3 % sous perturbations de la vue poignet, soit un doublement. Des essais sur robot réel indiquent que l'adaptation au niveau des features, apprise en simulation, se transfère à plusieurs configurations de déploiement. Le benchmark de robustesse aux points de vue poignet et une implémentation « plug-and-play » sont publiés.
Ce résultat touche un point bloquant du passage des VLA du laboratoire à l'atelier. Reproduire exactement la pose de caméra utilisée à l'entraînement est quasi impossible d'un site à l'autre. Les supports se desserrent, les intégrateurs choisissent des fixations différentes et les générations de robots varient. Une politique qui perd la moitié de ses performances pour un déplacement modéré du capteur oblige à recalibrer ou à réentraîner à chaque déploiement, ce qui pèse directement sur les coûts d'intégration. Le gain mesuré sur pi-0.5 montre que cette fragilité vient en bonne part de la représentation visuelle, et qu'on peut la corriger sans exiger les extrinsèques en entrée. Il faut toutefois rester prudent : les chiffres viennent surtout de LIBERO, un benchmark simulé aux tâches relativement standardisées. Le résumé ne chiffre pas la performance sur robot réel, ni le nombre de plateformes, de tâches ou d'essais. Le taux de 78,3 % reste aussi nettement inférieur à ce qu'exigerait une exploitation industrielle, et le texte fourni ne dit pas quel est le niveau de référence sans perturbation.
Le travail s'inscrit dans une série de recherches sur la robustesse des VLA aux changements de point de vue, après l'essor de modèles généralistes comme pi-0 et pi-0.5 de Physical Intelligence. Ces modèles sont entraînés sur des données massives, mais avec des configurations de caméras peu variées. Les approches concurrentes passent par l'augmentation de données multi-vues, la randomisation de domaine ou l'injection explicite de la géométrie de caméra. WARP-VLA évite l'entrée extrinsèque et mise sur un routage implicite, ce qui simplifie le déploiement. Le code et le benchmark publics permettront à d'autres équipes de comparer leurs méthodes, une étape utile avant toute validation en conditions de production. Aucune annonce de pilote industriel n'accompagne ce preprint, qui n'a pas encore été évalué par des pairs.
Pas d\'impact direct sur la France/UE




