
Vue-croisée d'action cohérente pour des politiques vision-langage-action robustes aux caméras
Des chercheurs publient sur arXiv (2608.06965v1) une méthode pour rendre les politiques vision-langage-action (VLA) robustes au déplacement de la caméra de scène, défaut fréquent alors même que tâche et objets restent identiques. L'approche n'utilise que l'image RGB, le langage et la proprioception, sans extrinsèques ni profondeur, la caméra au poignet étant masquée pour éviter tout raccourci visuel. Pour les VLA à flow matching, elle régularise le champ de vitesse d'action via une perte cross-vue appliquée à des paires de rendus MuJoCo (vue nominale/perturbée) issues des mêmes démonstrations LIBERO. Sur le benchmark LIBERO-Plus, elle atteint 87,2% de réussite (4797 rollouts par graine, sur 3 graines d'entraînement), contre 79,8% pour un flow-matching seul sur les mêmes paires et seulement 25,8% quand les paires sont mélangées au hasard, tout en préservant 95% de réussite en caméra nominale. Sur robot réel, sur trois tâches de manipulation, le taux de réussite en caméra inédite passe de 53,3% à 74,4%.
Le résultat s'attaque à un vrai point de friction pour les intégrateurs: reconfigurer ou dupliquer une cellule robotique oblige aujourd'hui à recollecter des données, faute de quoi la performance chute dès que l'angle de caméra change. Sans capteur supplémentaire ni calibration caméra, la méthode améliore la robustesse de près de 20 points sur robot réel, ce qui suggère que la généralisation aux changements de point de vue des VLA dépend autant de l'algorithme d'entraînement que du volume de données, une nuance qui tranche avec les discours misant tout sur l'échelle des données. Le taux plafonne toutefois à 74% en caméra inédite, sur seulement trente essais réels au total, ce qui limite la portée des conclusions hors laboratoire.
Le travail s'appuie sur LIBERO-Plus, extension du benchmark LIBERO conçue pour stresser les politiques d'imitation face aux perturbations de caméra, et sur le flow matching, technique de génération d'action utilisée par plusieurs architectures VLA récentes. Il se positionne implicitement contre la pratique courante du fine-tuning multi-caméra, moins performante de 12,5 points que la perte cross-vue proposée. Publié comme préprint non encore évalué par les pairs, sans mention de déploiement pilote ni de partenaire industriel, l'article laisse en suspens une validation à plus grande échelle, sur davantage de tâches et de plateformes robotiques réelles.
Dans nos dossiers




