
SAVLA : des modèles vision-langage-action sensibles à la symétrie pour la manipulation robotique
Un article publié le 16 septembre 2026 sur arXiv (2609.16641) présente SAVLA (Symmetry-Aware Vision-Language-Action), un modèle de manipulation robotique conditionnée par le langage. Contrairement aux modèles vision-langage-action classiques, qui n'apprennent leur compétence spatiale qu'à partir des démonstrations et échouent hors de la plage de poses couverte par celles-ci, SAVLA gèle un backbone vision-langage pré-entraîné et y ajoute une tête d'action équivariante par flow-matching ainsi qu'un module de canonicalisation qui ramène les vues obliques dans un repère de référence tout en faisant tourner les conditions géométriques en conséquence. Testé sur le benchmark simulé LIBERO face au modèle GR00T N1.5 de NVIDIA, SAVLA améliore de 5,1 points le taux de réussite moyen sur les quatre suites du benchmark, et fait passer le taux de réussite sous rotation sur LIBERO-Goal de 41,5% à 90,4%.
Le résultat s'attaque à une faiblesse connue des VLA : leur généralisation géométrique limitée, qui oblige aujourd'hui les intégrateurs à multiplier les démonstrations pour couvrir chaque orientation possible d'objet ou de caméra sur une ligne de production. En codant la symétrie directement dans l'architecture plutôt qu'en la laissant émerger des données, SAVLA vise une robustesse aux changements de pose avec moins d'exemples, un argument pertinent pour réduire le coût de collecte de données avant tout déploiement industriel de bras ou d'humanoïdes pilotés par VLA. Le gain reste toutefois mesuré en simulation sur un benchmark académique, pas sur un robot physique en usine, ce qui en fait une preuve de concept méthodologique plutôt qu'une solution prête à l'emploi.
SAVLA s'inscrit dans la vague des modèles VLA devenus le paradigme dominant du contrôle robotique par langage naturel, aux côtés de familles comme GR00T de NVIDIA, Pi-0 de Physical Intelligence ou Helix de Figure. Le choix de GR00T N1.5 comme référence positionne directement SAVLA face à l'un des modèles de fondation les plus utilisés du secteur. La méthode puise dans des travaux antérieurs sur l'apprentissage équivariant, une approche distincte du tout-données qui domine l'entraînement actuel des VLA. L'article ne mentionne ni partenariat industriel ni test sur robot physique, la validation en conditions réelles restant l'étape suivante logique pour ce type de travail académique.




