InfiNoVA : augmentation infinie de vues nouvelles pour des politiques robotiques invariantes au point de vue
Des chercheurs en robotique ont présenté InfiNoVA (Infinite Novel View Augmentation), une méthode d'augmentation de données pour les politiques Vision-Language-Action (VLA), détaillée dans un preprint publié sur arXiv le 24 septembre 2026 sous la référence 2609.27734v1. Le problème visé : ces politiques restent dépendantes des angles de caméra utilisés à l'entraînement et perdent en performance face à un nouveau point de vue, un défaut que la seule multiplication de démonstrations physiques ne corrige que partiellement, à coût élevé. InfiNoVA reconstruit chaque trajectoire de manipulation, filmée par plusieurs caméras synchronisées, en une représentation 3D Gaussienne variable dans le temps, puis génère des vues synthétiques depuis des poses caméra échantillonnées, en conservant la correspondance état-action d'origine. Sur quatre tâches de manipulation réelles, les politiques entraînées avec cette méthode obtiennent un taux de réussite moyen 5,4 fois supérieur à celui de l'augmentation VISTA ou d'une politique non augmentée face à des points de vue inédits, et 1,7 fois supérieur à un entraînement direct sur les cinq caméras physiques disponibles.
Ce travail cible un frein concret à l'industrialisation des politiques VLA : l'écart de performance qui apparaît dès qu'un intégrateur installe une caméra à une hauteur ou un angle différent de ceux du laboratoire d'origine, un obstacle direct à des déploiements sur des cellules robotiques hétérogènes. En s'appuyant sur une représentation 3D explicite plutôt que sur une synthèse générative par diffusion, InfiNoVA limite aussi les hallucinations visuelles qui nuisent à l'exécution de la tâche, un défaut connu de ces méthodes génératives. Pour un décideur robotique, l'enseignement clé est que la robustesse au point de vue s'obtient ici par un traitement des données d'entraînement, sans modifier l'architecture de la politique.
InfiNoVA s'inscrit dans les efforts pour combler l'écart de généralisation visuelle des politiques VLA. Sa comparaison directe avec VISTA, une méthode antérieure d'augmentation de vues, la positionne comme une alternative aux approches génératives par diffusion. Le travail reste une contribution de recherche en preprint, validée sur quatre tâches de laboratoire, sans partenariat industriel annoncé, présentée par ses auteurs comme une voie vers des politiques robustes aux caméras et vers des tests à plus grande échelle.
Dans nos dossiers




