RawVLA : un processeur d'images neuronal incarné pour la manipulation robotique
Une équipe de chercheurs publie sur arXiv RawVLA, un processeur d'image neuronal (neural ISP) conçu pour les politiques vision-langage-action (VLA) de manipulation robotique. Le point de départ est un angle mort du secteur : les VLA reçoivent presque toujours des images RGB produites par l'ISP fixe de la caméra, un module matériel qui convertit les données brutes du capteur (RAW) en image exploitable. Ce pipeline d'imagerie reste donc hors de la boucle d'apprentissage et d'évaluation. Les auteurs ont mesuré son influence sur cinq dimensions : le gain, le bruit du capteur, la réponse chromatique, la réponse tonale et la profondeur de bit. Le traitement RAW vers RGB modifie sensiblement les actions prédites et le taux de réussite des manipulations, et chaque dimension pèse d'un poids très différent. Sur cette base, ils proposent RawVLA, un ISP neuronal en flux continu qui rend les observations RAW pour des politiques VLA gelées, sans réentraînement. Sa capacité est concentrée sur les facteurs d'imagerie utiles au comportement incarné. Ils publient aussi RawVLA-Bench, un benchmark de manipulation en domaine RAW qui traite le traitement d'image comme une variable d'évaluation explicite, en conditions d'acquisition propres et dégradées.
Selon les auteurs, RawVLA maintient les performances en conditions standard et améliore nettement la robustesse quand l'imagerie se dégrade. Le résumé ne donne aucun chiffre : ni gain, ni taux de réussite, ni latence, ni modèle de VLA testé. Ces points sont à vérifier dans l'article complet. Le résultat compte pour les intégrateurs, car une partie de l'écart entre démonstration et réalité vient peut-être de la caméra elle-même. Un VLA entraîné sur des images bien exposées peut se dégrader en entrepôt sombre, sous éclairage variable ou avec un capteur bruité, sans que ni le modèle ni la simulation soient en cause. Le fait que l'ISP soit une variable d'évaluation à part entière suggère que les benchmarks actuels, presque tous en RGB propre, surestiment la robustesse réelle. L'approche est aussi pragmatique : un module d'adaptation placé devant une politique gelée évite de réentraîner un modèle de fondation.
Ce travail s'inscrit dans le mouvement des modèles VLA généralistes comme Pi-0, GR00T ou Helix, qui ont concentré l'effort sur l'architecture et les données, en laissant la chaîne d'acquisition aux réglages constructeur. Les recherches sur la robustesse visuelle se limitaient jusqu'ici surtout à des perturbations appliquées en RGB. RawVLA déplace le problème en amont, vers le capteur. Il reste une publication de recherche v1, non évaluée par les pairs, dont le code, le benchmark et la validation sur robot réel restent à confirmer. Les suites logiques sont une adoption de RawVLA-Bench par d'autres équipes, des tests sur plusieurs familles de VLA et une intégration au plus près des caméras embarquées.
Dans nos dossiers




