StereoPatch : fusion RGB-profondeur alignée par patchs pour la perception spatiale en manipulation robotique
Une équipe de recherche a publié le 15 septembre 2026 sur arXiv (référence 2609.15509) un article présentant StereoPatch, une représentation RGB-profondeur pour l'apprentissage par imitation en manipulation robotique. La méthode aligne la géométrie métrique directement sur les patches visuels RGB utilisés pour prédire les actions, via une attention croisée asymétrique appliquée sur une grille de patches 2D partagée, produisant des "StereoPatch Tokens" capables de conditionner des politiques visuomotrices existantes sans modifier leur objectif d'apprentissage. Sur six tâches de manipulation exécutées sur robot réel, StereoPatch dépasse quatre familles de références (apparence seule, géométrie seule, RGB-D brut, fusion tardive) en taux de réussite en boucle fermée. Trois suites de simulation complètent l'évaluation, testant la compatibilité avec différentes architectures de politiques, la généralisation spatiale et les limites opérationnelles de la méthode.
L'enjeu concerne directement les intégrateurs et concepteurs de politiques visuomotrices: des scènes visuellement similaires peuvent exiger des actions différentes quand la position cible, la hauteur d'un objet ou la géométrie de contact changent, alors que des features RGB préentraînées tendent à confondre ces états pourtant géométriquement distincts. Ajouter naïvement un flux de profondeur ne résout pas le problème, car la politique doit alors apprendre seule la correspondance RGB-profondeur à partir des mêmes démonstrations limitées qui servent déjà à apprendre le contrôle moteur. En montrant qu'une fusion alignée au niveau du patch surpasse le RGB-D brut et la fusion tardive, l'étude alimente le débat en cours sur la nécessité réelle de capteurs de profondeur dans les piles VLA déployées à grande échelle, plutôt que de s'en remettre uniquement à des caméras RGB et à du préentraînement massif.
Ces travaux s'inscrivent dans la tendance des politiques visuomotrices prédisant directement des actions à partir d'observations visuelles, une famille de méthodes qui s'est généralisée avec la montée des modèles vision-langage-action. L'article se positionne explicitement contre les approches de fusion RGB-D existantes, brutes ou tardives, dont il documente les limites empiriques sur des tâches réelles. Il s'agit à ce stade d'une publication de recherche fraîchement déposée sur arXiv, sans annonce de déploiement industriel ni de calendrier de commercialisation; une page de projet (aus.bot/research/stereopatch) accompagne l'article, laissant ouverte une extension future à d'autres plateformes robotiques et architectures de politiques.
Dans nos dossiers




