
Au-delà de la réussite de la tâche finale : comment auditer la récupération d'expériences visuelles en robotique
Une nouvelle méthodologie d'audit publiée sur arXiv (2609.26567v1) s'attaque à un angle mort de la robotique par réutilisation d'expériences: la plupart des systèmes sélectionnent, dans une bibliothèque d'expériences passées, celle à réutiliser dans une scène nouvelle par simple similarité visuelle, et les évaluations ne rapportent que le taux de succès final, sans dire si ce choix fait scène par scène est réellement bon. Les auteurs testent leur audit sur deux tâches de manipulation, trois mécanismes de réutilisation et des bibliothèques de K=3, 10 et 50 expériences, en exécutant systématiquement chaque expérience stockée sur chaque scène de requête pour cinq méthodes de sélection basées sur la distance du plus proche voisin dans des espaces d'embeddings visuels allant des pixels bruts à CLIP. Résultat central: une seule expérience fixe, choisie a posteriori, capture déjà 30 à 58% de l'écart entre sélection aléatoire et un oracle optimal, la sélection scène par scène n'ajoutant que 0,07 à 0,15 point de taux de succès. À partir de K=10, les règles visuelles se concentrent sur une seule expérience 1,5 à 3 fois plus que l'oracle, et leur score reflète alors surtout la qualité de cette expérience dominante. La distance visuelle prédit bien la réussite d'une paire donnée (AUROC jusqu'à 0,96) mais classe mal les candidats au sein d'une même scène, à peine mieux que le hasard pour quatre des cinq embeddings à K=50 (AUROC 0,45-0,52).
Ce travail remet en cause une hypothèse répandue dans la robotique fondée sur la récupération d'expériences, y compris dans les architectures vision-langage-action: la similarité visuelle, même via CLIP, ne garantirait pas une bonne sélection à l'échelle, et une part importante des gains de performance attribués à un mécanisme de sélection viendrait en réalité de la simple présence d'une expérience générique très transférable dans la bibliothèque. Comparée à un mélange aléatoire conservant les mêmes taux de sélection mais réassignant les scènes au hasard, chaque règle testée se révèle en fait moins bonne dès qu'elle s'en écarte significativement, pour toutes les politiques d'images apprises évaluées. Pour les équipes qui développent des systèmes adaptatifs par réutilisation plutôt que par ré-entraînement, cela signifie qu'optimiser le mécanisme de sélection sans auditer la composition de la bibliothèque peut être un mauvais usage des ressources d'ingénierie.
Cette contribution s'inscrit dans la montée des approches d'adaptation par réutilisation de trajectoires stockées, alternative au ré-entraînement complet de politiques popularisée par les architectures VLA. Faute d'une méthode pour distinguer l'apport du mécanisme de sélection de celui de la bibliothèque, le secteur s'appuyait jusqu'ici sur un score agrégé trompeur. Comme l'exécution exhaustive de chaque expérience sur chaque scène reste impraticable en conditions réelles, les auteurs proposent deux rapports simples que toute étude future pourrait fournir sans audit complet: la distribution des expériences effectivement sélectionnées, et le taux de succès de la meilleure expérience unique déterminée après coup.
Dans nos dossiers




