Retrouver dans le temps, corriger en fréquence
Publié le 6 août 2026 sur arXiv, RTCF (Retrieve in Time, Correct in Frequency) est une méthode qui corrige, sans aucun réentraînement, les politiques vision-langage-action (VLA) figées sujettes à des erreurs cumulées sur les tâches de manipulation longues. Elle sépare la récupération d'une expérience passée pertinente, via un alignement progressif de la mémoire visuelle avec des trajectoires réussies, de la correction proprement dite, limitée à un résidu basse fréquence sur les canaux de mouvement, la pince restant pilotée par la politique d'origine. Testée sur quatre suites LIBERO et 2000 épisodes par condition, elle fait passer le taux de réussite agrégé de 86,4% à 88,4%, et de 61,6% à 68,6% sur les tâches longues, pour une latence additionnelle de 10,99 ms par bloc d'action, calculée entièrement sur CPU.
L'enjeu est la dérive d'exécution: une petite erreur en début de séquence longue se propage et fait échouer toute la tâche, un point faible connu des VLA malgré leurs bonnes performances sur tâches courtes. En ne corrigeant que les basses fréquences du mouvement, RTCF évite les deux écueils des méthodes existantes, à savoir des rappels de mémoire désynchronisés de la progression réelle, ou un rejeu qui écrase la réactivité de la politique. Pour des équipes qui déploient des VLA préentraînés sans vouloir les réentraîner, l'intérêt tient autant au gain de fiabilité sur les tâches longues qu'au coût de calcul quasi nul, la correction s'exécutant sur CPU en quelques millisecondes; le gain reste toutefois modeste en valeur absolue, deux points sur l'agrégat.
LIBERO est un benchmark de simulation standard pour évaluer les politiques de manipulation robotique sur tâches courtes et longues, utilisé dans la littérature VLA récente aux côtés de modèles comme Pi-0 ou OpenVLA. RTCF s'inscrit dans une famille de corrections "test-time" qui améliorent des politiques figées sans toucher à leurs poids, une alternative moins coûteuse qu'un fine-tuning continu, en se distinguant par la séparation explicite entre alignement temporel et correction fréquentielle. Le résumé ne précise ni le modèle VLA de base utilisé pour les tests ni une validation au-delà de la simulation, deux éléments à surveiller avant d'envisager un transfert vers des déploiements réels.
Dans nos dossiers




