Fusion retardée routée par registres : repenser la fusion d'observations sujette aux raccourcis dans l'apprentissage par imitation visuomoteur
Des chercheurs proposent Register-Routed Delayed Fusion (RRDF), une architecture de fusion d'observations pour les politiques d'imitation visuomotrices, décrite dans un preprint arXiv (2610.02813v1). Le travail porte sur la manière dont ces politiques combinent des observations visuelles de grande dimension avec des signaux compacts, comme la proprioception. Dans la fusion dite « dense », les tokens visuels peuvent attendre directement les tokens compacts dès la première couche de l'encodeur. RRDF masque cette attention directe et fait passer les échanges entre modalités par un espace de travail de « registres » appris. Le schéma suit une séquence isoler, collecter, router : un préfixe initial garde les flux séparés, puis seuls les registres servent d'intermédiaires. Le générateur d'actions conserve un accès direct au signal compact. Les tests couvrent cinq tâches en simulation et trois tâches sur robot réel, avec ACT dense comme référence. Dans les conditions nominales, RRDF fait au moins aussi bien qu'ACT dense, et souvent mieux. Il se comporte aussi mieux lors de changements d'apparence sur quatre tâches simulées et lors d'évaluations à positions inédites sur les trois tâches réelles.
L'enjeu est la robustesse des politiques d'imitation, qui s'effondrent souvent dès que la scène diffère un peu des démonstrations. L'hypothèse des auteurs est que la proprioception, très prédictive de l'action, devient un raccourci : si elle influence trop tôt la formation des représentations visuelles spatiales, la politique s'appuie moins sur l'image. Des sondes d'entrée appariées par phase mesurent une sensibilité état-vers-image plus faible avec RRDF, ce qui va dans ce sens. Les ablations montrent que les registres seuls ne reproduisent pas le gain complet : c'est le contrôle du routage qui compte, pas l'ajout de paramètres. Pour les intégrateurs et les équipes de recherche, la leçon est pratique. Une modification de topologie légère, sans données supplémentaires, peut améliorer la généralisation d'une architecture répandue, avec la réserve d'un jeu de tâches restreint.
Le contexte est celui d'ACT (Action Chunking with Transformers), devenu une base courante pour l'apprentissage par démonstration sur bras de manipulation à bas coût. Les politiques plus récentes, de type VLA, reposent sur d'autres schémas de fusion, mais le problème du raccourci proprioceptif reste ouvert. Le résumé ne donne ni nom de robot, ni taux de réussite chiffrés, ni nombre d'essais, ni code publié. Il s'agit d'un preprint non évalué par des pairs. Les gains annoncés restent donc à confirmer, notamment sur des tâches plus longues, d'autres architectures et des politiques à grande échelle.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




