Une mémoire récurrente linéaire suffit pour distiller une politique de modèle du monde pour le robot d'air hockey
Une étude publiée sur arXiv (v1, identifiant 2609.39151) examine si le contrôle dépendant d'une mémoire exige des dynamiques récurrentes non linéaires. Le cadre est une tâche simulée de défense au air hockey, où le suivi du palet est temporairement perdu. Les auteurs utilisent comme enseignant un agent DreamerV3 (modèle du monde). Celui-ci surpasse une politique sans mémoire lorsque le suivi est coupé. Réinitialiser son état récurrent dégrade fortement ses performances, ce qui montre que la tâche requiert bien de la mémoire. Cet enseignant est distillé en politiques récurrentes compactes, avec un état de 64 dimensions. Elles combinent une récurrence linéaire diagonale et une « innovation » non linéaire de rang k optionnelle, tout en conservant des encodeurs d'observation et des têtes d'action non linéaires. Sur cinq graines appariées, le modèle purement linéaire (k=0) égale à la fois la base GRU et l'enseignant sur toute la plage de pertes de suivi testée. Augmenter le rang de l'innovation non linéaire n'apporte aucun gain mesurable. Les résultats viennent d'un jeu de test neuf, ouvert seulement après le gel des modèles et des analyses.
L'intérêt tient à l'économie de calcul. Le modèle linéaire exige moins de paramètres récurrents et moins de calcul qu'un GRU pour des performances comparables. Pour la robotique embarquée, où la latence et le budget énergétique contraignent les politiques temps réel, cela suggère qu'une partie de l'apprentissage de représentation non linéaire, placée autour d'un mémoire linéaire simple, peut suffire pour des tâches à occlusion ou perte de capteur. C'est cohérent avec l'intérêt récent pour les modèles à espace d'états linéaires. Le protocole, avec un jeu de test verrouillé et des graines appariées, est plus rigoureux que la moyenne du domaine. La portée reste étroite : une seule tâche simulée, un seul enseignant, un état de dimension 64, un horizon de coupure limité, cinq graines, et aucune validation sur robot réel, donc rien sur l'écart sim-to-real. Les auteurs précisent eux-mêmes que la conclusion ne vaut que pour des politiques dont l'encodeur et la tête d'action restent non linéaires. Ce n'est donc pas une preuve que la mémoire linéaire suffit en général.
Le travail s'inscrit dans deux courants. Le premier est celui des modèles du monde de type Dreamer, qui servent ici d'enseignants performants mais coûteux. Le second est celui de la distillation vers des politiques légères et des architectures récurrentes linéaires, présentées comme alternatives aux GRU et aux LSTM. Le air hockey robotique est un banc d'essai classique pour le contrôle dynamique rapide sous contraintes de perception. Les suites naturelles sont des tests sur des tâches plus longues ou plus riches en mémoire, d'autres enseignants, des états plus grands, et surtout un transfert sur matériel réel. Il s'agit d'un préprint non évalué par des pairs, sans produit ni déploiement associé.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




