
T$^2$Mem : apprendre une mémoire au moment du test pour la robotique
Des chercheurs présentent sur arXiv T²Mem, un cadre qui donne une mémoire à une politique vision-langage-action (VLA) pré-entraînée qui n'en avait pas. La méthode repose sur l'entraînement au moment du test (test-time training). Le système ne retraite pas tout l'historique à chaque décision. Il encode les observations passées dans des « poids rapides » compacts, mis à jour en ligne par apprentissage auto-supervisé. Une interface ancrée dans les observations extrait l'information vision-langage qui alimente la mémoire, puis renvoie le contexte récupéré à l'action expert de la politique. L'entraînement alterne entre mémoire et politique, chacune restant figée pendant l'optimisation de l'autre. Sur les 16 tâches du benchmark RoboMME, le taux de succès moyen passe de 17,93 % à 56,83 % par rapport à la politique de base. T²Mem dépasse aussi les méthodes à mémoire récurrente rapportées dans ce benchmark. Les auteurs annoncent une inférence au moins trois fois plus rapide que les méthodes explicites, mesurée par profilage contrôlé.
Ce travail s'attaque à une faiblesse structurelle des VLA. Ils décident surtout à partir de l'observation courante, alors que de nombreuses tâches de manipulation dépendent d'informations qui ne sont plus visibles, comme un objet masqué ou une étape déjà exécutée. Point notable : la mémoire est apprise à partir des seules démonstrations d'actions, sans modèle de raisonnement externe ni annotations dédiées. Cela réduit le coût de données et la complexité d'intégration. Le gain de latence compte pour les boucles de contrôle temps réel. Plusieurs réserves s'imposent. Il s'agit d'un préprint évalué sur benchmark, et le résumé ne mentionne ni validation sur robot physique ni déploiement. L'accélération est mesurée par les auteurs eux-mêmes. Enfin, 56,83 % de réussite moyenne reste loin d'une fiabilité industrielle.
Le contexte est celui de politiques généralistes qui ont progressé en dextérité mais restent largement sans état. Les approches de mémoire existantes reposent sur des historiques explicites, des modules de raisonnement externes ou des mémoires récurrentes, d'où la comparaison menée ici avec ces dernières. Le résumé ne nomme pas la politique de base utilisée, ce qui limite pour l'instant la lecture de la portée du gain. Un site projet est annoncé. Les prochaines étapes à surveiller sont la reproduction sur d'autres politiques de base, les essais sur robots réels et une éventuelle reprise du principe dans les modèles de fondation robotiques commerciaux.
Dans nos dossiers



