
OnEvoMemory : une mémoire évolutive via des essais robotiques en ligne pour les politiques de robots préentraînées
Publié en août 2026 sur arXiv (2608.08749v1), un article de recherche présente OnEvoMemory, un module de mémoire pour politiques robotiques pré-entraînées de type VLA, destiné à la manipulation à long horizon. À la différence des mécanismes existants, qui s'appuient sur des modèles externes ou des règles figées, il apprend directement, à partir des résultats de trajectoires, quelles expériences conserver, combinant contexte récent, expériences à haute valeur et transitions saillantes entre sous-tâches. Des démonstrations hors-ligne initialisent la mémoire, puis des rollouts en ligne, réussis ou échoués, l'affinent au fil de l'entraînement. Sur des bancs de manipulation longue, les auteurs rapportent une amélioration des performances d'une politique VLA de base, sans fournir de chiffres de charge utile, de degrés de liberté ni de temps de cycle: une contribution algorithmique, pas un déploiement matériel.
Ce travail cible un verrou connu des politiques génératives en robotique: le suivi des sous-tâches déjà accomplies sur des séquences longues, condition nécessaire pour éviter qu'un bras ou un humanoïde ne répète une action ou ne perde le fil d'une tâche multi-étapes. Les architectures VLA telles que Pi-0, GR00T N2 ou Helix géraient jusqu'ici ce problème via des modules externes, LLM de supervision ou machines à états codées à la main, plutôt que par une mémoire apprise et intégrée. Pour les intégrateurs qui construisent sur des modèles fondation robotiques, une mémoire native capable de s'améliorer via des essais en ligne réduirait la dépendance à ces pipelines ad hoc, même si le résultat reste une preuve de concept en preprint, non encore revue par les pairs.
La publication s'inscrit dans une vague de recherches visant à réduire l'écart entre les démonstrations spectaculaires de robots humanoïdes ou bras manipulateurs et leur fiabilité réelle sur des tâches enchaînées, un problème documenté depuis l'essor des modèles VLA comme RT-2 ou Octo. En misant sur un affinage par rollouts en ligne plutôt que sur des règles écrites à la main, OnEvoMemory prolonge les efforts pour rendre les politiques de manipulation plus autonomes sans multiplier les modules externes. Déposé sur arXiv sous le type "new", l'article ne mentionne aucun partenariat industriel ni calendrier de mise en production: son adoption dépendra de tests sur des plateformes physiques réelles.
Dans nos dossiers




