
Try Once, Puis Optimal : Mémoire de Procédure Dé-redondée pour l'Amortissement de l'Exploration Inter-Épisodes
Des chercheurs présentent Instance-Oriented Memory (IOM), un système de mémoire objet-centrique qui évite aux robots manipulateurs de re-sonder à chaque rencontre les objets à état caché, comme un four à micro-ondes verrouillé ou une porte au mécanisme invisible. Dès la première rencontre, réussie ou non, IOM enregistre une courte procédure indexée sur les caractéristiques visuelles de l'objet, puis l'injecte comme biais souple dans une politique de manipulation ; à la rencontre suivante, le robot reconnaît l'objet et rappelle directement la procédure au lieu de re-explorer. La distillation s'appuie sur un modèle vision-langage (VLM) prêt à l'emploi, sans entraînement spécifique à la tâche. Sur quatre tâches d'objets articulés (four et porte en simulation, bouteille et armoire sur robot réel), une mémoire de procédure oracle réduit les opérations de manipulation de 16 à 30 % sans perte de réussite, et la version instrumentée par VLM récupère 69 à 88 % de ce gain dès la sortie de boîte.
L'apport cible un angle mort des mémoires inter-épisodes existantes, qui organisent la réutilisation autour d'états génériques plutôt qu'autour de l'objet et du coût réel de sa re-exploration. Pour des intégrateurs déployant des robots en environnement semi-structuré (entrepôt, cuisine, hôpital) où les mêmes appareils reviennent souvent dans le champ d'action, ce gain d'efficacité réduit directement le temps de cycle. Le point le plus significatif pour la fiabilité en conditions réelles : la procédure retrouvée n'est qu'un biais sur une politique pilotée par retour sensoriel, pas une instruction impérative, donc une mémoire erronée est corrigée plutôt que suivie aveuglément. Le taux de réussite ne régresse jamais, même quand la procédure rappelée est fausse, ce qui arrive dans environ 12 % des instances de porte, et il s'améliore même sur le robot réel.
IOM s'inscrit dans la recherche sur la manipulation d'objets articulés à état caché, où le robot doit sonder physiquement un loquet ou une charnière avant d'agir de façon fiable. Contrairement aux politiques VLA généralistes récentes comme GR00T N2, Helix ou Pi-0, centrées sur la généralisation de compétences entre tâches, IOM se positionne comme une couche de mémoire additionnelle au-dessus d'une politique existante plutôt que comme un concurrent direct. L'article, soumis sur arXiv le 28 juillet 2026 en tant que nouvelle contribution, précise que le code sera publié après acceptation : aucune implémentation n'est donc encore disponible publiquement, et la validation reste pour l'instant limitée à quatre tâches de laboratoire.
Dans nos dossiers




