OCC4M : mémoire 4D centrée objet pour le raisonnement spatiotemporel en manipulation à long horizon
OCC4M, surnommé « Occam », est une mémoire 4D centrée sur les objets pour robots manipulateurs, présentée en septembre 2026 par ses auteurs (arXiv:2609.28798) pour les tâches longues nécessitant de raisonner sur un état absent du champ de vision actuel. Le système maintient des pistes persistantes dans un référentiel monde partagé et encode explicitement les relations temporelles, de mouvement et de contenance, par exemple pour localiser un objet sorti du champ de vision ou identifier le contenu d'un conteneur mélangé. Un modèle vision-langage interroge cette mémoire structurée pour désigner des cibles, ensuite traitées par un exécuteur bas niveau sans avoir besoin de l'historique complet des observations. Sur sept conditions de simulation et 350 épisodes, OCC4M obtient 96,6% de réussite mémoire et 88,9% de réussite de bout en bout, contre 54,6% et 57,7% pour FrameSamp, une référence utilisant Gemini 3.7 Flash avec l'historique brut complet et le même exécuteur. Après un changement de point de vue caméra, OCC4M conserve 100% et 98% de réussite, contre un score proche de zéro pour FrameSamp. Sur 20 épisodes réels avec un bras Franka et caméra fixe, OCC4M atteint 85% de précision mémoire contre 30% au maximum pour FrameSamp, et achève 45% des tâches complètes en deux étapes.
Ce résultat cible une faiblesse connue des architectures vision-langage-action actuelles, qui raisonnent souvent sur une fenêtre d'observations récentes ou sur tout l'historique brut, une approche coûteuse et peu fiable dès qu'une tâche s'étire dans le temps ou que le point de vue change, un cas fréquent en usine ou en logistique. En séparant la mémoire structurée de l'exécution bas niveau, OCC4M évite de faire porter tout le raisonnement long terme au modèle vision-langage, ce qui limite la dérive de contexte observée avec les approches par historique brut. L'effondrement quasi total de FrameSamp lors du changement de caméra illustre concrètement l'écart entre démonstrations en conditions contrôlées et robustesse réelle, un signal utile pour les intégrateurs qui évaluent des piles VLA pour des cellules robotiques à tâches longues et multi-étapes.
OCC4M s'inscrit dans la recherche sur la mémoire persistante pour la manipulation robotique, un axe distinct des architectures vision-langage-action généralistes qui gèrent surtout le contexte via une fenêtre d'observations glissante plutôt qu'une mémoire dédiée. Les auteurs situent leur contribution face à une référence bâtie sur Gemini 3.7 Flash de Google DeepMind, posant le débat entre mémoire structurée et simple élargissement du contexte des grands modèles multimodaux. Les tests, menés en simulation puis validés sur un bras Franka Emika réel, restent limités en échelle, avec seulement 20 épisodes physiques sur un seul type de bras, ce qui en fait une preuve de concept académique plutôt qu'un système prêt pour un déploiement industriel. Des vidéos qualitatives supplémentaires sont publiées sur occ4m-sup.github.io, sans calendrier annoncé de transfert vers un robot commercial.
Dans nos dossiers




