
Zeva de Tsinghua AIR fait passer le taux de réussite en manipulation incarnée de 26 % à 73 % sans réentraînement
L'Institute for AI Industry Research (AIR) de l'université Tsinghua, avec Domain Transform, a présenté Zeva, une méthode de manipulation robotique qui progresse pendant le déploiement sans toucher aux poids du modèle, via une mémoire causale en contexte. Le taux de réussite cumulé passe d'environ 26% à 73% sur plusieurs bancs d'essai, soit 47 points gagnés sans le cycle habituel de collecte de données et de réentraînement. Décrite dans l'article "Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation", signé notamment par Liu Yunxin et Cao Ting, la méthode s'appuie sur le backbone Cosmos3 : un encodeur relie chaque action au changement d'état qu'elle provoque, une mémoire à deux échelles sépare la tentative en cours de l'expérience accumulée, et ces indices sont injectés dans l'entrée du modèle figé sans mise à jour de gradient. Sur RoboCasa365-Atomic5, le taux moyen atteint 76,8% ; sur ChemLab-Evo (tâches de laboratoire de chimie), la prise d'un tube à essai passe de 65% à 100%, le placement d'un bécher de 25% à 70%, le versement d'eau de 30% à 80%, et une seule démonstration humaine ajoute environ 20 points sur le bécher et 15 sur le versement.
Pour les intégrateurs et décideurs industriels, l'intérêt est de transformer l'adaptation à un nouveau site en un problème d'ingénierie de contexte plutôt que de réentraînement : au lieu de semaines de calibration, il s'agit de gérer un contexte plus riche, au prix d'un coût d'inférence par étape qui décroît à mesure que la mémoire s'enrichit. Les auteurs reconnaissent que les gains sont plus marqués là où les performances de départ étaient faibles, ce qui relativise le progrès sur les tâches déjà maîtrisées ; le choix de la chimie tient aussi à des changements d'état propres et peu bruités, alors que des tâches déformables comme le linge s'annoncent plus difficiles. Aucune plateforme robotique indépendante du montage Cosmos3 n'a été testée, ce qui laisse les promesses de généralisation au stade de la publication tant que d'autres laboratoires n'auront pas reproduit cette architecture sur du matériel et des tâches différents.
Zeva s'inscrit dans une recherche qui cherche à contourner les coûts du réglage fin des modèles vision-langage-action classiques, à l'image de Pi-0, GR00T N2 ou Helix, généralement améliorés par des cycles coûteux de collecte et d'entraînement. En figeant le backbone et en reportant l'adaptation sur une mémoire en contexte, Tsinghua AIR et Domain Transform ciblent les sites dont l'environnement change souvent, tandis que les déploiements stables resteraient mieux servis par un réentraînement classique pour des raisons de coût. La démonstration reste pour l'instant limitée au backbone Cosmos3 et aux bancs RoboCasa365-Atomic5 et ChemLab-Evo, sans pilote industriel ni calendrier annoncés ; sa validation dépendra de sa reproduction sur d'autres plateformes et catégories de tâches, notamment celles à objets déformables où le signal causal est plus bruité.
Dans nos dossiers




