Zetta ζ : un harnais incarné en boucle fermée efficace pour une intelligence physique auto-évolutive
Une équipe de recherche publie sur arXiv (référence 2608.16590v1) un système baptisé Zetta, présenté comme un harnais agentique en boucle fermée pour l'intelligence physique incarnée. Contrairement aux approches agentiques existantes qui suivent des compétences fixes pendant l'exécution et ne réfléchissent qu'après la fin d'un épisode, Zetta garde le modèle de politique de base figé mais fait évoluer en ligne, pendant l'exécution, des critiques codées et des compétences de récupération. Le système repose sur trois boucles séparées par échelle de temps : une gouvernance au rythme de l'action, une proposition de critique et de récupération au niveau du rollout, et des mises à jour de compétences validées avant intégration. Associé à Z-Infra, une infrastructure qui découple la logique de l'agent des ressources d'exécution matérielles hétérogènes, Zetta atteint 90,8% de réussite sur le benchmark de simulation LIBERO-Pro et 93,6% sur RoboCasa, avec une accélération d'inférence de 11,1 fois par rapport aux méthodes comparées, dans le budget de rollout testé par les auteurs.
L'enjeu dépasse le simple score de benchmark : la plupart des harnais agentiques actuels échouent à boucler l'apprentissage pendant l'exécution physique elle-même, car les décisions doivent suivre des états robot-environnement qui évoluent trop vite pour les grands modèles agentiques actuels. Si les résultats se confirment au-delà de la simulation, cela offrirait une voie pour combler l'écart entre modèles de bout en bout figés et agents capables de s'auto-corriger en conditions réelles, un enjeu central pour les intégrateurs cherchant des politiques robotiques fiables à grande échelle plutôt que des démonstrations isolées. Il faut toutefois noter que LIBERO-Pro et RoboCasa restent des environnements simulés, non des déploiements sur robots physiques.
Le papier s'inscrit dans la lignée des travaux sur les modèles vision-langage-action (VLA), en cherchant à dépasser leur principale limite : l'incapacité à s'adapter dynamiquement pendant l'exécution. Les auteurs rapportent que la performance continue de progresser avec l'expérience d'auto-exploration accumulée, que les compétences apprises se transfèrent en zero-shot à de nouvelles tâches, et que des comportements de résolution soudaine ("Aha Moments") émergent au fil de l'entraînement, sans préciser à ce stade de calendrier de validation sur robot réel.
Dans nos dossiers




