
ETA : un nouveau paradigme à base d'agents pour les tâches incarnées
Un nouveau papier de recherche publié sur arXiv (référence 2608.03924, version 1) présente ETA, pour Embodied Task Agent, un paradigme conçu pour étendre les agents numériques au monde physique. Les auteurs publient en parallèle OpenETA, une implémentation open source du système. L'architecture repose sur une boucle à trois éléments : un Planner qui sélectionne un appel d'outil à la fois, une Interface qui pilote l'exécution de cet appel, et un World qui renvoie le résultat de l'action ainsi qu'une observation fraîche de l'environnement. Cette boucle permet à l'agent de vérifier ce qu'il a réellement accompli, de corriger son plan en conséquence, et de conserver les interactions réussies comme les échecs sous forme d'expérience réutilisable. OpenETA propose des Planners interchangeables, des Tools et Skills composables, une mémoire consultable a posteriori, des trajectoires rejouables, ainsi que des interfaces communes pour la simulation et pour des robots réels. Le papier mentionne aussi une intégration légère avec Codex, où OpenETA tourne comme un plugin limité à trois fonctions : observe, markpoint et moveto.
L'enjeu que pose l'équipe est celui du moment "ChatGPT" de la robotique : un robot généraliste capable de gérer des tâches et des environnements inconnus, tout en restant contrôlable sur des interactions longues. Les auteurs pointent une limite des systèmes actuels, majoritairement bâtis en bout en bout de l'observation vers l'action : leur généralisation dépend fortement de la couverture des données d'entraînement, et l'exécution de tâches longues reste difficile à superviser et à inspecter. En important le schéma agentique du monde des LLM (choix d'outil, vérification, mémoire auditable) plutôt qu'une politique monolithique, ETA vise justement l'inspectabilité et la traçabilité, deux propriétés recherchées par les intégrateurs et décideurs industriels pour le débogage, la sécurité et l'éventuelle certification, là où les modèles vision-langage-action de bout en bout restent largement des boîtes noires.
Il s'agit à ce stade d'un article de recherche accompagné d'un code source ouvert, sans déploiement industriel ni partenariat annoncé : le texte ne cite aucune entreprise ni site de production. La démarche se distingue des modèles VLA propriétaires à grande échelle qui dominent la course humanoïde actuelle, en empruntant plutôt aux architectures d'agents logiciels à base d'outils déjà répandues côté LLM. La suite logique passera par l'adoption du code OpenETA par la communauté, avec des évaluations en simulation puis sur robots réels pour confirmer si cette approche modulaire tient la comparaison face aux politiques end-to-end sur des tâches longues et non familières.
Dans nos dossiers




