LIBERO-Agent : évaluation d'agents généralistes pour la manipulation incarnée directe
Des chercheurs publient sur arXiv LIBERO-Agent, un benchmark qui teste si les agents généralistes savent piloter directement un robot manipulateur. Ces agents planifient, utilisent des outils et corrigent leur comportement à partir de retours. Les approches existantes leur demandent soit de soumettre un programme Python de contrôle pour toute la tâche, soit d'appeler des compétences robotiques de haut niveau. Ici, l'agent évolue dans un environnement interactif. Il choisit les observations à consulter, les traite avec ses propres outils et émet des commandes d'action natives. Le benchmark réunit 200 tâches dans un cadre commun. Sa suite principale compte 30 tâches, réparties pour isoler la perception, l'exécution à court horizon et la composition à long horizon. Les agents réussissent bien la perception et les tâches courtes faciles, mais leurs scores chutent nettement sur les tâches courtes difficiles et sur les séquences longues. GPT-6 Astra obtient la meilleure performance globale.
Le résultat nuance l'idée que les capacités agentiques acquises dans les environnements numériques se transfèrent mécaniquement au monde physique. Le goulot d'étranglement est la fiabilité, pas la compréhension de la scène. Pour un intégrateur ou un COO industriel, un agent généraliste n'est donc pas, en l'état, un substitut crédible à un modèle VLA (vision-langage-action) entraîné sur des données d'action. Les auteurs notent que des observations plus riches améliorent la manipulation à court horizon, alors que l'effet des démonstrations dépend de l'agent et du format. L'avantage de GPT-6 Astra tient surtout à l'interaction avec des mécanismes, en particulier quand un contact physique prolongé est nécessaire. Ses échecs restants viennent d'interférences entre étapes successives et d'erreurs géométriques.
Ce travail s'inscrit dans la course entre deux voies. La première est celle des VLA spécialisés comme Pi-0, GR00T N2 ou Helix, entraînés sur des données de manipulation. La seconde consiste à réutiliser des modèles généralistes comme agents. LIBERO-Agent est un outil d'évaluation, pas un produit ni un déploiement. Le résumé ne précise ni matériel réel, ni temps de cycle, ni coût d'inférence, ni comparaison directe avec les VLA, des données indispensables avant toute lecture industrielle. La suite logique est l'adoption du benchmark par d'autres laboratoires et sa confrontation aux modèles robotiques dédiés.
Dans nos dossiers




