Aller au contenu principal
RecherchearXiv cs.RO 

LIBERO-Agent : évaluation d'agents généralistes pour la manipulation incarnée directe

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv LIBERO-Agent, un benchmark qui teste si les agents généralistes savent piloter directement un robot manipulateur. Ces agents planifient, utilisent des outils et corrigent leur comportement à partir de retours. Les approches existantes leur demandent soit de soumettre un programme Python de contrôle pour toute la tâche, soit d'appeler des compétences robotiques de haut niveau. Ici, l'agent évolue dans un environnement interactif. Il choisit les observations à consulter, les traite avec ses propres outils et émet des commandes d'action natives. Le benchmark réunit 200 tâches dans un cadre commun. Sa suite principale compte 30 tâches, réparties pour isoler la perception, l'exécution à court horizon et la composition à long horizon. Les agents réussissent bien la perception et les tâches courtes faciles, mais leurs scores chutent nettement sur les tâches courtes difficiles et sur les séquences longues. GPT-6 Astra obtient la meilleure performance globale.

Le résultat nuance l'idée que les capacités agentiques acquises dans les environnements numériques se transfèrent mécaniquement au monde physique. Le goulot d'étranglement est la fiabilité, pas la compréhension de la scène. Pour un intégrateur ou un COO industriel, un agent généraliste n'est donc pas, en l'état, un substitut crédible à un modèle VLA (vision-langage-action) entraîné sur des données d'action. Les auteurs notent que des observations plus riches améliorent la manipulation à court horizon, alors que l'effet des démonstrations dépend de l'agent et du format. L'avantage de GPT-6 Astra tient surtout à l'interaction avec des mécanismes, en particulier quand un contact physique prolongé est nécessaire. Ses échecs restants viennent d'interférences entre étapes successives et d'erreurs géométriques.

Ce travail s'inscrit dans la course entre deux voies. La première est celle des VLA spécialisés comme Pi-0, GR00T N2 ou Helix, entraînés sur des données de manipulation. La seconde consiste à réutiliser des modèles généralistes comme agents. LIBERO-Agent est un outil d'évaluation, pas un produit ni un déploiement. Le résumé ne précise ni matériel réel, ni temps de cycle, ni coût d'inférence, ni comparaison directe avec les VLA, des données indispensables avant toute lecture industrielle. La suite logique est l'adoption du benchmark par d'autres laboratoires et sa confrontation aux modèles robotiques dédiés.

À lire aussi

Pyramide de données pour la manipulation incarnée
1arXiv cs.RO 

Pyramide de données pour la manipulation incarnée

Une équipe de recherche publie sur arXiv (2607.24744) une revue structurant l'écosystème des données pour l'apprentissage robotique en une "pyramide" à cinq niveaux : données réelles issues de robots physiques, données de type UMI (capture de démonstrations humaines avec interface portable), vidéos égocentriques et exocentriques, données de simulation, et données vision-langage générales issues du web. Les auteurs organisent cette pyramide autour d'un compromis central entre scalabilité et alignement robotique, et évaluent chaque source selon quatre critères : qualité, diversité, réutilisabilité et fidélité physique. Ils passent ensuite en revue les modèles fondation récents pour la robotique, qu'il s'agisse de modèles de "cerveau" incarné, de modèles vision-langage-action (VLA) ou de modèles monde-action, en analysant comment chacun sélectionne, aligne et mélange ces différentes sources lors du pré-entraînement, et comment ce choix conditionne leurs capacités de perception, de raisonnement, de planification et de prédiction. Cette cartographie répond à un problème identifié depuis plusieurs années dans le secteur : contrairement aux modèles de langage ou de vision, qui s'entraînent sur la quasi-totalité du contenu textuel et visuel disponible sur internet, les agents incarnés ne peuvent pas se contenter de données passives puisqu'ils doivent apprendre le couplage entre observation, état physique et action. C'est ce goulot d'étranglement qui explique pourquoi des modèles comme Pi-0, GR00T N2 ou Helix combinent systématiquement plusieurs sources de données plutôt qu'une seule, et pourquoi des plateformes comme Figure 03 ou Optimus Gen 3 misent autant sur la collecte de données réelles en usine que sur la simulation. Les auteurs terminent par six chantiers non résolus : constituer des jeux de données tactiles à grande échelle, capturer des séquences d'échec et de récupération, développer des pipelines de collecte scalables, aligner les actions entre différentes morphologies de robots, exploiter les données égocentriques pour la manipulation dextre, et concevoir des recettes de données principielles plutôt qu'empiriques, autant de points de friction qui continuent de freiner le passage de la démonstration au déploiement industriel fiable.

RecherchePaper
1 source
Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents
2arXiv cs.RO 

Mémoire analytique centrée sur les concepts pour la manipulation incarnée à base d'agents

Une équipe de recherche a soumis le 30 juin 2026 sur arXiv (arXiv:2606.29774) un cadre de mémoire structurée pour agents de manipulation robotique à long horizon. Baptisé "analytic concept-centric memory", le système organise l'expérience autour de concepts analytiques : chaque objet est représenté par ses parties sémantiques, des gabarits paramétriques, des poses ancrées dans l'espace, ses affordances et ses états de manipulation. Deux couches supplémentaires complètent l'architecture : une mémoire de transitions enregistrant les effets des actions sur l'état de scène, et une mémoire de compétences (skill memory) stockant des politiques réutilisables ancrées dans ces gabarits. À l'exécution, l'agent effectue une récupération coarse-to-fine pour identifier objets pertinents, états courants et compétences applicables. Les auteurs valident leur approche sur des tâches de manipulation dépendantes de la mémoire, la généralisation à des objets articulés (portes, tiroirs) et une évaluation en environnement réel. La gestion de mémoire reste un goulet d'étranglement critique en manipulation longue durée. Les agents actuels, y compris ceux fondés sur des architectures VLA (Vision-Language-Action), peinent à réutiliser les connaissances acquises lors d'interactions passées, forçant une replanification coûteuse à chaque nouvelle tâche. Ce cadre montre que structurer explicitement la mémoire autour de concepts physiques améliore le taux de complétion de tâches, la précision de récupération, la réidentification d'objets et la généralisation de compétences inter-objets, par rapport aux baselines non structurées et aux représentations vectorielles par embeddings. Pour les intégrateurs industriels, c'est un signal que la réutilisabilité des compétences sans réentraînement complet commence à devenir atteignable, ce qui réduit potentiellement les coûts de déploiement dans des environnements variables. La manipulation robotique à long horizon est un chantier actif chez plusieurs acteurs majeurs : Google DeepMind avec ses architectures RT-2 et SayCan, Physical Intelligence et son modèle Pi-0, Boston Dynamics, ainsi que des laboratoires comme Stanford et ETH Zurich. Ce travail s'inscrit dans une lignée cherchant à concilier planification symbolique structurée et politiques neuronales, deux paradigmes longtemps opposés. Ce preprint n'a pas encore été soumis à revue par les pairs, et les benchmarks restent des environnements de laboratoire contrôlés. La démonstration sur une plateforme industrielle réelle, avec la diversité des objets, le bruit sensoriel et les contraintes temps réel, reste à établir. Les prochaines étapes naturelles incluent l'intégration avec des VLA à grande échelle et l'évaluation sur des manipulateurs ou humanoïdes en contexte de production semi-réelle.

RechercheOpinion
1 source
LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique
3arXiv cs.RO 

LaGEA : des agents incarnés guidés par le langage pour la manipulation robotique

Des chercheurs présentent LaGEA (Language Guided Embodied Agents), une architecture combinant un modèle vision-langage (VLM) et l'apprentissage par renforcement (RL) pour la manipulation robotique, décrite dans une version mise a jour (v3) d'un article arXiv (2509.23155). Apres chaque tentative, le système résume l'épisode en langage naturel, localise les instants décisifs de la trajectoire, aligne ce retour avec l'état visuel dans une représentation partagée, puis transforme la progression vers l'objectif en récompenses bornées appliquées pas a pas. Un coefficient adaptatif, sensible aux échecs, rend ce signal dense en début d'exploration puis l'atténué avec la montée en compétence de l'agent. Sur les bancs d'essai simules Meta-World MT10 (dix taches de manipulation) et Robotic Fetch, LaGEA améliore le taux de réussite moyen de 9,0% sur des objectifs aléatoires, 5,3% sur des objectifs fixes et 17% sur les taches Fetch par rapport aux méthodes de référence, avec une convergence plus rapide. Le travail s'attaque a un problème classique du RL, la conception manuelle des fonctions de récompense, souvent couteuse et peu généralisable a de nouvelles taches. En montrant qu'un retour en langage naturel, structure et ancre temporellement, peut remplacer une partie de cette ingénierie, LaGEA nuance le narratif dominant autour des modèles vision-langage-action (VLA) de type Pi-0, GR00T N2 ou Helix, conçus pour piloter directement une politique de bout en bout : ici, le langage sert de superviseur d'apprentissage plutôt que de commande directe. Les gains rapportes restent obtenus en simulation, non sur du matériel réel, et demandent une confirmation sur des taches de manipulation physique. LaGEA prolonge les travaux exploitant les grands modèles vision-langage comme source de récompense ou de critique pour le RL, un axe de recherche actif depuis l'essor des modèles de fondation capables de décrire des objectifs et d'évaluer des trajectoires. Meta-World MT10 et Robotic Fetch sont des bancs d'essai standards de la communauté robotique, ce qui permet une comparaison directe avec l'état de l'art. S'agissant d'une version corrigée d'un article déjà publie, la contribution reste académique : aucun partenaire industriel, date de déploiement ou intégration produit n'est annonce a ce stade, la prochaine étape logique étant une validation sim-to-real sur robot physique.

RecherchePaper
1 source
Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon
4arXiv cs.RO 

Cortex : un cadre d'agent incarné à alignement bidirectionnel pour la manipulation à long horizon

Cortex, présenté dans un article arXiv publié début juillet 2026 (arXiv:2607.05377), est un nouveau framework d'agent incarné destiné aux tâches de manipulation robotique à long horizon. Le problème qu'il cible: les modèles Vision-Language-Action (VLA) actuels, de par leur nature markovienne, ne s'appuient que sur l'observation courante et peinent sur les séquences longues, tandis que les approches hiérarchiques à double système existantes souffrent d'un décalage entre la sémantique du planning haut niveau et la cinématique d'exécution bas niveau. Cortex introduit une interface de planification qui traduit les plans du VLM haut niveau en sous-tâches exécutables pour le VLA bas niveau, en standardisant les manipulations en 32 primitives de compétences canoniques. Les chercheurs ont ainsi pu annoter automatiquement plus de 4 000 heures de vidéos open-source et générer 30 heures de données de simulation, avec une stratégie d'échantillonnage équilibré par événements pour affiner l'entraînement sur les transitions ambiguës entre sous-tâches. Sur le plan des résultats, Cortex dépasse les baselines monolithiques de 3,1% sur le benchmark Libero-long et de 4,1% sur RoboTwin, en évaluation à la fois open-loop (VLM) et closed-loop (système complet). Plus notable pour l'industrie: le VLM généraliste de Cortex permet de réaliser en zero-shot des tâches réelles inédites à long horizon, comme des expériences de chimie en plusieurs étapes, simplement en le couplant à un VLA fine-tuné, une capacité que le fine-tuning d'un VLA seul n'atteint pas. Cela suggère qu'une architecture correctement pontée entre planification et exécution peut combler l'écart simulation-réel mieux qu'un unique modèle monolithique, un argument qui intéresse directement les intégrateurs cherchant à généraliser au-delà des tâches d'entraînement. Ce travail s'inscrit dans la lignée des architectures duales explorées par des modèles comme Pi-0, GR00T N2 ou Helix, qui tentent chacun de résoudre la même tension entre raisonnement sémantique et contrôle moteur. Cortex reste à ce stade une contribution de recherche évaluée sur benchmarks académiques et non un système déployé en production, mais son approche par primitives standardisées et annotation automatique à grande échelle pourrait influencer la prochaine génération de frameworks d'agents robotiques génécralistes.

RechercheActu
1 source