Aller au contenu principal
RecherchearXiv cs.RO 

Politiques de scène à base d'agents

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire Robotics and Embodied AI de Montréal (Mila, page projet montrealrobotics.ca) publient la deuxième version d'Agentic Scene Policies (ASP), un cadre de contrôle robotique qui vise la généralisation zéro-shot, c'est-à-dire l'exécution d'instructions en langage naturel sur des objets jamais vus, sans entraînement spécifique. ASP unifie, dans un seul espace d'actions « agentique », la localisation des objets et les compétences du robot, via une interface d'outils exposée à un agent. La représentation de la scène en 3D repose sur un modèle vision-langage (VLM), et les compétences s'appuient sur des affordances au niveau des parties d'objets, comme la poignée d'un tiroir ou la fiche d'un chargeur. Cela permet des interactions zéro-shot telles que débrancher un chargeur ou ouvrir un tiroir. Les auteurs affirment que ASP surpasse systématiquement les principaux modèles VLA (vision-langage-action) en zéro-shot lors d'expériences réelles, et présentent une version mobile du cadre pour répondre à des requêtes à l'échelle d'une pièce. Le résumé ne donne ni chiffres de taux de réussite, ni noms des VLA comparés, ni détails sur le robot utilisé. Ces éléments sont à chercher dans le papier complet.

L'intérêt tient au débat entre deux architectures. Les VLA détournent un VLM pour produire des actions de bout en bout, mais leur généralisation à de nouvelles instructions et à de nouveaux objets reste fragile. Les politiques modulaires, qui combinent représentation de scène, planification de mouvement et VLM, sont plus interprétables et donnent de bons résultats zéro-shot. Elles souffrent toutefois de deux faiblesses : une recherche d'objets purement sémantique, sans raisonnement spatial explicite, et des compétences limitées à la saisie et à la navigation de base. ASP s'attaque aux deux. Si l'avantage sur les VLA se confirme sur des protocoles indépendants, cela plaide pour des architectures hybrides, où un agent de langage orchestre des primitives géométriques robustes plutôt que de tout apprendre de bout en bout. Pour les intégrateurs, l'attrait est concret : un système modulaire se diagnostique, se corrige et s'étend en ajoutant des outils, sans réentraîner un modèle de plusieurs milliards de paramètres. Il faut cependant rester prudent. Il s'agit d'un travail académique, non d'un produit, et la comparaison dépend du choix des VLA de référence, de leur réglage et des tâches retenues. Les cadences, la fiabilité sur de longues séries et les modes de défaillance ne sont pas documentés dans le résumé.

Ce travail s'inscrit dans la lignée des approches qui font piloter des robots par des VLM et des LLM, avec des cartes sémantiques 3D et des outils de saisie issus de la vision. En face, les VLA généralistes tels que Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure ont gagné en visibilité, avec une promesse de généralisation encore peu vérifiée hors des environnements d'entraînement. La publication de cette version 2 (une révision d'un papier d'abord soumis en septembre 2025) suggère un travail affiné après relecture. Les prochaines étapes probables sont des tests sur davantage d'objets et de scènes, des comparaisons plus larges avec les VLA récents et une extension de la version mobile à des tâches de longue durée.

À lire aussi

Une mémoire simple à base d'agents pour les politiques robotiques généralistes
1arXiv cs.RO 

Une mémoire simple à base d'agents pour les politiques robotiques généralistes

Des chercheurs proposent SimpleARM (Simple Agentic Robot Memory), une couche de mémoire sans entraînement pour politiques robotiques généralistes gelées, décrite dans un preprint arXiv (v1). Le système fonctionne en quatre temps : à partir de l'instruction de la tâche, il détermine ce qu'il faut surveiller ; des outils perceptifs gelés maintiennent en ligne un état compact et typé ; un accès structuré ne récupère cet état que lorsqu'un sous-objectif proposé dépend de l'historique ; enfin, un ancrage dans la vue courante résout les entités rappelées avant l'exécution. L'évaluation porte sur RoboMME, un benchmark de 16 tâches de manipulation dont la réussite exige des informations qui ne sont plus visibles dans l'observation actuelle. Sur les 16 tâches et trois graines de politique, SimpleARM atteint 67,17 % de réussite moyenne, contre 44,51 % pour la meilleure base de comparaison non oracle. Des ablations appariées montrent que retirer l'état de relation, de référence, de progression ou d'itinéraire provoque de fortes chutes là où cet état est mobilisé, et épargne largement les autres tâches. L'enjeu dépasse le gain chiffré, soit environ 22,7 points. Les systèmes de mémoire visuelle actuels conservent ou compressent des observations passées, en supposant que l'historique utile se retrouve dans les images. Or le contrôle robotique dépend aussi d'un état issu de l'interaction, qu'aucune image ne représente explicitement : quel objet est lequel après avoir été déplacé, où en est la tâche, dans quel ordre exécuter une procédure. Les résultats plaident pour une mémoire conçue comme un état compact et pertinent pour la tâche, plutôt que comme un historique visuel étendu. Pour les intégrateurs et les équipes qui déploient des politiques VLA gelées, l'intérêt pratique est réel : la couche s'ajoute sans réentraînement, donc sans coût de collecte de données ni de fine-tuning. La spécificité des ablations renforce la crédibilité du mécanisme. Des réserves s'imposent toutefois : les résultats proviennent d'un benchmark, avec des tâches vraisemblablement simulées, sans preuve de déploiement réel, et l'écart avec les approches plus complexes reste à vérifier hors de RoboMME. Ce travail s'inscrit dans la montée des modèles généralistes gelés, de type VLA, qui excellent en réactivité mais restent faibles sur les tâches à longue portée dépendant du passé. Les approches concurrentes se répartissent entre conservation brute de trames, compression de contexte visuel et mémoires apprises de bout en bout, toutes exposées au même défaut : ne pas capter l'état implicite. SimpleARM adopte une orientation « agentique », où des outils spécialisés remplissent l'état plutôt que la politique elle-même. Les suites logiques seraient des tests sur robot physique, d'autres benchmarks de mémoire et une comparaison avec des politiques entraînées avec mémoire native. Le preprint n'annonce ni code, ni pilote, ni calendrier, et n'a pas encore été évalué par des pairs.

RecherchePaper
1 source
« À base d'agents » ou pas, ce titre parle de synthèse de politiques robotiques guidées par le langage
2arXiv cs.RO 

« À base d'agents » ou pas, ce titre parle de synthèse de politiques robotiques guidées par le langage

Traduction et résumé français de l'article ARCHITECT : Une équipe de recherche présente ARCHITECT, un framework qui reformule l'apprentissage de politiques robotiques comme une tâche de synthèse de programme interactive plutôt que comme un modèle de bout en bout. Contrairement aux modèles vision-langage-action (VLA) qui produisent des politiques opaques et difficiles à corriger, ARCHITECT s'appuie sur des agents de codage basés sur des LLM pour générer des programmes robotiques modulaires exploitant une bibliothèque d'outils de perception et de contrôle. Un superviseur humain peut intervenir par des corrections en langage naturel, que le système relie directement au code de la politique grâce aux traces d'exécution du programme, puis distille dans une bibliothèque de compétences persistante, une forme d'apprentissage en contexte à long terme. Sur un benchmark utilisant un bras robotique Franka Panda, ARCHITECT surpasse à la fois les modèles VLA de référence et les méthodes de synthèse de programme concurrentes sur des tâches longues et complexes, dont la manipulation d'objets articulés et le pliage de tissu. L'intérêt principal réside dans la réponse apportée à un problème récurrent du secteur : le décalage entre les démonstrations impressionnantes des modèles VLA et leur fragilité en conditions réelles, où un changement de distribution provoque des échecs en cascade difficiles à diagnostiquer. En rendant chaque politique modulaire et traçable, ARCHITECT permet d'isoler précisément l'origine d'un échec et de corriger uniquement le module fautif, plutôt que de réentraîner un modèle entier. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des systèmes plus auditables et moins gourmands en données d'entraînement, un argument clé face au coût et à l'opacité des grands modèles de fondation robotiques. Ce travail s'inscrit dans un mouvement de recherche cherchant des alternatives aux VLA monolithiques, en misant sur les capacités de raisonnement des LLM pour écrire et corriger du code robotique plutôt que d'apprendre des politiques end-to-end. La bibliothèque de compétences accumulée permettrait au système de transférer ses acquis vers des tâches nouvelles avec une intervention humaine décroissante, un axe que les auteurs présentent comme une alternative data-efficiente et pilotable à l'apprentissage robotique en boîte noire. Il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, sans indication de déploiement industriel.

RecherchePaper
1 source
RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution
3arXiv cs.RO 

RSR à base d'agents : du réel au simulé au réel par reconstruction de scène et politiques robotiques ancrées dans l'exécution

Des chercheurs présentent Agentic Real-to-Sim-to-Real (Agentic RSR), un cadre qui relie dans une même boucle la reconstruction de scène, le développement de politique et l'exécution sur robot réel, à partir d'une seule tâche de manipulation. L'entrée se limite à une vidéo de l'espace de travail, une description de la tâche et le modèle connu du robot. Un agent récupère l'échelle métrique, affine la scène par retours visuels successifs et vérifie dans MuJoCo que les interactions pertinentes pour la tâche sont bien préservées. Un agent de codage écrit ensuite une politique exécutable, en progressant des poses d'objets privilégiées vers des observations visuelles, puis vers une simulation randomisée. La politique peut enchaîner plusieurs observations et actions au sein d'un même appel, et l'agent exploite les retours d'exécution pour poursuivre, réessayer ou revoir son approche. Sur 18 scènes reconstruites impliquant deux robots, l'erreur absolue moyenne de profondeur sur quatre vues, mesurée par rapport à des estimations de référence, atteint 0,1057 m. Le ΔE76 moyen en espace Lab est de 11,04 et le SSIM moyen en niveaux de gris de 0,6990. Sur robot réel, le taux de réussite agrégé atteint 80 % de celui obtenu en simulation. Le point notable tient à l'architecture plus qu'à une performance isolée. La reconstruction de scène et le développement de politique sont habituellement traités séparément, ce qui produit des jumeaux numériques jolis mais inutiles pour la tâche, ou des politiques entraînées sur des observations que le robot réel ne verra jamais. Ici, la scène est jugée sur sa capacité à préserver les interactions utiles, et la politique n'utilise que des observations disponibles sur le matériel. Un taux de rétention de 80 % suggère que le fossé sim-to-real peut se réduire sans entraînement massif par apprentissage par renforcement, en s'appuyant sur du code généré par un agent et corrigé par ses retours d'exécution. Pour les intégrateurs, la perspective est de déployer plus vite sur une cellule inédite à partir d'une simple vidéo. Les métriques de reconstruction restent toutefois modestes : une erreur de profondeur d'environ 10 cm et un SSIM proche de 0,70 indiquent une fidélité visuelle limitée. Le ratio de 80 % est relatif à la simulation, et le taux de réussite absolu, la diversité des tâches et le nombre d'essais ne sont pas précisés dans le résumé. Ces travaux s'inscrivent dans la montée des approches « real-to-sim » et des agents de codage appliqués à la robotique, qui concurrencent les VLA entraînés de bout en bout, plus gourmands en données de téléopération. Ils reposent sur MuJoCo, simulateur désormais standard, et sur des modèles de perception pour la profondeur et la géométrie. L'article, publié sur arXiv (2610.10479v1), annonce que le code et les données de scènes reconstruites seront rendus publics, sans calendrier précisé. Leur diffusion permettra de vérifier si la méthode tient hors du cadre de laboratoire, sur des tâches plus longues et des environnements encombrés, ainsi que de la comparer aux politiques apprises de bout en bout.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
4arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source