Aller au contenu principal
RecherchearXiv cs.RO 

« À base d'agents » ou pas, ce titre parle de synthèse de politiques robotiques guidées par le langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Traduction et résumé français de l'article ARCHITECT :

Une équipe de recherche présente ARCHITECT, un framework qui reformule l'apprentissage de politiques robotiques comme une tâche de synthèse de programme interactive plutôt que comme un modèle de bout en bout. Contrairement aux modèles vision-langage-action (VLA) qui produisent des politiques opaques et difficiles à corriger, ARCHITECT s'appuie sur des agents de codage basés sur des LLM pour générer des programmes robotiques modulaires exploitant une bibliothèque d'outils de perception et de contrôle. Un superviseur humain peut intervenir par des corrections en langage naturel, que le système relie directement au code de la politique grâce aux traces d'exécution du programme, puis distille dans une bibliothèque de compétences persistante, une forme d'apprentissage en contexte à long terme. Sur un benchmark utilisant un bras robotique Franka Panda, ARCHITECT surpasse à la fois les modèles VLA de référence et les méthodes de synthèse de programme concurrentes sur des tâches longues et complexes, dont la manipulation d'objets articulés et le pliage de tissu.

L'intérêt principal réside dans la réponse apportée à un problème récurrent du secteur : le décalage entre les démonstrations impressionnantes des modèles VLA et leur fragilité en conditions réelles, où un changement de distribution provoque des échecs en cascade difficiles à diagnostiquer. En rendant chaque politique modulaire et traçable, ARCHITECT permet d'isoler précisément l'origine d'un échec et de corriger uniquement le module fautif, plutôt que de réentraîner un modèle entier. Pour les intégrateurs et décideurs industriels, cela ouvre la voie à des systèmes plus auditables et moins gourmands en données d'entraînement, un argument clé face au coût et à l'opacité des grands modèles de fondation robotiques.

Ce travail s'inscrit dans un mouvement de recherche cherchant des alternatives aux VLA monolithiques, en misant sur les capacités de raisonnement des LLM pour écrire et corriger du code robotique plutôt que d'apprendre des politiques end-to-end. La bibliothèque de compétences accumulée permettrait au système de transférer ses acquis vers des tâches nouvelles avec une intervention humaine décroissante, un axe que les auteurs présentent comme une alternative data-efficiente et pilotable à l'apprentissage robotique en boîte noire. Il s'agit pour l'instant d'un résultat de recherche évalué en laboratoire, sans indication de déploiement industriel.

Dans nos dossiers

À lire aussi

IA à base d'agents, pilotée par LLM : synthèse d'actions robotiques à partir de la parole, des gestes et de la musique
1arXiv cs.RO 

IA à base d'agents, pilotée par LLM : synthèse d'actions robotiques à partir de la parole, des gestes et de la musique

Des chercheurs publient sur arXiv (arXiv:2606.31158, soumission nouvelle non encore validée par les pairs) un framework qui utilise un grand modèle de langage (LLM) pour générer des actions robotiques à partir d'entrées humaines multimodales combinant parole naturelle, gestes de la main et musique ou rythme sonore. L'architecture assemble trois briques : un module de transcription vocale, un module de reconnaissance de gestes, et un pipeline de traitement du signal dédié à la détection de battements musicaux. Ces flux sont contextualisés via des templates de prompts, puis transmis à un LLM qui, informé d'un espace d'actions robotiques prédéfini, raisonne sur l'ensemble pour produire une séquence d'actions cohérente. Cette séquence alimente une file d'exécution pilotée via ROS (Robot Operating System) sur un robot quadrupède. L'abstract ne précise ni le modèle de LLM utilisé, ni de métriques de performance chiffrées, ni le nom commercial du robot testé : à ce stade, il s'agit d'une preuve de concept méthodologique documentée dans un preprint, pas d'un produit ou d'un déploiement. L'intérêt tient à la fusion de trois canaux hétérogènes dans un seul raisonnement : commandes sémantiques issues de la parole, information déictique (pointage, direction) issue des gestes, et cues rythmiques issues de la musique. Cela dépasse les systèmes de commande rigides et pré-programmés qui dominent encore l'interaction homme-robot (HRI), et s'inscrit dans la tendance plus large consistant à confier aux LLM le rôle de "cerveau de raisonnement" pour des comportements robotiques créatifs et contextuels, plutôt que pour la seule manipulation d'objets. Ce type d'approche vise davantage les robots d'accueil, de divertissement ou compagnons sociaux que l'industrie lourde, le quadrupède servant ici de plateforme de démonstration générique. Le travail s'inscrit dans la vague récente de recherches associant LLM et VLA (vision-language-action) à la robotique, aux côtés d'efforts comme GR00T N2 ou Pi-0 orientés manipulation. Ce papier se distingue en ciblant spécifiquement l'interaction créative multimodale plutôt que la tâche industrielle. L'abstract ne mentionne ni affiliation ni auteurs identifiables, ni calendrier de suite ; les prochaines étapes attendues pour ce type de travail restent une évaluation utilisateur et l'extension à d'autres morphologies de robots.

RecherchePaper
1 source
ASPIRE : découverte de compétences à base d'agents pour la robotique
2arXiv cs.RO 

ASPIRE : découverte de compétences à base d'agents pour la robotique

ASPIRE (Agentic Skill Programming through Iterative Robot Exploration) est un nouveau système d'apprentissage continu pour la robotique, décrit dans un article publié sur arXiv (2607.00272) début juillet 2026. Contrairement à la programmation robotique traditionnelle, qui impose de coder manuellement la perception multimodale, la gestion des contacts physiques et la diversité des échecs d'exécution, ASPIRE écrit et corrige lui-même ses programmes de contrôle selon le paradigme "code-as-policy", puis capitalise chaque correction validée dans une bibliothèque de compétences réutilisables. Le système s'appuie sur trois briques : un moteur d'exécution en boucle fermée qui expose des traces multimodales fines pour diagnostiquer les échecs et synthétiser des réparations ; une bibliothèque de compétences qui s'enrichit en continu de correctifs transférables ; et une recherche évolutionnaire qui génère des séquences de tâches et des programmes de contrôle variés, au-delà du simple raffinement trajectoire par trajectoire. Sur les bancs d'essai simulés, ASPIRE dépasse les méthodes précédentes de 77% sur les manipulations perturbées de LIBERO-Pro, 72% sur les transferts bimanuels de Robosuite, et 32% sur les tâches ménagères longues de BEHAVIOR-1K. Ce travail s'attaque directement à un point de friction connu du secteur : la difficulté à faire generaliser des politiques de contrôle robotique au-delà de la tâche pour laquelle elles ont été conçues, sans réentraînement lourd à chaque nouvelle configuration. La bibliothèque cumulative d'ASPIRE permet une généralisation zero-shot à des tâches longues jamais vues : 31% de réussite sur LIBERO-Pro Long, contre seulement 4% pour les meilleures méthodes concurrentes, qui pourtant s'appuient sur du raisonnement et des tentatives répétées au moment de l'exécution. Pour les intégrateurs et décideurs robotique, c'est un signal encourageant sur la viabilité de bibliothèques de compétences auto-construites plutôt que de politiques VLA monolithiques entraînées une fois pour toutes, mais les auteurs restent prudents : ils ne parlent que de "premières preuves" de transfert simulation-vers-réel, pas d'un problème résolu. Ce résultat s'inscrit dans la lignée des travaux récents sur les politiques de contrôle générées ou affinées par des grands modèles de langage, où l'enjeu principal est de dépasser le stade de la démonstration isolée pour atteindre une robustesse répétable en conditions réelles. Contrairement aux approches par apprentissage par renforcement pur ou aux VLA entraînés de bout en bout (type Pi-0 ou GR00T), ASPIRE mise sur l'exploration itérative et la mémoire de compétences pour réduire l'effort de programmation à chaque nouvel embodiment ou API robotique. Les auteurs annoncent vouloir approfondir la validation du transfert sim-to-real sur des plateformes physiques variées, une étape encore à venir puisque l'article ne documente pour l'instant que des résultats en simulation.

RecherchePaper
1 source
SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel
3arXiv cs.RO 

SR-Platform : un pipeline à base d'agents pour la synthèse d'environnements de simulation robotique en langage naturel

SR-Platform est un pipeline agentique, publié en preprint arXiv (2605.14700) en mai 2026, qui convertit des descriptions en langage naturel en environnements de simulation MuJoCo exécutables et physiquement valides. Le système décompose la génération de scènes en quatre étapes : un orchestrateur LLM qui structure l'intention utilisateur en plan de scène ; un "asset forge" qui récupère des géométries en cache ou en génère de nouvelles via synthèse LLM-CadQuery ; un "layout architect" qui assigne les poses des objets et vérifie les contraintes spatiales ; et une couche bridge qui assemble le fichier MJCF final en intégrant le modèle de robot cible. Déployé comme stack Docker à neuf services (MinIO pour les meshes, Qdrant pour la récupération sémantique d'assets, Redis pour l'état des jobs, InfluxDB pour la télémétrie), SR-Platform affiche une latence médiane d'environ 50 secondes pour des scènes à cinq objets, tombant à 30-40 secondes avec cache d'assets actif, sur une base de 611 appels LLM réussis en 30 jours de production. Le taux de retry de l'asset forge atteint 11,3 %, avec récupération automatique. Construire manuellement une scène MuJoCo prête à l'entraînement exige une expertise croisée en modélisation 3D, spécification MJCF, gestion des collisions et intégration robot, un processus qui représente typiquement plusieurs heures par scène. Ramener cette étape à moins d'une minute via une invite en langage naturel est un levier direct pour produire des environnements d'entraînement plus variés, facteur clé de la généralisation sim-to-real des politiques robotiques. Pour les équipes de robot learning, cette friction de configuration est réelle et souvent sous-estimée dans les pipelines de données synthétiques. Les métriques publiées portent cependant sur des scènes limitées à cinq objets dans un cadre contrôlé, et la robustesse du pipeline sur des configurations plus complexes ou des descriptions ambiguës reste à démontrer. La génération automatisée d'environnements de simulation est un goulot d'étranglement reconnu dans les pipelines de robot learning, que ce soit pour le reinforcement learning, l'imitation learning ou l'entraînement de modèles vision-langage-action (VLA). MuJoCo, maintenu par DeepMind, est le moteur physique de référence pour ces travaux. NVIDIA Isaac Lab et le framework open-source Genesis couvrent également cet espace ; Physical Intelligence (pi.ai) mise de son côté sur des pipelines d'entraînement à très large échelle. SR-Platform se positionne en amont, sur la génération de scènes plutôt que de politiques, avec un accent sur l'accessibilité via le langage naturel. Son code source n'est pas publié en open-source et le contexte précis du déploiement qualifié de "production" n'est pas explicité dans le preprint.

RecherchePaper
1 source
Apprentissage de politiques robotiques structurées à partir de modèles vision-langage par supervision neuro-symbolique synthétique
4arXiv cs.RO 

Apprentissage de politiques robotiques structurées à partir de modèles vision-langage par supervision neuro-symbolique synthétique

Une équipe de recherche publie sur arXiv (référence 2604.02812) une approche neuro-symbolique permettant à un modèle de langage vision (VLM) de générer automatiquement des politiques robotiques exécutables sous forme d'arbres de comportement (Behavior Trees, BTs), à partir d'observations visuelles, d'instructions en langage naturel et de spécifications système structurées. La contribution centrale est un pipeline entièrement automatisé qui produit un jeu de données synthétique multimodal : des scènes à randomisation de domaine sont générées procéduralement, chacune associée à des exemples instruction-politique produits par un modèle fondamental. Un modèle de 12 milliards de paramètres est ensuite entraîné exclusivement sur ces données synthétiques, sans annotation humaine. Les expériences physiques, conduites sur deux manipulateurs robotiques hétérogènes, confirment un transfert zéro-shot vers des environnements réels. L'enjeu industriel est direct : la grande majorité des politiques visuomotrices actuelles reposent sur des architectures end-to-end opaques, difficilement auditables ou certifiables pour un déploiement en production. En produisant des BTs, cette méthode offre interprétabilité, modularité et exécution réactive, trois propriétés que les intégrateurs industriels exigent mais que les approches VLA classiques (Pi-0, GR00T N2, OpenVLA) ne garantissent pas nativement. Le fait que le transfert sim-to-real soit obtenu sans aucune donnée réelle lors de l'entraînement contredit l'hypothèse persistante selon laquelle le gap simulation-réalité rendrait ce type d'approche impraticable pour la manipulation. C'est sur ce point que les résultats méritent attention, même si les auteurs ne détaillent pas la complexité des scènes testées ni les métriques de robustesse sur longues séquences. Les Behavior Trees sont un standard hérité du jeu vidéo et de la robotique classique, adoptés notamment dans ROS 2 via BehaviorTree.CPP, précisément pour leur lisibilité et leur capacité de reprise sur erreur. La tension entre contrôle symbolique et apprentissage end-to-end est au coeur des débats actuels, avec des acteurs comme 1X, Physical Intelligence ou Boston Dynamics cherchant des compromis différents. Cette recherche positionne les VLMs non plus comme générateurs de mouvements bruts, mais comme compilateurs de plans structurés, une distinction architecturale qui pourrait orienter les prochains cycles de développement vers des systèmes hybrides plus auditables. La prochaine étape naturelle serait de valider l'approche sur des manipulateurs commerciaux dans des environnements non contrôlés et sur des horizons de tâches plus longs.

RechercheOpinion
1 source