Aller au contenu principal
RecherchearXiv cs.RO 

Redonner vie au « Code as Policy » : des agents de pointe écrivent, appellent et font évoluer les outils robotiques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient URAI (Universal Robot-Agent Interface), un cadre qui sépare les rôles entre modèles de pointe et code exécutable pour la manipulation robotique. Un agent de programmation écrit des outils robotiques réutilisables ou spécifiques à une tâche à partir de l'intention de la tâche, puis les affine grâce au retour d'exécution et aux consignes humaines. Un agent d'exécution choisit et paramètre ces outils d'après les observations courantes. Chaque appel déroule localement un mouvement complet (approche, saisie, retrait) avant de rendre la main à l'agent. Les révisions validées persistent d'un épisode à l'autre sans toucher aux poids du modèle, et une interface graphique et une API communes donnent aux humains et aux agents accès aux mêmes outils. Sur cinq tâches du banc RoboDojo et quatre agents d'exécution figés, le taux de succès agrégé passe de 18,0 % à 53,0 % par rapport au contrôle direct des bouts de doigts, avec le gain le plus net sur Swap Blocks. Trois agents sur quatre terminent leurs épisodes 1,3 à 1,5 fois plus vite, avec 1,5 à 1,7 fois moins de tokens de sortie. Le coût de DeepSeek-V4-Flash, lui, varie à peine. Le cadre est aussi évalué sur sept tâches réelles avec un robot bimanuel AgileX : manipulation d'objets, pliage de textile et morpion en interaction avec un humain.

L'intérêt tient à l'arbitrage que ce travail rend mesurable. Faire raisonner un modèle de pointe à chaque mouvement élémentaire rend la manipulation lente et gourmande en tokens, ce qui pèse directement sur la latence et le coût d'exploitation d'un déploiement. Ici, le code absorbe les séquences de mouvement, et le modèle ne garde que la décision de haut niveau entre deux appels. Le résultat le plus instructif est la comparaison avec un programme écrit à l'avance : avec les mêmes outils, il n'atteint que 24 %, contre 56 % pour deux agents qui décident après chaque appel. Autrement dit, la boucle de rétroaction au niveau du modèle compte autant que la qualité des outils. À nuancer : les gains de vitesse ne sont pas uniformes, l'évaluation en simulation reste limitée à cinq tâches, et les résultats réels sur sept tâches AgileX sont décrits sans les chiffres détaillés dans le résumé. Pour un intégrateur, l'idée d'une bibliothèque d'outils améliorable sans réentraînement est séduisante, mais sa robustesse en production reste à démontrer.

Ce travail relance l'approche « code as policy », où un modèle de langage génère directement du code de contrôle. Cette approche avait montré ses limites lorsque le programme généré gérait seul toutes les décisions suivantes. URAI y répond en gardant le modèle dans la boucle. Il se place face aux politiques VLA (vision-langage-action) entraînées de bout en bout, comme Pi-0 ou GR00T, qui exigent des données de téléopération et des mises à jour de poids, alors qu'URAI s'appuie sur des modèles génériques figés et sur l'écriture d'outils. Les deux voies pourraient se combiner, des VLA fournissant des primitives que des agents orchestreraient. Il s'agit d'un preprint (arXiv, v1) : aucun produit, calendrier de déploiement ni partenaire industriel n'est annoncé. Les prochaines étapes à surveiller sont une validation sur davantage de tâches réelles, des comparaisons directes avec des VLA, et la reproductibilité sur d'autres matériels que l'AgileX.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

RACaP : raisonnement, action et codage à base d'agents pour un apprentissage robotique évolutif
1arXiv cs.RO 

RACaP : raisonnement, action et codage à base d'agents pour un apprentissage robotique évolutif

Des chercheurs ont publié sur arXiv, le 25 septembre 2026 (référence 2609.29394), un article décrivant RACaP (Reasoning, Acting, and Coding as Policies), un framework agentique pour l'apprentissage robotique évolutif. Contrairement aux méthodes Code as Policies (CaP) classiques, qui génèrent et réparent du code au moment de l'exécution au prix d'une latence et d'un mélange entre mécanismes réutilisables et décisions spécifiques à la tâche, RACaP déplace la génération de code vers une phase d'évolution en amont et s'appuie, au déploiement, sur une boucle ReAct qui appelle des API de politiques figées et typées, combinant curriculum d'apprentissage et auto-évolution autonome. Sur les bancs d'essai en simulation LIBERO, RACaP atteint 54,4% de réussite sur LIBERO-90, 45,0% en zero-shot sur LIBERO-PRO et 46,0% sur LIBERO-Long, contre au maximum 4,0% pour les baselines CaP sur les tâches à long horizon, soit 2,5 fois leur taux de réussite sur LIBERO-PRO et un temps de décision médian 1,9 fois plus rapide. Un fine-tuning par échantillonnage par rejet distille ensuite les décisions ReAct de GPT-5.6 dans un modèle compact Qwen3-VL-8B-Instruct, accélérant l'inférence par décision d'un facteur 13,2 et réduisant les appels physiques répétés de 16 à 4. Ce travail cible un problème concret pour les intégrateurs: la latence et la fragilité des approches où un modèle de langage génère et corrige du code de contrôle en direct, ce qui complique la maintenance et le passage à l'échelle sur des tâches longues. En séparant le code réutilisable, figé après évolution, des décisions prises en temps réel via mémoire de travail, mémoire d'expérience et retour visuel, RACaP illustre une piste pour rendre les agents VLA (vision-language-action) plus robustes et plus rapides sans sacrifier l'adaptabilité. La distillation vers un modèle compact comme Qwen3-VL-8B-Instruct répond directement à une contrainte industrielle: les grands modèles comme GPT-5.6 restent trop lents et coûteux pour tourner en boucle fermée sur un robot physique. Ces résultats demeurent toutefois obtenus en simulation sur les bancs académiques LIBERO, et non lors d'un déploiement réel en usine ou en entrepôt, laissant ouvert l'écart classique entre performance simulée et performance en conditions réelles. RACaP s'inscrit dans la lignée des méthodes Code as Policies, qui font piloter des robots par des grands modèles de langage générant directement du code exécutable, une approche dont les limites sur les tâches longues et complexes sont confirmées ici par les scores plafonnés à 4,0% des baselines CaP citées dans l'article. En comparant son architecture à ces méthodes de référence sur les mêmes bancs LIBERO-90, LIBERO-PRO et LIBERO-Long, l'équipe cherche à démontrer qu'une architecture combinant code figé et raisonnement au moment de l'action offre une meilleure transférabilité zero-shot, un critère que surveillent les décideurs avant tout investissement en robotique VLA. L'article, disponible en prépublication sous la référence 2609.29394v1, ne mentionne ni calendrier de déploiement sur robot physique ni partenariat industriel; les prochaines étapes attendues pour ce type de travaux académiques restent une validation sur plateforme réelle et une revue par les pairs.

RechercheActu
1 source
Apprentissage robotique en contexte avec des agents VLM
2arXiv cs.RO 

Apprentissage robotique en contexte avec des agents VLM

Un article publié sur arXiv (référence 2609.19138v1) présente GPT-Policy, un cadre logiciel qui permet à un robot d'apprendre au moment du déploiement, sans réentraînement préalable pour chaque tâche. L'architecture combine un « context compiler » qui conserve les transitions visuelles utiles à la tâche, un modèle vision-langage (VLM) grand public comme GPT-6 Astra chargé de proposer des actions robot-outil, et un contrôleur contraint qui vérifie, exécute et rapporte le résultat de chaque action. Sur robot réel, des démonstrations vidéo humaines améliorent le taux de réussite même sans étiquetage des actions robotiques correspondantes, et des références d'actions alignées apportent un gain supplémentaire sur les tâches sensibles au contact. Aucun chiffre de charge utile, de degrés de liberté ou de temps de cycle n'est communiqué : il s'agit d'une étude de recherche évaluée sur des métriques de réussite et d'efficacité, pas d'un produit commercialisé. Le problème visé est central pour l'industrie : aucun jeu de démonstrations fini ne peut couvrir toutes les tâches et situations qu'un robot rencontrera en usage réel, ce qui limite la généralisation des politiques actuelles entraînées par imitation. En s'appuyant sur l'apprentissage en contexte, déjà courant chez les grands modèles de langage pour le texte ou le code, mais sans mise à jour de gradient ni modification persistante des paramètres, l'approche suggère qu'un VLM généraliste pourrait s'adapter à une situation nouvelle à partir de quelques exemples fournis au moment de l'exécution. Si elle se confirme à plus grande échelle, cette piste remettrait en question l'idée selon laquelle seuls des modèles vision-langage-action spécialement entraînés sur des données robotiques peuvent piloter un robot, un enjeu direct pour les intégrateurs cherchant à réduire le coût de collecte de données par tâche. Ce travail s'inscrit dans la vague des modèles fondation appliqués à la robotique, aux côtés de familles VLA comme Pi-0, GR00T N2 ou Helix, qui misent à l'inverse sur un entraînement massif de bout en bout sur des données robotiques. Les auteurs présentent eux-mêmes leurs résultats comme une étape vers l'apprentissage en contexte plutôt que comme une solution aboutie, reconnaissant que des défis subsistent avant un déploiement fiable. Aucun acteur français ou européen, aucun site de déploiement industriel ni calendrier de commercialisation ne figurent dans cette publication, qui reste une contribution académique destinée à poser des fondations empiriques plutôt qu'un produit prêt à l'emploi.

UEAucun acteur ni déploiement européen n'est mentionné, mais la piste de l'apprentissage en contexte pourrait à terme intéresser les intégrateurs robotiques européens en réduisant le coût de collecte de données par tâche.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
3arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique
4arXiv cs.RO 

VASO : des compétences formellement vérifiables et auto-évolutives pour agents d'IA physique

Des chercheurs ont publié sur arXiv (identifiant 2606.05395) un framework nommé VASO, pour "Verification-guided Self-evolution of LLM-generated robot skill contracts", qui vise à rendre les compétences robotiques générées par des grands modèles de langage à la fois réutilisables et formellement vérifiables. L'idée centrale : chaque compétence n'est plus un simple script exécutable mais un contrat sémantique à double interface, une interface formelle qui aligne états du robot, observations et commandes de contrôle avec des propositions logiques pour le model checking, et une interface orientée planificateur qui guide la génération de comportements exécutables. Lorsqu'un plan généré échoue à la vérification, VASO traduit la trace de contre-exemple en un gradient textuel qui met à jour le contrat de compétence réutilisable, sans toucher aux poids du modèle de fondation. Sur des plateformes Clearpath Jackal et PX4 (quadrocoptère), le framework atteint 97,2 % de conformité aux spécifications temporelles formelles en moins de 100 échantillons d'optimisation, surpassant les baselines de feedback d'exécution, d'optimisation de prompt et de fine-tuning. Le problème adressé est précis et rarement traité : les boucles d'évolution de compétences existantes, retour d'exécution, tests unitaires, récompenses d'environnement, auto-critique LLM, ne fournissent que des preuves au niveau de la trace. Elles montrent qu'une compétence a fonctionné sur des exécutions échantillonnées, pas qu'elle satisfait des contrats de sécurité temporelle dans des conditions non testées. Pour un intégrateur ou un COO industriel, c'est la différence entre une démo convaincante en lab et un déploiement certifiable en production. Le fait que VASO maintienne les poids du modèle gelés est également notable sur le plan économique : pas de fine-tuning, pas de GPU dédié à la mise à jour du modèle. Ce travail s'inscrit dans la tendance des "physical AI agents" où les LLM orchestrent des comportements robotiques à long horizon depuis des instructions en langage naturel. Les compétences réutilisables sont devenues les unités de base de ces architectures, mais leur fiabilité formelle reste un angle mort notable. Des approches concurrentes comme les VLA (Vision-Language-Action models) ou les frameworks d'optimisation de prompts comme OPRO ne ferment pas cette boucle vérification-évolution. VASO affirme être le premier à le faire explicitement. Il s'agit néanmoins d'un preprint sans validation industrielle publiée, et les résultats obtenus sur deux plateformes relativement simples devront être confirmés sur des environnements plus complexes et des chaînes de compétences plus longues avant d'envisager un déploiement en conditions réelles.

RecherchePaper
1 source