Redonner vie au « Code as Policy » : des agents de pointe écrivent, appellent et font évoluer les outils robotiques
Des chercheurs publient URAI (Universal Robot-Agent Interface), un cadre qui sépare les rôles entre modèles de pointe et code exécutable pour la manipulation robotique. Un agent de programmation écrit des outils robotiques réutilisables ou spécifiques à une tâche à partir de l'intention de la tâche, puis les affine grâce au retour d'exécution et aux consignes humaines. Un agent d'exécution choisit et paramètre ces outils d'après les observations courantes. Chaque appel déroule localement un mouvement complet (approche, saisie, retrait) avant de rendre la main à l'agent. Les révisions validées persistent d'un épisode à l'autre sans toucher aux poids du modèle, et une interface graphique et une API communes donnent aux humains et aux agents accès aux mêmes outils. Sur cinq tâches du banc RoboDojo et quatre agents d'exécution figés, le taux de succès agrégé passe de 18,0 % à 53,0 % par rapport au contrôle direct des bouts de doigts, avec le gain le plus net sur Swap Blocks. Trois agents sur quatre terminent leurs épisodes 1,3 à 1,5 fois plus vite, avec 1,5 à 1,7 fois moins de tokens de sortie. Le coût de DeepSeek-V4-Flash, lui, varie à peine. Le cadre est aussi évalué sur sept tâches réelles avec un robot bimanuel AgileX : manipulation d'objets, pliage de textile et morpion en interaction avec un humain.
L'intérêt tient à l'arbitrage que ce travail rend mesurable. Faire raisonner un modèle de pointe à chaque mouvement élémentaire rend la manipulation lente et gourmande en tokens, ce qui pèse directement sur la latence et le coût d'exploitation d'un déploiement. Ici, le code absorbe les séquences de mouvement, et le modèle ne garde que la décision de haut niveau entre deux appels. Le résultat le plus instructif est la comparaison avec un programme écrit à l'avance : avec les mêmes outils, il n'atteint que 24 %, contre 56 % pour deux agents qui décident après chaque appel. Autrement dit, la boucle de rétroaction au niveau du modèle compte autant que la qualité des outils. À nuancer : les gains de vitesse ne sont pas uniformes, l'évaluation en simulation reste limitée à cinq tâches, et les résultats réels sur sept tâches AgileX sont décrits sans les chiffres détaillés dans le résumé. Pour un intégrateur, l'idée d'une bibliothèque d'outils améliorable sans réentraînement est séduisante, mais sa robustesse en production reste à démontrer.
Ce travail relance l'approche « code as policy », où un modèle de langage génère directement du code de contrôle. Cette approche avait montré ses limites lorsque le programme généré gérait seul toutes les décisions suivantes. URAI y répond en gardant le modèle dans la boucle. Il se place face aux politiques VLA (vision-langage-action) entraînées de bout en bout, comme Pi-0 ou GR00T, qui exigent des données de téléopération et des mises à jour de poids, alors qu'URAI s'appuie sur des modèles génériques figés et sur l'écriture d'outils. Les deux voies pourraient se combiner, des VLA fournissant des primitives que des agents orchestreraient. Il s'agit d'un preprint (arXiv, v1) : aucun produit, calendrier de déploiement ni partenaire industriel n'est annoncé. Les prochaines étapes à surveiller sont une validation sur davantage de tâches réelles, des comparaisons directes avec des VLA, et la reproductibilité sur d'autres matériels que l'AgileX.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




