Moins de jetons, meilleure action : les agents robotiques GPT-6 Astra gagnent 14 % de réussite avec 65 % de jetons en moins
Des chercheurs publient sur arXiv (identifiant 2610.01939v1) PyRUA-Lean, un cadre d'exécution de code interactif pour piloter des robots avec un agent VLM (modèle vision-langage). Ici, le planificateur est GPT-6 Astra. L'agent compose des primitives robotiques classiques et des politiques VLA (vision-language-action) apprises dans des cellules Python. Ces cellules effectuent des vérifications conditionnelles et des tentatives locales de reprise. Elles ne renvoient au modèle que les images et les retours d'état demandés explicitement, pour permettre le replanning. L'évaluation porte sur 700 instances de tâches simulées issues de LIBERO-PRO, RoboTwin 2.0 et RoboCasa365. La référence est un agent à appels d'outils (tool-calling) qui utilise le même planificateur et les mêmes primitives. À budget d'appels LLM égal, le taux de réussite global passe de 63,1 % à 71,7 %, soit 8,6 points de plus (environ 14 % en relatif). Sur les instances résolues par les deux agents, PyRUA-Lean utilise 49 % d'appels LLM en moins et 65 % de tokens d'entrée en moins.
Le résultat touche un coût d'exploitation souvent absent des démonstrations : le nombre d'appels au modèle et le volume d'observations qu'il ingère à chaque pas. Dans une boucle classique, chaque action déclenche un appel au planificateur et le renvoi d'images, ce qui pèse sur la latence et la facture. Déléguer les vérifications et les reprises à du code exécuté localement déplace une partie du contrôle vers des routines déterministes. Pour un intégrateur, cela suggère qu'une partie du gain vient de l'architecture de l'agent, pas seulement d'un meilleur modèle. L'approche rapproche aussi les VLA, utilisés comme primitives, d'un orchestrateur de plus haut niveau. Il faut toutefois rester prudent. Tous les chiffres viennent de la simulation, le papier est un preprint non évalué par des pairs, et la comparaison porte sur un seul type de baseline. Le gap sim-to-real n'est pas traité dans le résumé, et la réduction de 49 % et 65 % ne vaut que sur les tâches réussies par les deux agents, ce qui exclut les cas où l'agent de référence échoue.
Ce travail s'inscrit dans la tendance des agents « code-as-policy », où un LLM écrit du code qui appelle des modules de perception et de contrôle, désormais associés à des politiques VLA comme Pi-0 ou GR00T. Les benchmarks retenus (LIBERO-PRO, RoboTwin 2.0, RoboCasa365) couvrent la manipulation tabletop, le bimanuel et les tâches domestiques en cuisine simulée. Ils sont courants, mais ils restent éloignés des contraintes d'un site industriel. Le résumé ne cite ni acteur européen, ni partenaire industriel, ni calendrier de déploiement. Les suites logiques seraient une validation sur robot physique, une comparaison avec d'autres architectures d'agents et une mesure du coût en euros par tâche plutôt qu'en tokens. Tant que ces tests n'existent pas, PyRUA-Lean reste un résultat de recherche et non un produit disponible.
Dans nos dossiers




