OpenRUA : les agents d'utilisation de robots sont des politiques visuomotrices zero-shot
OpenRUA, un framework publié sur arXiv (code disponible sur GitHub, dépôt terminalworld/OpenRUA), montre qu'un agent de code généraliste peut piloter un robot sans couche d'abstraction sur mesure. Le dispositif se limite à un accès terminal à ROS 2, l'interface logicielle native du robot. L'agent dispose d'un espace de travail minimal contenant la documentation ROS 2 et quelques outils de base, puis organise seul son travail, sans workflow imposé. La perception devient une affaire de lecture de fichiers, la manipulation un exercice de programmation. Avec Claude Code propulsé par Claude Opus 5, les auteurs rapportent 99,0 % de réussite sur CaP-Bench et 87,0 % sur LIBERO-PRO, sans primitives dédiées ni entraînement spécifique aux tâches. Dans 96,80 % des épisodes, l'agent écrit de lui-même des programmes qui traitent les données brutes des capteurs pour en tirer des mesures métriques. Il construit des clients de contrôle moteur, comme la commande de pince, dans 95,87 % des épisodes, et des boucles de contrôle fermées, qui ajustent le mouvement selon le retour capteur, dans 50,13 % des cas.
L'intérêt tient à la remise en cause d'une pratique répandue : empiler des harnais complexes, avec workflows prescrits et interfaces maison, autour des modèles pour les faire agir sur du matériel. Si un agent de code du commerce atteint ces scores avec ROS 2 seul, une partie de cette ingénierie pourrait être superflue. Pour les intégrateurs, cela suggère que la valeur se déplace vers la qualité de la documentation, des interfaces standard et des garde-fous, plutôt que vers des SDK propriétaires. C'est aussi une alternative aux VLA (vision-language-action) entraînés de bout en bout, comme Pi-0 ou GR00T, puisqu'ici la politique visuomotrice est produite à la volée sous forme de code. Les réserves sont nombreuses. Les résultats portent sur des benchmarks, très probablement en simulation, et rien n'indique une validation sur robot réel. Le temps de cycle, la latence, le coût en tokens et la sécurité d'un code généré puis exécuté sur un bras ne sont pas détaillés dans le résumé. Le contrôle en boucle fermée n'apparaît que dans la moitié des épisodes, ce qui limite la portée pour les tâches dynamiques.
Ces travaux prolongent la montée en puissance des agents de code, d'abord cantonnés au logiciel, puis étendus au monde physique via des approches de type « code as policies », où un modèle de langage écrit des programmes de contrôle. Les travaux antérieurs s'appuyaient sur des harnais spécialisés, que OpenRUA cherche à supprimer. Le concept concurrence les VLA entraînés sur de grandes bases de démonstrations, au prix d'une dépendance à un modèle propriétaire de pointe. Les prochaines étapes à surveiller sont la validation sur matériel réel, la mesure des coûts et de la latence, et la reproduction avec des modèles ouverts, que la publication du code rend désormais possible.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




