RobotUse : allouer le calcul, le contexte et les décisions
RobotUse est un « harnais » d'agent robotique présenté dans un preprint arXiv (2610.04929, version 2) par une équipe qui publie une page projet à l'adresse robotuse-team.github.io. Le système organise le calcul, le contexte et les décisions autour d'une tâche précise : spécifier puis réviser des actions physiques. L'agent, un modèle de langage, choisit visuellement les cibles et les poses. Le backend prend en charge la géométrie, la planification de mouvement et le contrôle. Des sous-agents conservent le détail des interactions propres à chaque sous-objectif et ne remontent que l'information utile à la décision suivante. Un mécanisme de « harnachement continu » met à jour un playbook persistant à partir de l'exécution. Sur le benchmark RoboLab, RobotUse atteint 45 % de réussite, soit 6,7 points de pourcentage de plus que CaP-X, avec des contextes de décision plus compacts et moins d'abstractions d'action prédéfinies. Les auteurs affirment aussi que le système apprend de l'exécution réelle malgré un retour d'information imparfait, et transfère ce savoir à des tâches ultérieures.
L'enjeu touche à la manière de découper les responsabilités entre un agent LLM et la pile robotique classique. Beaucoup d'interfaces enferment les choix dans des outils figés, ou obligent l'agent à manipuler du code d'exécution détaillé dont l'historique gonfle à chaque essai. RobotUse propose une répartition différente : l'agent décide en perception et en intention, le backend garde la géométrie et la commande. Les sous-agents servent aussi à contenir la croissance du contexte, un point de blocage fréquent pour les agents qui répètent leurs tentatives. Il faut toutefois relativiser les chiffres. Un taux de succès de 45 % signifie que plus de la moitié des tâches échouent, loin d'un niveau exploitable en production. L'écart avec CaP-X, de 6,7 points, est modeste, et le résumé ne donne ni nombre de tâches, ni variance, ni détail des essais réels. L'apprentissage « malgré un retour imparfait » reste une affirmation à vérifier dans le papier complet.
Ce travail s'inscrit dans la lignée des approches où un LLM génère du code ou appelle des outils pour piloter un robot, dont CaP-X est ici la référence de comparaison. Il se distingue des modèles vision-langage-action (VLA) de bout en bout, comme Pi-0 ou GR00T, qui apprennent directement la commande à partir de démonstrations. RobotUse mise à l'inverse sur un agent orchestrateur au-dessus d'un backend de planification classique. Aucune annonce de déploiement, de pilote industriel ou de calendrier n'accompagne ce preprint, qui reste un résultat de recherche. La suite probable passera par des évaluations sur davantage de tâches et de plateformes, ainsi que par une comparaison directe avec les VLA sur les mêmes benchmarks.
Dans nos dossiers




