RobotWorld : un banc d'essai pour agents multimodaux pilotant des robots, sur des tâches et des morphologies variées
RobotWorld, un banc d'essai en simulation publié sur arXiv (2610.10409), cherche à mesurer jusqu'où les agents généralistes, déjà capables d'écrire du code, d'utiliser des outils et de mener des tâches numériques complexes, savent piloter un robot. Il regroupe 84 tâches couvrant la manipulation, la manipulation mobile, la locomotion, la conduite et le contrôle aérien. Chaque tâche impose un budget d'interactions explicite et une vérification de succès exécutable. Les chercheurs analysent les résultats en parallèle des traces d'exécution, afin de distinguer ce qui se transfère du numérique vers le physique et ce qui bloque. Deux modèles ressortent de la comparaison : Astra et Opus 5.5.
Les agents testés savent monter des chaînes de perception et de contrôle élaborées : segmentation d'images, calibration de caméra, estimation spatiale, calculs fondés sur la dynamique. Ces briques ne se composent pourtant pas de façon fiable en comportement abouti. Les agents perdent l'état des objets pertinents alors même que le robot atteint les poses commandées, ne corrigent pas les actions inefficaces, réagissent trop tard ou prennent une tâche inachevée pour une tâche terminée. Les profils divergent selon le modèle : Astra réussit plus souvent les objectifs spatiaux et ceux à contact contraint, tandis qu'Opus 5.5 l'emporte sur l'équilibre continu et les interactions chronométrées. Il s'agit d'une évaluation en simulation. Le résumé ne fournit ni taux de réussite globaux ni chiffres par modèle, ce qui limite la lecture quantitative.
L'intérêt pour l'industrie tient au diagnostic. Le goulot d'étranglement ne semble plus se situer dans la génération de code de perception ou de contrôle, que les agents maîtrisent déjà, mais dans le suivi d'état, l'auto-vérification et la détection d'échec en boucle fermée. Pour les intégrateurs qui envisagent d'appuyer des robots sur des modèles généralistes plutôt que sur des politiques VLA spécialisées, cela signifie qu'un agent capable de produire un pipeline convaincant ne garantit pas une exécution fiable, et que la confirmation de fin de tâche ne peut pas lui être déléguée sans contrôle externe. Les profils complémentaires d'Astra et d'Opus 5.5 montrent aussi qu'aucun modèle ne domine sur l'ensemble des embodiments, ce qui pèse sur le choix d'un modèle selon l'application.
RobotWorld s'inscrit dans la série de bancs d'essai qui évaluent les agents hors du texte, après les tests de code, de navigation web et d'usage d'ordinateur. Il se distingue en couvrant des morphologies très différentes dans un même cadre, avec des critères de succès exécutables plutôt que des jugements subjectifs. Il complète les évaluations de politiques robotiques entraînées de bout en bout, comme les approches VLA, en mesurant la voie concurrente : l'agent généraliste qui pilote un robot via ses interfaces. Les auteurs le présentent comme une cible concrète pour l'entraînement d'agents physiques plus fiables. La suite dépendra de la publication du jeu de tâches et de l'évaluation sur robots réels, qui dira si ces écarts survivent au passage de la simulation au monde physique.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




