Aller au contenu principal
RecherchearXiv cs.RO 

RobotWorld : un banc d'essai pour agents multimodaux pilotant des robots, sur des tâches et des morphologies variées

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RobotWorld, un banc d'essai en simulation publié sur arXiv (2610.10409), cherche à mesurer jusqu'où les agents généralistes, déjà capables d'écrire du code, d'utiliser des outils et de mener des tâches numériques complexes, savent piloter un robot. Il regroupe 84 tâches couvrant la manipulation, la manipulation mobile, la locomotion, la conduite et le contrôle aérien. Chaque tâche impose un budget d'interactions explicite et une vérification de succès exécutable. Les chercheurs analysent les résultats en parallèle des traces d'exécution, afin de distinguer ce qui se transfère du numérique vers le physique et ce qui bloque. Deux modèles ressortent de la comparaison : Astra et Opus 5.5.

Les agents testés savent monter des chaînes de perception et de contrôle élaborées : segmentation d'images, calibration de caméra, estimation spatiale, calculs fondés sur la dynamique. Ces briques ne se composent pourtant pas de façon fiable en comportement abouti. Les agents perdent l'état des objets pertinents alors même que le robot atteint les poses commandées, ne corrigent pas les actions inefficaces, réagissent trop tard ou prennent une tâche inachevée pour une tâche terminée. Les profils divergent selon le modèle : Astra réussit plus souvent les objectifs spatiaux et ceux à contact contraint, tandis qu'Opus 5.5 l'emporte sur l'équilibre continu et les interactions chronométrées. Il s'agit d'une évaluation en simulation. Le résumé ne fournit ni taux de réussite globaux ni chiffres par modèle, ce qui limite la lecture quantitative.

L'intérêt pour l'industrie tient au diagnostic. Le goulot d'étranglement ne semble plus se situer dans la génération de code de perception ou de contrôle, que les agents maîtrisent déjà, mais dans le suivi d'état, l'auto-vérification et la détection d'échec en boucle fermée. Pour les intégrateurs qui envisagent d'appuyer des robots sur des modèles généralistes plutôt que sur des politiques VLA spécialisées, cela signifie qu'un agent capable de produire un pipeline convaincant ne garantit pas une exécution fiable, et que la confirmation de fin de tâche ne peut pas lui être déléguée sans contrôle externe. Les profils complémentaires d'Astra et d'Opus 5.5 montrent aussi qu'aucun modèle ne domine sur l'ensemble des embodiments, ce qui pèse sur le choix d'un modèle selon l'application.

RobotWorld s'inscrit dans la série de bancs d'essai qui évaluent les agents hors du texte, après les tests de code, de navigation web et d'usage d'ordinateur. Il se distingue en couvrant des morphologies très différentes dans un même cadre, avec des critères de succès exécutables plutôt que des jugements subjectifs. Il complète les évaluations de politiques robotiques entraînées de bout en bout, comme les approches VLA, en mesurant la voie concurrente : l'agent généraliste qui pilote un robot via ses interfaces. Les auteurs le présentent comme une cible concrète pour l'entraînement d'agents physiques plus fiables. La suite dépendra de la publication du jeu de tâches et de l'évaluation sur robots réels, qui dira si ces écarts survivent au passage de la simulation au monde physique.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Gradients de valeur pour la conception de robots à morphologies multiples
1arXiv cs.RO 

Gradients de valeur pour la conception de robots à morphologies multiples

Des chercheurs ont publié le 2 juin 2026 sur arXiv (référence 2606.00702) une méthode visant à accélérer la conception de robots via ce qu'ils nomment les "value gradients". Le principe consiste à entraîner une unique fonction de valeur issue du reinforcement learning sur un ensemble varié de morphologies robotiques, puis à utiliser cette fonction, une fois gelée, comme proxy différentiable pour optimiser de nouveaux designs sans relancer de cycle d'apprentissage complet. Les expériences portent sur des modèles entraînés sur jusqu'à 50 robots distincts, couvrant des espaces de conception de plus de 1 100 paramètres continus d'embodiment: longueurs de membres, configurations articulaires, propriétés mécaniques. La méthode a été évaluée sur des variantes perturbées d'un même robot mais aussi sur des morphologies entièrement nouvelles appartenant à des classes non vues à l'entraînement, testant ainsi sa capacité de généralisation. Le problème que ce travail adresse est central en co-conception robotique: optimiser conjointement la morphologie d'un robot et son contrôleur nécessite traditionnellement de relancer un cycle complet de reinforcement learning pour chaque design candidat, une opération computationnellement prohibitive qui freine l'exploration de l'espace de conception. En gelant la fonction de valeur après un premier entraînement généralisé, les auteurs la transforment en oracle différentiable, permettant d'optimiser directement les paramètres physiques via descente de gradient, sans resimulation coûteuse. Au-delà de l'optimisation, l'analyse des gradients permet d'identifier quels paramètres de design ou de contrôle limitent les performances, une capacité analytique précieuse pour les ingénieurs souhaitant localiser des goulots d'étranglement avant d'engager des cycles de prototypage physique coûteux. La co-conception robotique est un domaine actif depuis plusieurs années, avec des approches concurrentes allant des algorithmes évolutionnaires aux méthodes de simulation physique différentiable explorées notamment par MIT CSAIL, ETH Zurich ou Google DeepMind. La particularité de cette contribution est de ne pas exiger de simulateur différentiable lors de l'optimisation: seule la fonction de valeur préentraînée suffit, la rendant potentiellement compatible avec des pipelines de simulation standard non différentiables. Les suites naturelles concernent l'extension à des espaces de conception encore plus larges, des tâches multi-objectifs et des morphologies plus complexes comme les manipulateurs industriels ou les humanoïdes. Il s'agit à ce stade d'une contribution purement académique, sans partenariat industriel ni déploiement annoncé.

RecherchePaper
1 source
Robots à tenségrité continuum : des morphologies adaptables aux tâches pour des comportements coopératifs
2arXiv cs.RO 

Robots à tenségrité continuum : des morphologies adaptables aux tâches pour des comportements coopératifs

Une prépublication arXiv (2608.27221v1, fin août 2026) présente un nouveau robot modulaire reconfigurable combinant un corps compliant à base de tenségrité et des mécanismes de connexion par griffes. Chaque unité manipule des objets et se déplace de façon autonome ; plusieurs unités peuvent s'assembler et se reconfigurer en chaînes, boucles ou structures ramifiées pour coopérer sur des tâches de manipulation et de locomotion. Les auteurs démontrent ces capacités en conditions réelles : transport et manipulation coordonnés d'objets, locomotion multimodale, et loco-manipulation combinant déplacement et prise. L'abstract ne fournit aucun chiffre sur les degrés de liberté, la charge utile ou le nombre d'unités testées simultanément. L'intérêt tient à la combinaison de deux familles de robots jusque-là disjointes : les robots modulaires reconfigurables, capables de s'assembler mais généralement rigides et peu tolérants aux chocs, et les robots à structure continue, souples grâce à leur colonne flexible mais incapables de se reconfigurer en configurations multi-robots. En unifiant compliance structurelle et reconfiguration collective, l'approche ouvre une piste pour des collectifs robotiques polyvalents changeant de forme selon la tâche, un sujet suivi par les intégrateurs en logistique non structurée, exploration spatiale ou intervention en zone sinistrée. Il s'agit d'une démonstration de recherche en laboratoire, pas d'un produit commercialisé : fabrication, espace et sauvetage restent des applications potentielles, non des déploiements validés. Le travail s'inscrit dans la lignée des robots à tenségrité, structures rigides maintenues en tension par câbles ou ressorts, légères et résistantes aux impacts mais historiquement difficiles à contrôler finement pour la manipulation. Il se positionne face aux robots modulaires rigides existants, dont la reconfiguration est bien maîtrisée mais la compliance limitée, et face aux robots continus classiques, compliants mais figés dans une seule configuration. En combinant les deux via des connexions par griffes, les auteurs posent, selon leurs termes, les bases de collectifs robotiques adaptables. La prépublication ne mentionne ni partenaire industriel, ni calendrier de transfert, ni essai pilote programmé.

RecherchePaper
1 source
Video2World : un banc d'essai d'agents de code pour la modélisation interactive du monde à partir de vidéos incarnées
3arXiv cs.RO 

Video2World : un banc d'essai d'agents de code pour la modélisation interactive du monde à partir de vidéos incarnées

Une équipe de chercheurs publie Video2World, un benchmark qui teste si des agents de code adossés à des modèles de fondation peuvent transformer une vidéo embodied en simulateur interactif, sans intervention humaine. La tâche, baptisée « vidéo-to-simulation autonome », est posée comme un problème d'ingénierie logicielle. L'agent observe une vidéo de démonstration (robot ou humain), construit l'environnement simulé et le comportement du robot correspondants, puis affine le résultat grâce au retour d'exécution. Le benchmark compte 222 instances de reconstruction issues de 189 vidéos. Il note les mondes reconstruits selon trois axes : la fidélité géométrique (perception spatiale), la fidélité dynamique (raisonnement physique) et la justesse fonctionnelle (capacité à exécuter une interaction). Neuf systèmes d'agents de code de pointe ont été évalués. Le taux de réussite de la tâche passe de moins de 5 % à plus de 15 % à partir de Claude Opus 5. L'écart avec une reconstruction assistée par des humains reste important. L'enjeu est direct pour quiconque produit des données d'entraînement pour la robotique. Aujourd'hui, construire un environnement de simulation à partir d'observations réelles demande beaucoup de travail manuel, de modélisation de scène et de calibration. C'est un goulot d'étranglement pour passer à l'échelle des données embodied, par exemple pour entraîner des politiques VLA (vision-langage-action) ou générer des jeux de test reproductibles. Le saut observé suggère que les capacités de génie logiciel agentique commencent à toucher ce problème, mais un taux de succès d'environ 15 % reste très loin d'un pipeline industriel fiable. Le résultat le plus instructif est ailleurs : les mondes qui paraissent meilleurs ne fonctionnent pas forcément mieux, et une fidélité visuelle accrue ne garantit pas un meilleur taux de réussite. Cela rappelle l'écart, déjà connu avec les modèles génératifs, entre réalisme perceptif et exactitude factuelle. Pour les équipes qui évaluent des « world models » ou des simulateurs générés, juger sur le rendu est donc un mauvais indicateur, et il faut mesurer la dynamique et l'exécution. Ce travail s'inscrit dans la course à l'automatisation de la création de simulateurs, où se croisent les modèles de monde génératifs vidéo, les pipelines de reconstruction 3D et les approches « real-to-sim » encore très manuelles. Le choix de cadrer le problème comme une tâche d'agent de code, avec boucle d'exécution et correction, déplace la question de la génération de pixels vers la production de code de simulation exécutable. Il s'agit d'une publication académique sur arXiv (v2) et non d'un produit livré : aucun déploiement industriel ni acteur européen n'est mentionné dans le résumé. Les suites probables sont l'évaluation de nouveaux agents sur le benchmark, la mesure de l'écart restant avec les humains et, à terme, l'usage de ces mondes reconstruits pour générer des données d'entraînement. La preuve que ces mondes améliorent réellement des politiques robotiques reste à apporter.

RecherchePaper
1 source
Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques
4arXiv cs.RO 

Génération d'arbres de comportement multimodaux : un petit modèle vision-langage pour la planification de tâches robotiques

Une nouvelle version (v2) d'un article de recherche publié sur arXiv (2603.06084) détaille un pipeline pour entraîner des modèles vision-langage (VLM) compacts à générer des arbres de comportement (Behavior Trees, BT) exécutables et compatibles ROS2 pour la planification de tâches robotiques. Les auteurs ont converti 1 622 épisodes du corpus Open X-Embodiment via un pipeline enseignant multi-étapes, produisant un jeu de données augmenté de 2 433 exemples multimodaux associant images, instructions et BT. Ce jeu de données a servi à affiner, par fine-tuning efficace en paramètres (PEFT), des VLM open source allant de 500 millions à 4 milliards de paramètres. Les BT générés ont été évalués hors ligne sur leur validité syntaxique, puis exécutés sur 15 tâches domestiques dans l'environnement de simulation BEHAVIOR-1K. Le meilleur modèle, Gemma-3 4B, atteint une validité syntaxique parfaite et un taux de réussite de 87%, devançant Claude Opus 4.8 et approchant GPT-5, tout en tournant entièrement en local. Ce résultat nourrit le débat récurrent sur l'écart entre démonstration et réalité dans la planification robotique pilotée par IA: un modèle compact, exécutable sans API propriétaire ni connexion cloud, égale voire dépasse des modèles fermés bien plus massifs sur une tâche concrète. Pour les intégrateurs et décideurs industriels, c'est un signal en faveur d'une planification embarquée, sans latence réseau ni coûts d'inférence récurrents, un critère souvent déterminant pour un déploiement à grande échelle. Les ablations confirment aussi une hypothèse centrale du secteur: l'ancrage visuel est décisif, le taux de réussite passant de 40% en texte seul à 87% avec observations visuelles. L'augmentation de données, elle, fait grimper la validité syntaxique des BT de 65% à 100%, rappelant que la qualité des données d'entraînement prime souvent sur la taille du modèle. Ces travaux prolongent une lignée de recherches utilisant les Behavior Trees, formalisme hiérarchique déjà répandu en robotique industrielle via ROS2, comme cible de génération pour les grands modèles de langage. Jusqu'ici, ces approches restaient soit purement textuelles, soit dépendantes de VLM propriétaires massifs, faute de jeu de données public reliant observations visuelles et BT exécutables, un manque que ce travail cherche explicitement à combler. La comparaison directe avec Claude Opus 4.8 et GPT-5 positionne cette contribution académique comme une tentative de démocratiser la planification VLM face aux modèles propriétaires. Aucun partenariat industriel ni déploiement sur robot physique n'est mentionné: l'évaluation reste cantonnée à la simulation BEHAVIOR-1K, ce qui invite à la prudence avant toute extrapolation vers un usage en environnement réel.

RechercheOpinion
1 source