Aller au contenu principal
RecherchearXiv cs.RO 

Neuf essais pour récupérer : un benchmark reproductible de l'adaptation aux dommages des robots souples sans répertoire de comportements

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un nouveau benchmark publié sur arXiv (2610.07616) propose un protocole reproductible pour mesurer la récupération de robots souples endommagés, sans répertoire de comportements précalculés, avec seulement neuf essais en ligne. Le protocole apparie des masques de dommages au sein de chaque morphologie, conserve un contrôleur nominal mesuré comme solution de repli et sépare le développement des méthodes de leur évaluation sur des corps inédits. Le contrôleur de référence repose sur un processus gaussien avec amélioration espérée (GP-EI) qui ajuste les phases des actionneurs en trois sondes d'initialisation puis six essais choisis d'après le retour du système. Sur deux cohortes disjointes de 75 corps, il dépasse la recherche aléatoire, Sobol, CEM et CMA-ES à budget égal. Il améliore le gain du pire masque sur 69 des 75 corps de confirmation, avec un avantage de 0,235 à 0,310 de récompense moyenne sur le pire masque. Lors d'un test de résistance sur la cohorte de développement, où 10 % des voxels occupés sont retirés physiquement, GP-EI progresse sur 71 corps sur 75 et devance l'implémentation officielle de TuRBO (BoTorch) de 0,356.

L'intérêt tient moins à l'algorithme qu'à la méthode d'évaluation. Les travaux d'adaptation aux dommages se comparent souvent sur des corps de développement, avec des budgets inégaux et sans repli mesuré, ce qui gonfle les gains. Ici, l'inférence est menée corps par corps et la cohorte de confirmation reste gelée. Le coût de sécurité est aussi chiffré : le rejeu à contrôleur fixe donne 5,06 largeurs de voxel de récupération moyenne, pour une hausse de seulement 0,0031 du p99 de déformation d'arête dans le pire masque. Une porte de déploiement stricte, interdisant toute sollicitation supplémentaire, ne conserve toutefois que 48,7 % du gain moyen. Pour un intégrateur, cela signifie qu'une partie de la récupération s'obtient en sollicitant davantage la structure. Une réserve s'impose : le comparateur le plus proche, un GP local de type TuRBO, n'est pas distingué statistiquement, puisque l'intervalle de confiance apparié inclut zéro. Tout cela relève de la simulation de voxels, sans validation sur matériel physique.

Le travail s'inscrit dans la lignée de l'algorithme Intelligent Trial and Error (Cully et al., 2015), qui adaptait un robot endommagé en quelques essais grâce à un répertoire de comportements précalculé en simulation. Le benchmark cherche à mesurer ce que de tels a priori appris de dommages apportent réellement par rapport à une optimisation bayésienne sans répertoire, et fournit le point de comparaison manquant. Les contrôleurs rejouables, l'inférence au niveau des corps et les cohortes gelées sont publiés pour permettre aux futures méthodes d'être comparées dans les mêmes conditions. La suite logique serait de confronter les approches à répertoire, les politiques apprises et ce socle GP-EI, puis de passer du voxel simulé à des robots souples réels.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Un système rapide, résilient et adaptable pour les comportements de loco-manipulation des robots humanoïdes

Une équipe de recherche a publié le 2 septembre 2026 sur arXiv (2609.01518) un système d'architecture comportementale pour la loco-manipulation sur robots humanoïdes, conçu pour tourner localement et être modifié en temps réel pendant l'exécution. L'architecture combine des Affordance Templates centrées objets, une structure en arbre organisant la logique des tâches, et une scène de perception éditable au runtime, exécutée par un contrôleur corps entier combinant marche et mouvements du buste, avec une interface opérateur synchronisée en continu pour superviser et corriger à la volée. Testé sur un Unitree H1-2 et un second robot nommé Alex sur six variantes de tâches, le système franchit une porte à pousser en 34 secondes et trie six balles par couleur en 45 secondes sous perturbation humaine directe. Des sessions d'autorat chronométrées montrent la création ou l'adaptation d'un comportement de loco-manipulation en quelques heures. Ce résultat nuance un discours dominant dans la robotique humanoïde, où la performance repose de plus en plus sur des modèles vision-langage-action entraînés de bout en bout, à la manière de Pi-0, GR00T N2 ou Helix. Les auteurs affirment que leur approche, explicitement programmée plutôt qu'apprise, reste compétitive face à ces systèmes récents, tout en offrant un avantage opérationnel : créer ou corriger un comportement en heures plutôt qu'en semaines de collecte de données. Pour les intégrateurs et décideurs industriels, cela ouvre une voie alternative moins dépendante de gigantesques jeux de démonstrations, potentiellement plus rapide à auditer sur site, même si les chiffres de cycle avancés restent issus de démonstrations contrôlées. Le travail s'inscrit dans la course à l'autonomie des humanoïdes pour des tâches physiquement pénibles, dangereuses ou répétitives, un terrain disputé par Figure AI avec Figure 03, Tesla avec Optimus Gen 3 ou NVIDIA avec GR00T, majoritairement pariés sur l'apprentissage à grande échelle. En misant sur une architecture éditable localement et supervisée par un opérateur, les auteurs positionnent leur système comme complémentaire, voire alternatif, à ces approches pilotées par les données. Aucun acteur français ou européen n'est cité, et cette publication reste à ce stade une contribution de recherche sur arXiv plutôt qu'un produit commercialisé, sans calendrier annoncé de pilotes au-delà des six tâches démontrées.

RecherchePaper
1 source
Adaptation continue sans récompense pour des robots spatiaux résilients
2arXiv cs.RO 

Adaptation continue sans récompense pour des robots spatiaux résilients

Un preprint diffusé sur arXiv fin août 2026 (arXiv:2608.23452v1) présente un cadre d'apprentissage par renforcement continu sans signal de récompense, destiné aux robots spatiaux victimes d'une dégradation matérielle sévère, un contexte où le calcul précis de récompense est impossible faute de systèmes de suivi externes comme le GPS. La méthode pré-entraîne sur des simulations variées un agent doté d'un modèle du monde à état latent qui apprend un prédicteur robuste de récompense, puis, une fois déployé sur un système endommagé, ne réajuste que la dynamique de transition de ce modèle via des trajectoires non supervisées, la politique étant réentraînée uniquement sur des trajectoires imaginées. L'approche est testée en simulation sur trois tâches, traversée planétaire, navigation orbitale et assemblage de précision, sous pannes morphologiques sévères. L'apport principal tient au découplage entre adaptation et supervision externe: la plupart des méthodes d'apprentissage continu embarqué restent bloquées dès qu'il n'existe pas de vérité terrain en environnement extrême, que ce soit dans l'espace profond, en fond marin ou sur un site nucléaire. Si la méthode se confirme hors simulation, elle ouvrirait la voie à des robots capables de retrouver une capacité opérationnelle après un choc matériel sans intervention au sol, un enjeu direct pour les rovers planétaires, les satellites de service en orbite ou les bras d'assemblage orbitaux. Les résultats publiés restent toutefois purement simulés, sans validation sur matériel réel ni en environnement spatial, ce qui limite la démonstration à une preuve de concept algorithmique. Ce travail s'inscrit dans la lignée des modèles du monde à état latent, popularisés par la famille Dreamer, devenus un outil courant de l'apprentissage par renforcement basé modèle en robotique pour entraîner des politiques sur des trajectoires imaginées plutôt que sur des interactions réelles coûteuses. La robotique spatiale attire un nombre croissant d'acteurs publics et privés, de la NASA-JPL à l'ESA en passant par des sociétés de service en orbite comme Astroscale ou Intuitive Machines, tous confrontés au même verrou: maintenir et adapter des systèmes hors de portée d'une intervention humaine directe. Le résumé du preprint ne précise ni laboratoire ni affiliation industrielle; la suite logique resterait une validation sur banc d'essai robotique, puis une démonstration en environnement analogue spatial avant tout transfert vers une mission opérationnelle.

UEL'ESA est confrontee au même verrou technique que les acteurs cites mais n'est pas associée a ces travaux de recherche non affilies.

RecherchePaper
1 source
UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI
3arXiv cs.RO 

UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI

Une équipe de recherche a déposé le 10 juin 2026 le preprint arXiv 2606.10382 décrivant UMI-Bench 1.0, présenté comme le premier benchmark entièrement dédié à l'évaluation en conditions réelles de politiques de manipulation robotique entraînées via l'Universal Manipulation Interface (UMI). Le benchmark cible la manipulation d'objets sur table (tabletop manipulation) et couvre l'intégralité de la chaîne de validation : collecte de données, réinitialisation de scène entre essais, exécution de politique, journalisation des résultats et analyse par facteurs de tâche. Il opère en mode "local-first", c'est-à-dire que les évaluations tournent directement sur robot réel, sans couche de simulation intermédiaire. L'UMI couple observations depuis une caméra montée au poignet, représentation des actions, collecte de démonstrations humaines et déploiement physique, une architecture dont les performances dépendent de la cohérence de chaque maillon. Ce benchmark répond à un problème structurel de l'apprentissage par imitation : l'absence de protocole standardisé conduit chaque équipe à évaluer ses politiques dans des conditions non comparables, ce qui rend la littérature difficile à arbitrer pour un intégrateur ou un décideur industriel. En rendant le processus reproductible et auditable, UMI-Bench permet de mesurer concrètement dans quelle mesure une politique entraînée sur des démonstrations généralise à des configurations physiques inédites, ce que les chercheurs appellent la sim-to-real (ici demo-to-real) generalization. C'est un enjeu central pour les politiques de diffusion (Diffusion Policy) et les VLA (Vision-Language-Action models), dont les performances en démonstration sélectionnée restent difficiles à quantifier sans infrastructure de test commune. L'UMI a été introduit en 2023-2024 par Cheng Chi et al. (Columbia University) comme interface portable de collecte de démonstrations : un opérateur guide un gripper équipé d'une caméra et d'un module de localisation, et les trajectoires servent directement à entraîner des politiques. Le paysage concurrent des benchmarks comprend LIBERO, DROID et le framework LeRobot de Hugging Face, qui proposent leurs propres protocoles mais sans calibration spécifique pour le pipeline UMI. L'étape logique suivante serait l'intégration de modèles fondationnels comme pi-0 (Physical Intelligence) ou OpenVLA dans ce protocole de référence, et l'extension à des tâches multi-étapes.

RecherchePaper
1 source
Évaluation des robots pour les environnements du quotidien : des essais en laboratoire aux opérations réelles
4arXiv cs.RO 

Évaluation des robots pour les environnements du quotidien : des essais en laboratoire aux opérations réelles

Un article de recherche interdisciplinaire (arXiv:2609.26490) présente un cadre de benchmarking pour robots déployés en environnements publics, conçu pour combler l'écart entre les métriques de laboratoire classiques et les exigences d'une évaluation en conditions réelles. Trois robots distincts ont été testés sur trois cas d'usage représentatifs du quotidien : le nettoyage de parcs en extérieur, le nettoyage de passages souterrains piétons et l'assistance interactive en bibliothèque. Le processus s'est étalé sur trois ans, de 2023 à 2025, et a compris sept événements de benchmarking, un atelier de consensus et six évaluations sur site, à raison de deux par cas d'usage, menées dans des environnements de test réalistes en intérieur comme en extérieur. Un panel d'experts couvrant la robotique, l'interaction homme-robot, la sécurité et l'économie a conçu et affiné méthodiquement un protocole d'évaluation destiné à analyser la transition des prototypes de laboratoire vers des systèmes opérationnels. Ce travail importe surtout pour la méthodologie qu'il propose plutôt que pour des résultats chiffrés spécifiques : il identifie une grille de facteurs jugés critiques pour un déploiement réussi, à savoir l'accomplissement effectif de la tâche, la qualité de l'interaction avec les usagers, la sécurité et la viabilité économique. Pour les intégrateurs et décideurs B2B, ce cadre offre un outil pour évaluer des robots de service au-delà des démonstrations contrôlées, souvent peu représentatives, et pour objectiver l'écart persistant entre promesses commerciales et performance réelle en environnement non structuré, fréquenté par le public. En l'absence de standard partagé pour comparer des robots hétérogènes hors laboratoire, une telle grille pourrait servir de référence commune aux acheteurs publics et privés évaluant des solutions de nettoyage autonome ou d'assistance robotique. L'article ne nomme ni les robots testés ni les entreprises qui les fabriquent, l'accent étant mis sur la méthode d'évaluation plutôt que sur la promotion de produits commerciaux, ce qui distingue nettement cette démarche des annonces marketing habituelles du secteur des robots humanoïdes ou de service. Elle s'inscrit dans un effort plus large de la communauté robotique pour standardiser l'évaluation des systèmes déployés en environnement public, un enjeu devenu plus pressant à mesure que des robots de nettoyage, de logistique ou d'accueil sortent des laboratoires pour être testés dans des parcs, des espaces urbains ou des bibliothèques. Les auteurs présentent leurs travaux comme une base actionnable pour chercheurs et praticiens, sans annoncer de calendrier de déploiement commercial ni de partenariat industriel précis, ce qui situe clairement cette publication du côté de la recherche méthodologique plutôt que du produit prêt à être commercialisé.

RecherchePaper
1 source