Aller au contenu principal
RecherchearXiv cs.RO 

AssemblyGrid v1 : un benchmark pour la production multi-robots avec coalitions temporaires, information locale et contraintes géométriques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article déposé sur arXiv sous la référence 2609.16075v1 présente AssemblyGrid v1, un benchmark reproductible pour l'étude de la production robotique multi-agents en contrôle décentralisé. Il combine dans une seule tâche la progression explicite des processus de fabrication, le transfert de matériaux, la formation de coalitions temporaires entre robots, l'exécution concurrente d'opérations productives et des contraintes géométriques de faisabilité. Le benchmark se compose de trois familles de scénarios, Flow, Coalition et Concurrency, chacune déclinée en trois niveaux de difficulté croissante. Les auteurs le valident par des tests de conformité exécutables et des expériences comparant un contrôleur centralisé de référence, des contrôleurs décentralisés structurés, et trois algorithmes d'apprentissage multi-agents par renforcement, IPPO, MAPPO et QMIX.

Le résultat clé est que des politiques décentralisées, entraînées uniquement à partir d'observations et d'actions locales, parviennent à produire un comportement collectif de production efficace, sans vision globale du système. C'est une donnée importante pour l'industrie robotique, où la coordination des lignes flexibles repose encore largement sur des règles centralisées mal adaptées aux ateliers reconfigurables exigeant une coopération ponctuelle entre robots. En séparant strictement les critères de réussite de la méthode de résolution, AssemblyGrid v1 permet de comparer objectivement des approches par apprentissage et des approches classiques sur les mêmes scénarios, un exercice jusque-là entravé par l'absence d'outils standardisés. Il fournit ainsi un cadre pour vérifier si des méthodes multi-robots décentralisées, souvent démontrées sur des cas simplifiés, résistent à des contraintes réalistes de ressources partagées, d'état des matériaux et de compatibilité géométrique.

Ce travail s'inscrit dans le rapprochement entre planification de production robotique et prise de décision multi-agents coopérative sous observabilité partielle, un cadre emprunté à la recherche en apprentissage par renforcement plutôt qu'à la robotique industrielle classique. Les auteurs présentent AssemblyGrid v1 comme comblant un vide : aucun benchmark existant ne réunissait jusqu'ici progression de processus, observations décentralisées, transfert de matériaux, coalitions temporaires et contraintes géométriques dans une seule formulation de tâche. La désignation "v1" laisse attendre des extensions futures, en scénarios comme en niveaux de difficulté. Les expériences rapportées restent pour l'instant en simulation, sans partenariat industriel ni déploiement sur robots physiques annoncé, ce qui limite la portée des résultats à une validation algorithmique plutôt qu'à une preuve de robustesse en production réelle.

Dans nos dossiers

À lire aussi

HA-VLN 2.0 : un benchmark ouvert pour la navigation humain-robot en environnements discrets et continus avec interactions multi-personnes dynamiques
1arXiv cs.RO 

HA-VLN 2.0 : un benchmark ouvert pour la navigation humain-robot en environnements discrets et continus avec interactions multi-personnes dynamiques

Une équipe de chercheurs a publié HA-VLN 2.0, un benchmark unifié pour évaluer la navigation guidée par le langage et la vision (VLN) dans des environnements peuplés d'humains en mouvement. Le jeu de données associé, HAPS 2.0, couvre 16 844 instructions socialement contextualisées et modélise des interactions multi-humains en intérieur comme en extérieur, dans des espaces discrets et continus. Le système introduit des métriques explicites mesurant simultanément la précision de navigation vers l'objectif et le respect de l'espace personnel des personnes croisées. Des expériences en conditions réelles sur robot physique ont complété l'évaluation simulée, et un leaderboard ouvert permet des comparaisons reproductibles entre équipes. Les résultats sont sans appel pour les agents VLN actuels : dès que des humains dynamiques et une observabilité partielle entrent en jeu, leurs performances chutent significativement. Ce constat remet en question une hypothèse répandue dans la recherche VLN, à savoir que les agents entraînés en environnements statiques généraliseraient correctement au monde réel. Les expériences sim-to-real confirment en revanche que la modélisation explicite des contraintes sociales améliore la robustesse de navigation et réduit les collisions, ce qui valide l'approche. Pour les intégrateurs déployant des robots mobiles en milieu professionnel (entrepôts partagés, hôpitaux, espaces de bureau), cela signifie que les benchmarks sans humains surestiment substantiellement les capacités réelles des systèmes. La navigation guidée par langage est un champ actif depuis les travaux fondateurs sur R2R (Room-to-Room, 2018), mais la majorité des benchmarks existants, dont R2R, REVERIE ou SOON, supposent des environnements vides ou quasi-statiques. HA-VLN 2.0 s'inscrit dans une tendance récente incluant les travaux sur SocNavBench et HuNavSim, qui cherchent à intégrer la dynamique humaine dans l'évaluation de la navigation sociale. Le benchmark est entièrement open-source (datasets, simulateurs, baselines, protocoles). Les prochaines étapes probables incluent l'intégration de modèles VLA (Vision-Language-Action) plus récents comme pi-0 ou RT-2 dans le leaderboard, ainsi que des évaluations dans des scènes extérieures plus complexes.

RecherchePaper
1 source
SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques
2arXiv cs.RO 

SoftVTBench : un benchmark visuo-tactile axé sur la sécurité pour la manipulation robotique d'objets déformables sous contraintes physiques

Des chercheurs viennent de publier SoftVTBench, un benchmark construit sous Isaac Sim pour évaluer la manipulation robotique d'objets déformables non plus seulement sur la réussite de la tâche, mais sur la sécurité physique de l'interaction. Le système simule les objets déformables par éléments finis (FEM) et combine vues RGB multiples, capteurs tactiles RGB avec suivi de marqueurs, proprioception et instructions en langage naturel. Il définit quatre suites de tâches croisant type d'objet (déformable versus rigide) et axe de variation (objet versus position spatiale), et distingue deux métriques : le Goal Success, qui mesure l'atteinte de l'objectif, et le Safety Success, plus strict, qui exige en plus l'absence de chute et un niveau de déformation maximal sous un seuil calibré par objet, mesuré via les états FEM cachés à la politique. Les auteurs testent des politiques basées sur pi0.5, le modèle vision-langage-action (VLA) de Physical Intelligence, dans ce protocole. Les résultats sont un signal d'alarme pour l'évaluation actuelle des politiques de manipulation : une part importante des trajectoires qui atteignent l'objectif violent en réalité les contraintes physiques de sécurité, ce que les benchmarks classiques, uniquement orientés succès, ne détectent pas. L'ajout du retour tactile change la donne : le Safety Success passe de 21,4% à 35,6% sur les tâches déformables centrées objet, avec une réduction mesurable de la déformation pendant l'exécution, sans dégrader le Goal Success. Pour les intégrateurs et chercheurs en robotique manipulant des objets souples (textile, alimentaire, emballage), cela confirme qu'un capteur tactile n'est pas un simple bonus de précision mais un levier direct de sécurité opérationnelle, et que les métriques de succès seules surestiment la fiabilité réelle d'une politique. SoftVTBench s'inscrit dans une littérature où les benchmarks de manipulation restent très majoritairement centrés sur la réussite de tâche, laissant un angle mort sur le comportement physique pendant l'exécution. En s'appuyant sur pi0.5, déjà positionné comme référence VLA face à des modèles comme GR00T N2 ou Helix, les auteurs proposent un protocole reproductible que d'autres équipes pourront réutiliser pour comparer leurs propres politiques visuo-tactiles sous contrainte physique, plutôt que sur le seul critère du taux de réussite.

RecherchePaper
1 source
UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI
3arXiv cs.RO 

UMI-Bench 1.0 : un benchmark ouvert et reproductible pour la manipulation robotique de surface avec données UMI

Une équipe de recherche a déposé le 10 juin 2026 le preprint arXiv 2606.10382 décrivant UMI-Bench 1.0, présenté comme le premier benchmark entièrement dédié à l'évaluation en conditions réelles de politiques de manipulation robotique entraînées via l'Universal Manipulation Interface (UMI). Le benchmark cible la manipulation d'objets sur table (tabletop manipulation) et couvre l'intégralité de la chaîne de validation : collecte de données, réinitialisation de scène entre essais, exécution de politique, journalisation des résultats et analyse par facteurs de tâche. Il opère en mode "local-first", c'est-à-dire que les évaluations tournent directement sur robot réel, sans couche de simulation intermédiaire. L'UMI couple observations depuis une caméra montée au poignet, représentation des actions, collecte de démonstrations humaines et déploiement physique, une architecture dont les performances dépendent de la cohérence de chaque maillon. Ce benchmark répond à un problème structurel de l'apprentissage par imitation : l'absence de protocole standardisé conduit chaque équipe à évaluer ses politiques dans des conditions non comparables, ce qui rend la littérature difficile à arbitrer pour un intégrateur ou un décideur industriel. En rendant le processus reproductible et auditable, UMI-Bench permet de mesurer concrètement dans quelle mesure une politique entraînée sur des démonstrations généralise à des configurations physiques inédites, ce que les chercheurs appellent la sim-to-real (ici demo-to-real) generalization. C'est un enjeu central pour les politiques de diffusion (Diffusion Policy) et les VLA (Vision-Language-Action models), dont les performances en démonstration sélectionnée restent difficiles à quantifier sans infrastructure de test commune. L'UMI a été introduit en 2023-2024 par Cheng Chi et al. (Columbia University) comme interface portable de collecte de démonstrations : un opérateur guide un gripper équipé d'une caméra et d'un module de localisation, et les trajectoires servent directement à entraîner des politiques. Le paysage concurrent des benchmarks comprend LIBERO, DROID et le framework LeRobot de Hugging Face, qui proposent leurs propres protocoles mais sans calibration spécifique pour le pipeline UMI. L'étape logique suivante serait l'intégration de modèles fondationnels comme pi-0 (Physical Intelligence) ou OpenVLA dans ce protocole de référence, et l'extension à des tâches multi-étapes.

RecherchePaper
1 source
IMBench : un benchmark pour la manipulation robotique intuitive
4arXiv cs.RO 

IMBench : un benchmark pour la manipulation robotique intuitive

Une équipe de recherche publie IMBench, un nouveau benchmark conçu pour évaluer ce qu'elle appelle la « manipulation intuitive » des robots, c'est-à-dire la capacité à combiner raisonnement physique et exécution motrice de façon intégrée, plutôt que de tester ces deux compétences séparément. L'article, déposé sur arXiv le 15 juillet 2026, propose un jeu de 35 tâches couvrant la manipulation avec contact riche, l'usage d'outils et les dépendances multi-étapes, accompagné de 14 000 trajectoires filtrées et d'outils permettant de générer de nouveaux scénarios à l'échelle. Contrairement aux benchmarks existants, IMBench exige des modèles qu'ils identifient d'abord la structure physique pertinente d'une scène (poids, friction, contraintes géométriques) avant de produire une séquence d'actions exécutable sous contraintes explicites. Les auteurs ont testé à la fois des modèles vision-langage (VLM) et des modèles vision-langage-action (VLA) de dernière génération sur cet ensemble de tâches. Les résultats mettent en évidence un écart systématique dans les systèmes actuels : les VLM montrent une capacité de raisonnement physique partielle mais ne parviennent pas à traduire ce raisonnement en plans d'action exécutables, tandis que les VLA de pointe échouent à respecter les contraintes des tâches et généralisent mal d'un scénario à l'autre. Pour l'industrie robotique, ce constat confirme un doute déjà répandu chez les intégrateurs : la performance affichée par les politiques génératives sur des démonstrations contrôlées ne garantit pas une compréhension physique transférable à des scènes nouvelles. IMBench propose ainsi une mesure plus rigoureuse pour distinguer les systèmes qui « comprennent » réellement une scène de ceux qui reproduisent des schémas d'entraînement. Ce travail s'inscrit dans une vague récente de benchmarks cherchant à combler le fossé entre évaluation en simulation et déploiement réel, alors que des modèles comme GR00T N2, Pi-0 ou Helix visent une manipulation généraliste dans des environnements variés. En isolant explicitement la composante « raisonnement intuitif » comme axe manquant des politiques robotiques actuelles, les auteurs positionnent IMBench comme un outil de diagnostic pour orienter les prochaines générations de modèles fondation en robotique, plutôt que comme un simple classement de performance brute.

RecherchePaper
1 source