Aller au contenu principal
RecherchearXiv cs.RO 

Présentation d'Arena 5.0 : un cadre de simulation ROS2 photoréaliste pour développer et évaluer la navigation sociale

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Arena 5.0, la cinquième version du framework open source dédié au développement et à l'évaluation de la navigation sociale des robots, vient d'être présentée sur arXiv (2610.11220). Son apport principal est l'intégration complète de NVIDIA Isaac Gym, qui permet des simulations photoréalistes et un entraînement plus efficace. Les modules existants de la plateforme fonctionnent dans cet environnement: génération aléatoire d'environnements, outils d'évaluation, support de ROS2, intégration de planificateurs, de modèles de robots et d'API. Les auteurs ajoutent un benchmark des stratégies de navigation sociale de l'état de l'art, testées sur des mondes générés ou personnalisés et sur des scénarios de difficulté variable, avec une large gamme de métriques sociales. Ils ajoutent aussi des modules de génération de scénarios et de planification de tâches, capables de produire des situations personnalisées comme des urgences ou des opérations de secours. Le code est disponible sur le GitHub Arena-Rosnav. L'article ne donne pas de chiffres précis dans son résumé, ni sur les gains d'entraînement ni sur le nombre de planificateurs comparés.

L'intérêt est d'abord méthodologique. La navigation sociale, c'est-à-dire la capacité d'un robot à évoluer parmi des humains sans les gêner ni les mettre en danger, souffre d'un manque de protocoles communs. Chaque équipe teste ses planificateurs dans ses propres simulateurs, avec ses propres métriques, ce qui rend les comparaisons peu fiables. Un banc d'essai ROS2 standardisé et photoréaliste réduit l'écart entre simulation et réalité (sim-to-real), un point critique pour les AMR et les robots de service qui partagent leurs espaces avec des personnes. Pour les intégrateurs, il offre un moyen de tester des planificateurs avant un déploiement en entrepôt, hôpital ou lieu public. Une réserve s'impose: l'amélioration de l'utilisabilité repose sur une étude utilisateur dont le résumé ne donne ni la taille d'échantillon ni les résultats chiffrés. Le photoréalisme d'un simulateur ne garantit pas non plus un transfert fiable vers le terrain.

Arena 5.0 prolonge un projet académique construit sur ROS et maintenu par la communauté Arena-Rosnav, qui a produit quatre versions précédentes. Le choix d'Isaac Gym s'inscrit dans la tendance des équipes de recherche à s'appuyer sur l'écosystème NVIDIA (Isaac Sim, Isaac Lab) pour l'apprentissage par renforcement massivement parallèle. Le framework rejoint des outils comme Habitat ou iGibson, orientés navigation et interaction, ainsi que des bancs d'essai de navigation sociale plus ciblés. Son atout est l'intégration native de ROS2, standard de fait chez les industriels. La suite dépendra de son adoption: l'ajout de planificateurs par des équipes externes et son utilisation comme référence dans les publications diront s'il devient un benchmark commun ou reste un outil de laboratoire.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale
1arXiv cs.RO 

SONG : une plateforme de simulation 3D en Gaussian Splatting photoréaliste pour évaluer la navigation sociale

Sortie automatisée de mouvements corporels complets à partir de ces trajectoires. Un chercheur propose SONG, une plateforme de simulation pour la navigation sociale robotique, construite sur le 3D Gaussian Splatting (3DGS), une technique de rendu photoréaliste qui reconstruit à la fois les scènes et les avatars humains évoluant dedans. Les piétons virtuels ne suivent pas des scripts fixes: leurs trajectoires sont générées par un grand modèle de langage de façon sémantiquement cohérente, puis converties en mouvements corporels continus via un générateur conditionné par trajectoire. Autour de cette plateforme, les auteurs construisent SONG-Bench, un ensemble de scénarios d'évaluation classés par niveau de difficulté, associé à une suite de métriques multidimensionnelles couvrant l'efficacité du déplacement, la sécurité et le respect des conventions sociales. Le travail est décrit dans un article déposé sur arXiv (2607.25219v1) comme une nouvelle soumission. L'enjeu dépasse le simple outil de test. Jusqu'ici, les simulateurs de navigation sociale souffraient d'un compromis frustrant: soit ils offraient des observations visuelles pauvres, soit ils manquaient d'avatars humains mobiles, soit leur rendu et le comportement des piétons restaient trop éloignés du réel pour valider des algorithmes de navigation guidés uniquement par la vision embarquée. En évaluant des méthodes de référence sur SONG-Bench, les auteurs tirent trois constats qui pèsent sur tout le secteur de la robotique mobile: la navigation sociale basée vision est loin d'être résolue, les modèles actuels présentent un déficit de sécurité plus criant encore que leurs manquements en étiquette sociale, et l'entraînement sur des données réelles compte davantage que la simple augmentation de la taille des modèles. Point notable, les auteurs montrent qu'un ajustement fin sur les données qu'ils ont constituées améliore concrètement le taux de réussite en conditions réelles, ce qui distingue cette contribution d'une simple démonstration en simulation. Ce travail s'inscrit dans une trajectoire de recherche qui est passée d'environnements 2D simplifiés à des cadres visuels plus exigeants, où le robot ne dispose que de sa caméra embarquée pour se comporter correctement en présence d'humains. Les auteurs présentent SONG comme un banc d'essai destiné à structurer la prochaine génération de recherches sur la navigation sociale visuelle, sans toutefois annoncer de partenariat industriel ou de déploiement au-delà du cadre académique à ce stade.

RecherchePaper
1 source
PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots
2arXiv cs.RO 

PRISM : représentation prédictive du style d'interaction et du mouvement pour la navigation sociale des robots

La recherche présentée dans l'article arXiv:2609.18125v1 (déposé fin septembre 2026) porte sur un système baptisé PRISM, pour Predictive Representation of Interaction Style and Motion, conçu pour améliorer la navigation des robots dans les foules humaines. Concrètement, PRISM utilise un encodeur transformer entraîné avec une fonction de perte dite Rank-N-Contrast pour transformer les trajectoires observées de piétons en un espace latent continu et ordonné, qui capture le style d'interaction de chaque personne plutôt que sa seule position géométrique. Le système associe à chaque trait inféré un score de stabilité temporelle, transmis ensuite à la politique de navigation du robot. Les auteurs rapportent des résultats obtenus dans des simulations de foules randomisées : une réduction du taux de collisions par rapport à une référence qui ne modélise que l'état géométrique des piétons, ainsi que des gains marginaux sur le temps de trajet et la longueur du chemin parcouru. L'enjeu dépasse la seule performance chiffrée. La plupart des politiques de navigation sociale actuelles traitent les piétons comme de simples obstacles mobiles décrits par leur position et leur vitesse, ignorant que deux personnes se comportent différemment face à un robot selon leur style d'interaction propre. En inférant ce style de façon passive, sans capteurs additionnels ni interaction explicite, PRISM ouvre une piste pour des robots de livraison, des AMR ou des plateformes d'assistance appelés à circuler dans des environnements humains denses, où la sécurité perçue dépend autant du comportement social du robot que de sa seule évitement de collision. Le travail s'inscrit dans la lignée des recherches en navigation sociale robotique qui cherchent à dépasser les modèles purement géométriques hérités de la planification de trajectoire classique. Il reste toutefois à un stade de validation en simulation uniquement : aucun essai sur robot physique ni déploiement réel n'est mentionné, et les gains rapportés sur le temps de trajet et la distance parcourue sont qualifiés eux-mêmes de modestes par les auteurs. La suite logique, non annoncée à ce stade, serait un transfert vers des plateformes réelles pour vérifier si l'amélioration observée en simulation résiste au bruit des capteurs et à la variabilité humaine réelle.

RecherchePaper
1 source
CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique
3arXiv cs.RO 

CaP-X : un cadre pour évaluer et améliorer les agents de codage pour la manipulation robotique

Des chercheurs publient CaP-X, un framework open-access destiné à évaluer et améliorer les agents de type "Code-as-Policy" pour la manipulation robotique, selon un article déposé sur arXiv (2603.22435v2). Le système s'appuie sur CaP-Gym, un environnement interactif où des agents pilotent des robots en générant et exécutant du code combinant des primitives de perception et de contrôle. Sur cette base, les auteurs construisent CaP-Bench, un banc d'essai qui compare 12 modèles de langage et modèles vision-langage frontier selon différents niveaux d'abstraction, d'interaction et d'ancrage perceptif. Le travail aboutit à deux propositions concrètes : CaP-Agent0, un framework ne nécessitant aucun entraînement supplémentaire, et CaP-RL, une méthode d'apprentissage par renforcement avec récompenses vérifiables, testée en simulation puis transférée sur robots réels. L'enjeu dépasse le simple exercice académique : l'approche "code comme politique de contrôle" est présentée comme un complément aux méthodes Vision-Language-Action (VLA), très gourmandes en données, qui dominent aujourd'hui la robotique humanoïde et industrielle. CaP-Bench met en évidence une faiblesse structurelle des agents actuels, leur performance chute nettement dès que les abstractions conçues par des humains sont retirées, ce qui révèle une dépendance excessive au travail d'ingénierie préalable plutôt qu'à une véritable autonomie de raisonnement. Pour les intégrateurs et décideurs industriels, ce résultat tempère l'idée que les grands modèles suffiraient seuls à piloter des bras ou des humanoïdes sans échafaudage logiciel dédié. À l'inverse, les auteurs montrent que multiplier les tours d'interaction, le retour d'exécution structuré, la différenciation visuelle et la synthèse automatique de compétences comble une grande partie de cet écart, même sur des primitives de bas niveau. Ce travail s'inscrit dans le prolongement des recherches sur le "Code-as-Policy", initiées pour donner aux modèles de langage une interface exécutable vers le contrôle robotique, en alternative aux pipelines VLA de bout en bout. En documentant précisément où les agents actuels échouent et en ouvrant l'accès à son environnement de test, CaP-X vise à devenir une plateforme de référence pour comparer objectivement les approches futures, avant un possible passage à l'échelle sur des tâches de manipulation réelles plus complexes.

RecherchePaper
1 source
Vers une simulation visuellement réaliste : un benchmark pour évaluer la manipulation robotique en simulation
4arXiv cs.RO 

Vers une simulation visuellement réaliste : un benchmark pour évaluer la manipulation robotique en simulation

Une équipe de recherche a publié le 9 mai 2026 un nouveau benchmark de simulation dédié à l'évaluation des politiques de manipulation robotique, sous le nom VISER (Visually Realistic Simulation for Robot Manipulation Evaluation). Le système repose sur une bibliothèque de plus de 1 000 assets 3D équipés de matériaux PBR (Physically-Based Rendering), intégrés dans des scènes générées automatiquement. Pour constituer cette base à grande échelle, les auteurs ont développé un pipeline automatisé combinant des modèles de langage multimodaux (MLLMs) pour la segmentation des pièces et la récupération des matériaux. Les tâches d'évaluation couvrent la saisie, le placement et des séquences longue durée (long-horizon tasks), permettant de tester des modèles Vision-Language-Action (VLA) dans des conditions reproductibles. Résultat clé : un coefficient de corrélation de Pearson moyen de 0,92 entre les performances en simulation et les performances réelles, mesuré sur plusieurs politiques distinctes. Ce score de 0,92 est le chiffre le plus structurant de la publication. La grande majorité des benchmarks existants génèrent un écart domaine (domain gap) significatif parce qu'ils négligent deux variables décisives : l'éclairage et les propriétés de matériaux. VISER montre expérimentalement que ces deux facteurs pèsent directement sur le raisonnement géométrique et l'ancrage spatial des modèles VLA, deux capacités centrales pour toute manipulation physique fiable. Pour les équipes qui développent des politiques robotiques, un proxy simulation fiable à 0,92 réduit massivement le coût et le temps des cycles d'itération réel, notamment pour des architectures VLA dont le fine-tuning reste coûteux en déploiement physique. Le problème du sim-to-real gap structure la robotique de manipulation depuis plus d'une décennie. Les benchmarks de référence comme RLBench ou MetaWorld sont largement utilisés mais construits sur des rendus bas fidélité qui limitent leur valeur prédictive pour les approches VLA modernes, dont pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. VISER positionne explicitement ses actifs PBR comme une réponse à cette insuffisance, en automatisant la génération via MLLMs pour éviter le goulot d'artisanat manuel qui freinait les benchmarks précédents. La prochaine étape naturelle sera de mesurer si cette corrélation de 0,92 tient sur des robots à morphologies variées et des scénarios de manipulation industrielle hors laboratoire.

RechercheOpinion
1 source