Aller au contenu principal
Démo : cadre de co-simulation en boucle fermée Sionna-Isaac Sim pour une navigation robotique sensible au réseau sans fil via ROS 2
RecherchearXiv cs.RO 

Démo : cadre de co-simulation en boucle fermée Sionna-Isaac Sim pour une navigation robotique sensible au réseau sans fil via ROS 2

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs de la Singapore University of Technology and Design (SUTD) présentent, dans une démonstration publiée sur arXiv, un cadre de co-simulation en temps réel qui couple NVIDIA Isaac Sim (moteur physique et de perception robotique) et NVIDIA Sionna (simulateur de liaisons radio) via ROS 2. Sionna calcule par lancer de rayons sur GPU le canal entre la station de base et le robot, sur la géométrie exacte que simule Isaac Sim, au lieu d'un modèle stochastique. Les états du canal reviennent dans la boucle de commande en temps réel : la carte de couverture est rafraîchie en environ 16 ms (environ 60 Hz). Pour la démonstration, l'équipe a construit un jumeau numérique du campus SUTD à partir d'OpenStreetMap, avec deux robots Nova Carter. Le planificateur en boucle fermée supprime les coupures de communication pour un surcoût de seulement 7,4 % sur le temps de parcours. Le trajet le plus court, pris comme référence, reste déconnecté 7,9 s sur un parcours de 81,2 s, soit environ 10 % du temps.

L'enjeu concerne les robots dont la boucle de contrôle est déportée sur le réseau, en 5G privée ou en edge computing. Comme le récepteur se déplace avec le robot, la qualité de la liaison dépend de sa trajectoire. Jusqu'ici, les simulateurs traitaient l'un ou l'autre aspect. Les auteurs affirment, à leur connaissance, qu'aucun outil n'unifie nativement moteur physique et propagation spécifique au site, et que les couplages existants se limitaient à des analyses hors ligne. Pour un intégrateur de flottes d'AMR en entrepôt ou en usine, l'intérêt est de tester avant déploiement les zones d'ombre radio, au lieu de les découvrir sur site. Les chiffres demandent toutefois de la prudence : ils proviennent d'un seul scénario simulé, sur un campus, sans mesure sur du matériel réel. Un jumeau fidèle en simulation ne garantit pas la même précision face aux réflexions, aux obstacles mobiles et à la variabilité d'un site industriel. Il s'agit d'une démo de recherche, pas d'un produit livré ni d'un déploiement.

Cette approche prolonge la convergence des outils NVIDIA, avec Isaac Sim pour la robotique, Omniverse pour les jumeaux numériques et Sionna pour la recherche en communications, dans la perspective de la 6G et du « network-aware robotics ». Elle s'inscrit dans le courant de la simulation avant le sim-to-real, déjà adoptée pour la perception et la manipulation, mais encore peu appliquée à la connectivité. Le sujet touche aussi les humanoïdes et les robots mobiles qui déportent une partie de l'inférence, par exemple pour les modèles VLA, vers des serveurs distants. Les prochaines étapes naturelles seraient une validation sur un banc réel, des scénarios multi-cellules et multi-robots, et une intégration avec des planificateurs plus complexes. Aucun calendrier n'est annoncé.

À lire aussi

GE-Sim 2.0 : une feuille de route vers des simulateurs vidéo en boucle fermée pour la manipulation robotique
1arXiv cs.RO 

GE-Sim 2.0 : une feuille de route vers des simulateurs vidéo en boucle fermée pour la manipulation robotique

Une équipe de recherche a publié sur arXiv (arXiv:2605.27491) GE-Sim 2.0, un simulateur vidéo en boucle fermée conçu pour l'entraînement et l'évaluation de politiques de manipulation robotique. Le système, Genie Envisioner World Simulator 2.0, prolonge l'architecture de génération vidéo conditionnée par l'action de son prédécesseur et a été ré-entraîné sur des milliers d'heures de données robotiques réelles couvrant la télé-opération, les interactions contact-rich et le déploiement de politiques embarquées. Trois nouveaux modules ferment la boucle simulation-apprentissage : un "state expert" qui décode l'état proprioceptif depuis les latents vidéo pour alimenter les politiques VLA (Vision-Language-Action) en prédiction de trajectoire ; un "world judge" qui évalue automatiquement les rollouts générés face aux instructions de tâche, produisant des signaux de réussite vérifiables sans inspection manuelle ; et un framework d'accélération capable de générer un rollout de 25 frames en 2,3 secondes sur un seul GPU H100, avec jusqu'à 4x de frame skipping à l'inférence pour les scénarios longue-portée. Avec seulement 2 milliards de paramètres, le modèle domine le classement public WorldArena, devançant à la fois des world models robotiques dédiés et des générateurs vidéo généralistes en source fermée. L'enjeu central est le sim-to-real gap, la difficulté chronique à transférer des politiques entraînées en simulation vers des robots réels. GE-Sim 2.0 tente d'y répondre sur deux fronts : en générant des données synthétiques crédibles sur lesquelles entraîner des politiques VLA, avec des gains mesurables en conditions réelles selon les auteurs, et en automatisant l'évaluation des rollouts via le world judge, un goulot d'étranglement qui nécessitait jusqu'ici infrastructure physique ou inspection humaine. Pour les équipes travaillant à l'échelle sur des politiques de manipulation, l'équation coût-délai d'itération pourrait évoluer sensiblement. La performance au benchmark WorldArena avec 2B paramètres seulement suggère une efficacité paramétrique notable, même si les benchmarks de simulation ne garantissent pas directement des performances terrain. GE-Sim 2.0 s'inscrit dans la continuité directe de Genie Envisioner, framework de génération vidéo conditionné par l'action publié par la même équipe. Le marché des world models pour la robotique s'est densifié rapidement, avec notamment UniSim et des travaux issus de Google DeepMind, IRASim, ainsi que les simulateurs développés par Physical Intelligence autour de pi_zero. Dans l'espace VLA, Lerobot (Hugging Face) et plusieurs groupes académiques de MIT et Stanford investissent des directions parallèles. Ce résultat reste une pré-publication arXiv sans révision par les pairs ; les "gains mesurables en conditions réelles" annoncés ne sont pas quantifiés précisément dans l'abstract, ce qui limite l'interprétation des performances de transfert. La prochaine étape logique serait une validation externe sur des benchmarks physiques standardisés.

RechercheOpinion
1 source
Un cadre en boucle réel-simulation-réel (RSR) pour le transfert de politiques robotiques généralisables
2arXiv cs.RO 

Un cadre en boucle réel-simulation-réel (RSR) pour le transfert de politiques robotiques généralisables

Des chercheurs proposent un cadre « Real-to-Sim-to-Real » (RSR), publié sur arXiv dans sa troisième version (2503.10118v3), qui vise à réduire l'écart entre simulation et monde réel lors du transfert de politiques de contrôle robotique. Sa contribution centrale est une fonction de coût d'inspiration théorique de l'information. Elle pèse deux objectifs : accomplir la tâche, et orienter la politique vers la collecte d'échantillons réels les plus informatifs possible pour améliorer le transfert. Cette fonction s'intègre dans des algorithmes d'apprentissage par renforcement existants, comme PPO ou SAC, et vise une exploration équilibrée des zones critiques du domaine réel. Le cadre a été implémenté avec la plateforme MuJoCo MJX et testé sur deux familles de tâches : de la manipulation avec un bras robotique à 6 DOF, et de la locomotion avec un robot à pattes. Les auteurs annoncent une acquisition de données plus efficace et une nette amélioration des performances en conditions réelles. Le résumé ne chiffre ni les gains ni le nombre d'essais, et ne nomme ni robots ni laboratoires. L'intérêt est de traiter le sim-to-real comme un problème de choix des données réelles à collecter, et non seulement de réglage de la simulation. Les échantillons réels coûtent cher, surtout sur des robots à pattes ou des bras industriels où chaque essai use le matériel et mobilise des opérateurs. Une politique qui cherche activement l'information manquante sur l'écart de dynamique pourrait réduire le nombre d'itérations réel-simulation nécessaires avant déploiement. Le simulateur différentiable est facultatif. Quand il existe, les données servent aussi à calibrer ses paramètres. Sinon, le cadre reste utilisable, ce qui élargit son champ d'application aux équipes sans pipeline différentiable. Il faut toutefois rester prudent : il s'agit d'un travail académique évalué sur deux plateformes, sans comparaison chiffrée visible dans le résumé, et loin d'une validation à l'échelle industrielle ou sur des tâches longues et variées. Ce travail s'inscrit dans l'effort général pour fermer l'écart sim-to-real, qui freine le passage de l'entraînement massif en simulation aux robots déployés. La randomisation de domaine, l'identification de paramètres et les simulateurs différentiables en sont les approches classiques. Le choix de MuJoCo MJX, version accélérée sur GPU via JAX, reflète la place de ces outils dans la recherche actuelle. Les grands acteurs de l'humanoïde et des modèles de fondation robotiques s'appuient eux aussi fortement sur la simulation, ce qui rend ces méthodes d'exploration guidée potentiellement pertinentes pour eux. La suite dépendra de la publication du code, de l'évaluation sur des systèmes plus complexes et de comparaisons directes avec les méthodes existantes.

RecherchePaper
1 source
WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée
3arXiv cs.RO 

WNM-3D : un modèle de navigation intégrant une conditionnalisation 3D pour la navigation vision-langage en boucle fermée

Un article publié sur arXiv (référence 2608.07267, catégorie "cross-listing" signalant un croisement entre disciplines) présente WNM-3D, un modèle de navigation "world-action" conçu pour la navigation vision-langage en boucle fermée, c'est-à-dire des robots qui suivent des instructions en langage naturel à partir de flux vidéo égocentriques. Le système combine un encodeur de géométrie gelé, qui extrait des représentations 3D à partir de l'historique RGB monoculaire de l'agent, avec un adaptateur entraînable appelé 3D Scene-to-Token, qui convertit ces représentations en un préfixe de longueur fixe injecté dans un Transformer de diffusion. Grâce à un mécanisme d'attention "block-causal", ce contexte géométrique conditionne à la fois la génération des futures vues visuelles et celle des actions de navigation. L'entraînement se déroule en trois étapes : un ajustement supervisé sur des démonstrations générées par l'algorithme A*, une adaptation de type DAgger sur les états visités par la politique elle-même, puis une optimisation en boucle fermée via une méthode appelée DanceGRPO. Sur le benchmark GN-Bench, WNM-3D surpasse des politiques de navigation basées sur des modèles vision-langage classiques ainsi que sa propre variante conditionnée en 2D, avec une meilleure cohérence entre flux visuel et action et une erreur de mouvement visuel réduite sur un jeu d'évaluation proche de l'objectif. L'intérêt de ces travaux réside dans le diagnostic qu'ils posent sur les approches VLA (vision-language-action) actuelles, qui associent directement observations et instructions à des actions sans modéliser explicitement comment la scène visuelle doit évoluer sous l'effet du mouvement prédit. En ancrant la prédiction conjointe d'images futures et d'actions dans une représentation 3D persistante plutôt que dans un simple contexte 2D, WNM-3D vise à réduire la dérive en boucle fermée, un problème classique où les erreurs de navigation s'accumulent au fil des pas de temps. Pour les intégrateurs de robots mobiles autonomes, ce résultat suggère qu'un conditionnement géométrique explicite améliore la robustesse par rapport à des politiques purement basées sur des modèles vision-langage préentraînés, sans toutefois constituer une preuve de déploiement réel : les résultats restent circonscrits à un benchmark, sans essai terrain ni robot physique mentionné. Ce travail s'inscrit dans la lignée des modèles génératifs "world-action" (WAM), une famille d'approches qui prédisent conjointement observations futures et actions mais qui, jusqu'ici, ne conditionnaient pas cette génération sur une représentation géométrique de l'historique observé pour la navigation continue. WNM-3D se positionne explicitement contre les politiques VLA de référence et contre une variante 2D du même modèle, utilisée comme ablation pour isoler l'apport du conditionnement 3D. Aucun partenariat industriel, aucun calendrier de déploiement ni acteur commercial n'est mentionné dans l'abstract, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit prêt à l'intégration.

RechercheActu
1 source
SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu
4arXiv cs.RO 

SC$^{2}$-WM : un modèle du monde autocorrecteur à boucle de rétroaction fermée pour la navigation vision-langage en environnement continu

Des chercheurs ont publié le 11 août 2026 sur arXiv (référence 2608.07548v1) un article présentant SC²-WM, un modèle du monde auto-correcteur destiné à la navigation par vision et langage en environnement continu (VLN-CE), une tâche où un agent robotique doit suivre des instructions en langage naturel pour se déplacer dans un espace qu'il ne perçoit que partiellement. Contrairement à la plupart des méthodes existantes, qui fonctionnent en boucle ouverte sans mécanisme pour détecter une dérive de leur représentation interne pendant l'exécution, SC²-WM introduit une boucle de rétroaction fermée : le modèle du monde anticipe les conséquences d'une action avant de l'exécuter et affine le plan de navigation au niveau de l'état interne. Pour les cas les plus difficiles, les auteurs ajoutent un mécanisme d'adaptation conditionnelle qui met à jour le modèle du monde lui-même au moment du test, lorsque la rétroaction signale que ses capacités sont insuffisantes pour la situation rencontrée. Les expériences, menées sur les benchmarks standards de VLN-CE, montrent une robustesse et une généralisation améliorées par rapport aux approches en boucle ouverte. Le code est mis à disposition sur GitHub (sunrise-ikun/SC2_WM). Aucun chiffre précis de gain de performance ni comparaison avec des systèmes commerciaux n'est communiqué dans le résumé. Cette contribution touche un point sensible de la navigation robotique par instructions : le fossé entre les démonstrations en simulation et la fiabilité en conditions réelles. Un agent en boucle ouverte accumule des erreurs de perception ou d'interprétation du langage sans pouvoir les corriger, ce qui dégrade rapidement ses performances dès que l'environnement s'écarte des données d'entraînement. En donnant au modèle du monde la capacité de vérifier ses propres prédictions avant d'agir, puis de se réadapter localement quand ses connaissances ne suffisent plus, SC²-WM s'inscrit dans une tendance de fond de la recherche en IA incarnée : rendre les architectures de type modèle du monde ou VLA plus robustes à l'inférence, sans réentraînement complet. Pour les intégrateurs travaillant sur des AMR ou des plateformes mobiles guidées par langage naturel, ce type de mécanisme de correction interne est un prérequis pour sortir des scénarios de laboratoire scriptés et s'approcher d'un déploiement fiable en environnement non structuré. SC²-WM s'inscrit dans la lignée des travaux récents combinant modèles du monde et navigation instruite par le langage, un domaine où la littérature s'est jusqu'ici surtout concentrée sur l'amélioration de la perception et de la planification en boucle ouverte, laissant de côté la correction d'erreurs pendant l'exécution. L'article ne précise ni affiliation institutionnelle ni partenariat industriel ; il s'agit d'une publication de recherche accompagnée d'un code open source, sans annonce de produit ni de déploiement commercial. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation sur des plateformes robotiques physiques et une comparaison directe avec d'autres architectures de navigation par le langage, notamment les approches fondées sur des modèles VLA génériques.

RecherchePaper
1 source