Aller au contenu principal
LOTUSim : simulateur multi-domaines pour la robotique marine
RecherchearXiv cs.RO 

LOTUSim : simulateur multi-domaines pour la robotique marine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent LOTUSim, un simulateur maritime open source conçu pour la robotique navale multi-domaines, combinant drones aériens, véhicules de surface et engins sous-marins dans un même environnement partagé. Publié sur arXiv début juillet 2026, ce travail répond à un manque identifié dans les simulateurs existants, généralement centrés sur l'autonomie pure et dépourvus d'interaction humaine en temps réel. LOTUSim apporte deux contributions techniques. D'abord, une architecture temps réel supportant plusieurs opérateurs simultanément, capable de monter en charge jusqu'à de larges flottes hétérogènes de drones tout en conservant fidélité visuelle et performance d'exécution stricte. Ensuite, un modèle de courants sous-marins inspiré des couches d'Ekman, qui capture la dynamique des flux dépendants du vent et de la profondeur avec une précision physique supérieure aux modèles stochastiques de Gauss-Markov habituellement employés, comme le confirment les validations menées contre des données de réanalyse océanique.

Pour l'industrie de la robotique marine, cet outil comble un vide concret: l'entraînement des opérateurs et la répétition de missions navales coordonnées nécessitent des simulateurs capables de mêler humains et machines en boucle fermée, pas seulement de valider des algorithmes d'autonomie en isolation. La capacité à faire cohabiter des essaims de drones aériens, de surface et sous-marins dans un même scénario interactif touche directement les besoins d'opérations militaires ou de surveillance côtière multi-véhicules, où le coût et le risque des essais réels rendent la simulation incontournable. Le gain de précision du modèle de courants a aussi une portée pratique: une dynamique océanique mal modélisée fausse les prédictions de trajectoire et de consommation énergétique des véhicules sous-marins autonomes.

Ce projet s'inscrit dans une lignée de simulateurs robotiques qui, jusqu'ici, ont privilégié soit le rendu visuel, soit la fidélité physique, rarement les deux à l'échelle avec un opérateur humain dans la boucle. En le rendant open source, les auteurs visent son adoption par la communauté de recherche en robotique opérateur-en-boucle, avec pour perspective l'extension à des scénarios encore plus larges de coordination navale multi-drones.

Dans nos dossiers

À lire aussi

SoMA : un simulateur neuronal réel-vers-simulation pour la manipulation robotique de corps mous
1arXiv cs.RO 

SoMA : un simulateur neuronal réel-vers-simulation pour la manipulation robotique de corps mous

SoMA, un simulateur neuronal de type "real-to-sim" pour la manipulation robotique d'objets déformables, vient d'être présenté dans un article arXiv (référence 2602.02402v2, version révisée). Le système s'appuie sur des Gaussian Splats 3D pour modéliser les dynamiques d'objets souples (tissus, matériaux déformables) en couplant trois éléments dans un espace latent neuronal unifié : la dynamique de déformation propre à l'objet, les forces environnementales, et les actions des articulations du robot. Contrairement aux simulateurs existants qui reposent soit sur des modèles physiques prédéfinis, soit sur des dynamiques apprises à partir de données mais sans conditionnement par les commandes du robot, SoMA intègre directement le contrôle robotique dans sa boucle de simulation. Les auteurs rapportent un gain de précision de resimulation et de généralisation de 20% sur des tâches de manipulation robotique réelles, avec une démonstration sur du pliage de tissu à horizon long. Cette approche s'attaque à un problème central pour l'industrie robotique : la manipulation d'objets souples reste l'un des angles morts des pipelines actuels de simulation-vers-réel, largement optimisés pour les objets rigides. Un simulateur capable de représenter fidèlement la déformation de matériaux tout en restant stable sur de longues séquences d'actions ouvrirait la voie à un entraînement plus fiable de politiques de manipulation pour du linge, des câbles, ou des emballages souples, sans dépendre de modèles physiques manuels coûteux à calibrer. Le gain de 20% en généralisation, s'il se confirme sur d'autres tâches que le pliage de tissu, suggérerait que les architectures neuronales conditionnées par le robot peuvent combler une partie de l'écart entre simulation et réalité pour les objets déformables, un domaine où les benchmarks restent encore peu standardisés. Le champ de la simulation "real-to-sim" pour la robotique s'est largement développé autour des Gaussian Splatting comme représentation de scène, en particulier pour les objets rigides ou articulés. SoMA prolonge cette ligne de recherche vers les corps mous, un défi documenté de longue date en raison de la difficulté à modéliser des dynamiques non linéaires avec peu de données réelles. L'article ne précise pas de plan de déploiement industriel ni de partenariat commercial à ce stade : il s'agit d'une contribution de recherche académique, dont la reproductibilité et l'extension à d'autres classes d'objets déformables (mousses, liquides, objets composites) restent à démontrer par la communauté.

RecherchePaper
1 source
Au-dessus et en dessous : SLAM multi-robots hétérogène pour domaines de surface et sous-marins
2arXiv cs.RO 

Au-dessus et en dessous : SLAM multi-robots hétérogène pour domaines de surface et sous-marins

Une équipe de chercheurs a publié sur arXiv (référence 2605.09811) un système de cartographie et localisation simultanées multi-robots (SLAM) capable de fusionner les données d'un véhicule de surface autonome (USV) et de plusieurs véhicules sous-marins autonomes (AUV) en une seule carte cohérente. Là où les approches existantes recouraient au ping acoustique entre robots pour mesurer les distances, ce travail exploite une observation géométrique : certaines structures présentes dans les environnements maritimes sont visibles à la fois depuis la surface et depuis le fond, ce qui permet d'établir des fermetures de boucle visuelles inter-robots. Chaque robot effectue sa propre estimation d'état en autonomie, puis un nœud centralisé détecte ces correspondances croisées USV-AUV et fusionne l'ensemble des trajectoires dans un graphe de poses unique couvrant la totalité de la mission. Le système a été validé sur des données perceptuelles réelles dans trois environnements distincts, montrant une réduction des erreurs de localisation pour les AUVs par rapport au SLAM mono-robot sur les mêmes trajectoires. L'intérêt opérationnel est direct : le ping acoustique impose que les robots se trouvent à portée mutuelle simultanément, que le signal ne soit pas obstrué, et souvent que les horloges soient synchronisées, contraintes difficiles à tenir dans des environnements encombrés (quais, infrastructures offshore, épaves). En s'affranchissant de ces dépendances, cette approche ouvre la voie à des missions d'inspection sous-marine plus longues et plus autonomes, notamment pour le monitoring de pipelines, de fondations d'éoliennes offshore ou de structures portuaires, sans déployer d'infrastructure acoustique dédiée. Le papier constitue également une preuve de faisabilité que le sim-to-real gap dans la mise en correspondance de features visuels cross-domaines (surface vs sous-eau) est franchissable sur données réelles. Ce travail s'inscrit dans un corpus de recherche récent sur la fermeture de boucle inter-robots entre USVs et AUVs, dont il représente l'extension vers un système complet multi-robots centralisé. Dans le paysage de la robotique maritime, les acteurs industriels comme Saildrone (USV), Kongsberg ou Hydroid (AUV) s'appuient encore largement sur l'USBL acoustique pour le positionnement sous-marin relatif. Une approche purement visuelle et géométrique comme celle-ci, si elle passe à l'échelle, pourrait réduire significativement le coût et la complexité logistique des flottes hétérogènes. Les auteurs ne mentionnent pas de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une contribution académique, validée sur terrain, mais sans annonce de commercialisation.

UEPertinent pour les opérateurs européens d'éoliennes offshore et d'infrastructures portuaires (Mer du Nord, Baltique) qui dépendent aujourd'hui de l'USBL acoustique coûteux pour les inspections sous-marines autonomes.

RecherchePaper
1 source
WorldLine : simulation visuelle pilotée par les actions pour la manipulation robotique
3arXiv cs.RO 

WorldLine : simulation visuelle pilotée par les actions pour la manipulation robotique

WorldLine, un simulateur visuel piloté par l'action, est présenté dans un preprint arXiv (2609.38059) pour la manipulation robotique. Il s'agit d'un résultat de recherche, sans produit ni déploiement industriel annoncé. Le système apprend la dynamique de manipulation à partir de plus de 10 000 heures de vidéos de robots sans annotation d'actions. Il l'ancre ensuite dans le contrôle avec plus de 2 000 heures de trajectoires actionnées, réparties sur plus de dix morphologies de robots. Une représentation des actions dans l'espace image sert d'interface de contrôle commune, ce qui évite de traduire entre espaces de commande incompatibles. L'entraînement combine plusieurs points de vue, des trajectoires d'échec et une régularisation relationnelle pour mieux prédire les interactions. Une distillation en quelques étapes centrée sur le robot permet un déroulé causal rapide, en conservant les mouvements utiles à l'action. Sur des trajectoires échouées, le score d'IoU des masques du robot gagne 0,1626 face à la meilleure référence. La réussite d'une trajectoire est prédite avec 74 % de précision moyenne sur RoboTwin et AgiBot, soit un point de plus que la meilleure base de comparaison. Sans entraînement ni adaptation sur RoboTwin, les déroulés du simulateur améliorent le taux de succès de tâche jusqu'à 21,4 points par rapport à l'exécution directe de la politique. L'enjeu est le coût de l'évaluation et de la collecte d'expérience sur robot réel, principal frein à l'apprentissage en conditions réelles. Un simulateur capable de prédire l'issue d'une action avant son exécution permet de trier des politiques ou de planifier sans mobiliser de matériel. Le résultat le plus parlant concerne les échecs : les modèles vidéo génératifs tendent à produire des scènes plausibles mais peu fidèles à l'action commandée, et à «réussir» visuellement des gestes ratés. Or un simulateur inutilisable pour détecter l'échec ne sert pas à l'évaluation. Il faut toutefois relativiser : 74 % de précision sur la réussite reste modeste pour de la validation avant déploiement, et l'avance sur la meilleure référence n'est que d'un point. Le gain de 21,4 points est un maximum, non une moyenne, et les benchmarks (RoboTwin est surtout simulé) ne garantissent pas la robustesse en atelier. L'approche montre néanmoins qu'un jeu de données vidéo massif sans actions peut compenser la rareté des données actionnées. Ces travaux s'inscrivent dans la vague des modèles du monde et des simulateurs vidéo pour la robotique, qui visent à réduire la dépendance aux données téléopérées, coûteuses et propres à chaque robot. Leur point de friction est l'hétérogénéité des espaces d'action entre plateformes, que WorldLine traite par sa représentation image partagée. Il se place face aux modèles vidéo généralistes et aux simulateurs conditionnés par l'action, limités par des données rares. La suite logique passe par la validation sur robots physiques, la mesure de la corrélation entre succès prédit et succès réel, et l'intégration à des boucles de planification ou d'évaluation de politiques. Une page projet publie des résultats supplémentaires, mais aucune date de publication du code ou des modèles n'est mentionnée.

RecherchePaper
1 source
Modèles du monde pour la manipulation robotique
4arXiv cs.RO 

Modèles du monde pour la manipulation robotique

Des chercheurs ont publié en juin 2026 sur arXiv (2606.24742) un modèle généraliste de valeur pour la manipulation robotique, le WVM (World Value Model). La proposition centrale consiste à substituer les backbones VLM (Vision-Language Model) habituellement utilisés par un modèle de monde, nativement mieux adapté à la modélisation temporelle nécessaire pour évaluer la progression d'une tâche. Sur les benchmarks standards, WVM atteint les meilleures performances connues en Value-Order Correlation (VOC), la métrique de référence pour les modèles de valeur robotiques. L'équipe introduit également Suboptimal-Value-Bench, un benchmark multi-embodiment composé de 800 trajectoires sous-optimales annotées frame par frame par des humains, comblant un angle mort des évaluations existantes qui ne contenaient que des données expertes. L'enjeu est directement opérationnel pour quiconque entraîne des systèmes de manipulation à grande échelle : les données collectées en conditions réelles sont rarement uniformément expertes. Un modèle de valeur précis permet de pondérer ou filtrer ces trajectoires hétérogènes, améliorant la qualité de l'entraînement sans nettoyage manuel coûteux. WVM démontre des gains de performance sur plusieurs approches d'extraction de politique, en simulation comme en déploiement réel, ce qui renforce la thèse que l'estimation de valeur est un composant orthogonal et complémentaire au choix d'architecture de politique. La robustesse maintenue sur données sous-optimales est l'aspect le plus significatif : c'est précisément dans ce régime que les VLMs classiques décrochent, leurs préentraînements sur observations visuelles statiques ne suffisant pas à capturer les dynamiques temporelles longues. La montée en puissance des VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA a rendu critique la question de la qualité des données d'entraînement à grande échelle. L'approche WVM s'inscrit dans une tendance émergente qui consiste à spécialiser les composants : un backbone temporel dédié pour l'évaluation de la valeur, distinct du modèle d'action. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans cet article purement académique. Les prochaines étapes naturelles incluent l'intégration du WVM dans des pipelines d'imitation à grande échelle ou en combinaison avec du reinforcement learning offline (IQL, CQL), et une extension à des environnements multi-tâches plus complexes.

RechercheOpinion
1 source