
OceanGym : un environnement de référence pour les agents incarnés sous-marins
Des chercheurs du projet OceanGPT ont publié en septembre 2025 sur arXiv (article 2509.26536, version 3) OceanGym, présenté comme le premier benchmark complet pour les agents incarnés évoluant en environnement océanique sous-marin. La plateforme couvre huit domaines de tâches réalistes et repose sur un framework d'agent unifié piloté par des modèles de langage multimodaux de grande taille (MLLM), combinant perception, mémoire et prise de décision séquentielle. Les agents testés doivent interpréter à la fois des données optiques et sonar, explorer de façon autonome des environnements complexes et mener à bien des objectifs à long horizon, dans des conditions marquées par une faible visibilité et des courants océaniques dynamiques. Le code et les données du benchmark sont mis à disposition sur GitHub, sous l'organisation OceanGPT.
Les expériences menées par les auteurs montrent un écart substantiel entre les agents MLLM les plus avancés et des experts humains sur les tâches de perception, de planification et d'adaptation en milieu sous-marin, un constat qui tranche avec le discours ambiant sur la maturité des agents vision-langage-action. Pour l'industrie des véhicules sous-marins autonomes (AUV) et des ROV, ce résultat confirme que l'environnement océanique reste nettement plus exigeant que les domaines terrestre ou aérien, où des benchmarks d'agents incarnés existent déjà depuis plusieurs années. OceanGym fournit ainsi aux équipes de recherche et aux intégrateurs un outil d'évaluation standardisé pour mesurer les progrès réels des agents avant tout déploiement physique, plutôt que de se fier à des démonstrations isolées.
Le milieu sous-marin figure, selon les auteurs, parmi les dernières frontières inexplorées de la Terre. Jusqu'ici, l'essentiel des benchmarks d'IA incarnée portait sur des environnements terrestres ou aériens, structurés et bien cartographiés, laissant un vide pour les usages océaniques. OceanGym s'inscrit dans la continuité du projet OceanGPT, dont l'équipe avait déjà développé des modèles de langage dédiés aux sciences océaniques, et prolonge cette démarche vers l'évaluation d'agents capables d'agir physiquement sous l'eau. Les auteurs présentent ce travail comme une étape vers le transfert de ces capacités à de véritables véhicules sous-marins autonomes déployés en conditions réelles, sans toutefois communiquer de calendrier de pilote ni de partenariat industriel à ce stade: le projet reste pour l'instant au niveau de la recherche académique en accès ouvert plutôt que du produit commercial.
Dans nos dossiers




