AquaOrbit : apprentissage par renforcement simulation-réel pour l'orbite autour d'une cible sous-marine avec retour visuel intermittent
Des chercheurs ont publié le 22 septembre 2026 sur arXiv (2609.24054) une étude présentant AquaOrbit, un contrôleur par apprentissage par renforcement pour faire orbiter un robot sous-marin autour d'une cible malgré des pertes intermittentes de flux visuel. Un module de récupération exploite, lors d'une perte de détection, des références figées de ligne de visée, de roulis et de profondeur pour stabiliser le véhicule et retrouver la cible. Entraîné dans le simulateur Isaac Sim avec randomisation de la dynamique, des observations et des pertes de vision, le contrôleur a ensuite été évalué sans réentraînement dans Gazebo/ROS2, un moteur physique différent : 20 essais réussis sur 20 en cible statique comme en cible mobile, sur une trajectoire 3D à profondeur variable inédite. Face à une cible mobile, l'erreur moyenne de ligne de visée baisse d'environ 46% par rapport à un contrôleur PID de servovision équipé du même module, pour une précision de trajectoire comparable ; sans ce module, la réussite chute à 9 essais sur 20. Un déploiement physique zero-shot, perception et contrôle entièrement embarqués, a suivi des trajectoires elliptiques, en huit et circulaires à profondeur variable, avec stabilité maintenue lors d'occlusions manuelles jusqu'à 8 secondes et réacquisition de cible en 2,5 secondes.
Pour les intégrateurs de véhicules sous-marins autonomes et les opérateurs d'inspection offshore (pipelines, coques, aquaculture), ce travail cible un point de friction concret : la perte de suivi visuel en virage serré ou en eau trouble fait généralement échouer l'orbitage automatisé. Le transfert simulation-vers-réel démontré sans réentraînement, y compris sur un moteur physique distinct de celui de l'entraînement, soutient l'idée que des politiques de RL peuvent généraliser au-delà du simulateur d'origine, un point encore débattu en robotique sous-marine où bruit acoustique et optique diffèrent fortement du monde simulé. L'écart chiffré entre configurations avec et sans module de récupération (20/20 contre 9/20) quantifie l'apport réel du mécanisme plutôt que de s'appuyer sur une vidéo sélective.
Il s'agit d'une publication de recherche en preprint, sans entreprise ni produit commercial associé : un résultat scientifique, pas un déploiement industriel. Le travail se positionne face aux méthodes classiques de servovision visuelle par PID, utilisées comme référence de comparaison, et s'inscrit dans le mouvement plus large de transfert simulation-vers-réel déjà exploré pour des robots terrestres et aériens mais encore peu démontré pour l'orbitage sous-marin de cibles mobiles. Aucun acteur français ou européen n'apparaît dans cette étude. Les essais physiques réels, incluant des trajectoires absentes de l'entraînement, dépassent la simple démonstration en environnement contrôlé, mais aucun calendrier de transfert commercial ni volume de déploiement n'est communiqué à ce stade.
Dans nos dossiers



