
CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine
Une équipe de recherche présente CoralPlan, un système vision-langage conçu pour l'inspection robotique sous-marine de colonies coralliennes, décrit dans un preprint publié sur arXiv (2609.31211v1). Le système sélectionne une compétence d'observation à partir d'une image de caméra courante et d'une consigne textuelle fournie par un "manifeste d'épisode". Une interface de mouvement commune exécute ensuite trois primitives de trajectoire relatives à la cible, orbite, patch ou survey (balayage), les autres champs du plan servant de guide pour l'opérateur humain. Deux critères de succès sont définis: la complétion de l'observation, qui exige le maintien de la cible dans le champ et une couverture propre à chaque primitive, et le succès conjoint, qui exige en plus que la compétence choisie corresponde à la référence enregistrée. Le système a été évalué sur 144 épisodes simulés et 36 paires appariées simulation-matériel, réalisées dans une piscine à eau claire avec des poses de référence de cible mesurées par un système externe. Sur matériel réel, le taux de complétion d'observation atteint 77,8% et le taux de succès conjoint 63,9%.
Ce travail illustre un enjeu concret pour les opérateurs de robotique sous-marine (inspection de récifs, aquaculture, infrastructures immergées) : reconnaître une cible ne suffit pas, le robot doit aussi choisir le bon type de mouvement d'observation selon la tâche demandée, une décision jusqu'ici largement câblée en dur dans les trajectoires pré-programmées des AUV et ROV. En étendant les systèmes vision-langage-action, jusqu'ici concentrés sur la manipulation et les humanoïdes terrestres, au cadrage caméra sous-marin, l'étude teste la portée de cette approche hors de son terrain habituel. L'écart entre les 144 épisodes simulés et les seules 36 paires testées sur matériel, ainsi que la chute du taux de succès conjoint à 63,9% par rapport à la complétion d'observation à 77,8%, rappelle que le passage de la simulation au réel reste un point de friction, même pour une tâche de perception plutôt que de manipulation fine. Les auteurs documentent eux-mêmes des cas d'échec, complétions ne correspondant pas à la référence ou observations incomplètes malgré une sélection de compétence correcte, une transparence qui tranche avec l'emphase habituelle des annonces du secteur.
La surveillance automatisée des récifs coralliens gagne en importance face à leur dégradation, mais les robots sous-marins existants suivent le plus souvent des trajectoires fixes plutôt que des mouvements d'observation adaptés à la tâche. CoralPlan s'inscrit dans la vague plus large des modèles vision-langage-action appliqués jusqu'à présent surtout à la manipulation robotique terrestre, en la transposant à des décisions de cadrage caméra sur une plateforme non humanoïde évoluant en milieu aquatique. Il s'agit d'un travail de recherche publié en preprint, non encore relu par les pairs, testé en piscine à eau claire et non lors de déploiements réels sur récif, ce qui limite pour l'instant sa portée à une preuve de concept en conditions contrôlées. Les auteurs pointent eux-mêmes les cas où la sélection correspond à la référence sans que l'observation soit complète, ouvrant la voie à des travaux futurs visant à combler cet écart avant d'envisager des essais en eau trouble ou sur site naturel.
Dans nos dossiers




