Aller au contenu principal
Collaboration entre agents pour le diagnostic d'anomalies en robotique sous-marine
RecherchearXiv cs.RO 

Collaboration entre agents pour le diagnostic d'anomalies en robotique sous-marine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche mis à jour sur arXiv (identifiant 2511.03075, version 2) présente AURA, pour Autonomous Resilience Agent, un framework de diagnostic d'anomalies et de pannes destiné à la robotique sous-marine. Le système combine deux agents distincts : un agent de bas niveau, chargé de la caractérisation d'état, qui surveille en continu la télémétrie du robot et traduit les signaux bruts en une description structurée du problème en langage naturel ; et un agent de raisonnement diagnostique de haut niveau, qui mène un dialogue guidé par des connaissances externes avec un opérateur humain pour identifier la cause racine d'une anomalie. L'ensemble s'appuie sur un jumeau numérique haute fidélité et sur de grands modèles de langage (LLM), avec une boucle homme-dans-la-boucle explicite. Une fois qu'un diagnostic est validé par un opérateur, il est reconverti en exemple d'entraînement pour affiner le modèle perceptif de bas niveau. Les auteurs ne publient pas de résultats chiffrés de déploiement dans le résumé ; il s'agit d'une contribution de recherche décrivant l'architecture et une implémentation de référence, pas d'un produit commercialisé.

L'intérêt principal de ce travail tient au terrain qu'il cible : les véhicules sous-marins autonomes évoluent dans des environnements où la connectivité est intermittente et où une panne non anticipée peut être coûteuse, voire dangereuse, ce qui rend l'automatisation intégrale du diagnostic risquée sans supervision humaine. En positionnant explicitement l'IA comme partenaire évolutif plutôt qu'outil figé, AURA répond à une critique répandue envers les systèmes autonomes classés comme boîtes noires, en gardant l'humain dans la boucle de validation tout en capitalisant sur chaque cas traité pour améliorer le modèle. Pour les intégrateurs de robotique sous-marine et les opérateurs de flottes d'AUV, ce type d'architecture ouvre la voie à une maintenance prédictive plus fiable, sans sacrifier la traçabilité des décisions critiques.

Le papier s'inscrit dans la tendance plus large des architectures agentiques bâties sur des LLM couplés à des jumeaux numériques pour la robotique de terrain, un axe de recherche actif depuis l'essor des modèles de raisonnement conversationnel. Aucun acteur industriel ni concurrent n'est cité dans le résumé, ce qui confirme la nature académique de la publication ; les suites logiques attendues seraient une validation expérimentale sur des plateformes sous-marines réelles et une comparaison avec des approches de diagnostic purement automatisées.

Dans nos dossiers

À lire aussi

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique
1arXiv cs.RO 

DiagGen : génération à base d'agents d'objets déformables avec diagnostics par simulation pour la robotique

DiagGen est un framework agentique de recherche qui transforme une simple photo prise en conditions réelles en un asset déformable prêt pour la simulation robotique, via une boucle génération-simulation-diagnostic-correction. Le système construit d'abord une géométrie décomposée par parties ainsi que des paramètres matériaux, puis un agent basé sur un VLM (vision-language model) sélectionne les régions sémantiquement informatives de l'objet, les sonde dans un simulateur physique, observe la réponse du matériau simulé et transmet des indices de correction ciblés à l'étape de génération responsable de l'erreur. Les auteurs ont testé l'approche sur 40 assets et montrent que ce diagnostic basé sur la simulation produit des indices de correction utiles et améliore modérément la qualité des objets déformables générés. Ils démontrent également que les assets issus de DiagGen peuvent être directement intégrés dans un simulateur physique haute fidélité pour planifier des tâches de manipulation pick-and-place en contact riche, contrairement aux objets générés par des modèles de fondation visuels qui ne sont pas toujours simulables. Le projet, décrit dans un preprint arXiv publié en septembre 2026, met à disposition un site web (diaggen.github.io) présentant les résultats. L'enjeu pratique est significatif pour quiconque construit des pipelines de manipulation robotique en simulation: générer un asset visuellement réaliste ne garantit pas qu'il se comporte correctement sous contact physique, ce qui pousse aujourd'hui les équipes à corriger manuellement les objets déformables (tissus, sacs, objets mous) avant de les utiliser pour entraîner ou valider des politiques. En rebouclant la simulation dans le processus de génération, plutôt que de l'utiliser seulement comme vérification finale, DiagGen s'attaque directement à l'écart entre génération visuelle et simulabilité physique, un problème récurrent pour les approches d'entraînement en environnement synthétique destinées aux tâches de préhension et de manipulation fine. Pour les intégrateurs et laboratoires qui construisent des bibliothèques d'assets pour entraîner des politiques VLA ou des contrôleurs de manipulation, cela laisse entrevoir une réduction du travail manuel de nettoyage géométrique et matériau, même si l'amélioration mesurée reste qualifiée de "modérée" par les auteurs eux-mêmes, sur un échantillon limité à 40 objets. DiagGen s'inscrit dans un mouvement de recherche plus large visant à produire des environnements et objets synthétiques exploitables pour l'entraînement de politiques robotiques, un domaine où la plupart des frameworks existants de génération d'assets déformables évaluent la plausibilité physique seulement après coup, sans réinjecter cette information dans le pipeline de génération. Le papier se positionne explicitement face aux approches qui s'appuient sur des modèles de fondation visuels généralistes pour produire des objets 3D, en pointant leur absence de garantie de simulabilité. Publié sur arXiv (2609.23103) en tant que preprint de recherche, DiagGen reste à ce stade un travail académique accompagné d'un site de démonstration, sans indication d'intégration à un moteur de simulation commercial ni de calendrier de diffusion plus large; la suite logique évoquée consiste à étendre les tests au-delà des 40 assets actuels et à affiner la boucle de diagnostic pour d'autres catégories de matériaux déformables.

RecherchePaper
1 source
Vers une collaboration humain-agent-robot fondée sur les preuves pour le tri des anomalies sans dépendance à la Terre
2arXiv cs.RO 

Vers une collaboration humain-agent-robot fondée sur les preuves pour le tri des anomalies sans dépendance à la Terre

Des chercheurs proposent, dans un preprint arXiv (2610.08933), une architecture de triage d'anomalies pour équipages en espace lointain, fondée sur une équipe humain, agent IA et robot. Le système repose sur un gestionnaire d'état de triage qui conserve les hypothèses en cours, la provenance des preuves, l'incertitude, le contexte opérationnel et l'état des outils. Un agent incarné, tourné vers l'équipage, recueille les observations des astronautes et explique pourquoi l'évaluation change. Un robot mobile va chercher des preuves ciblées et localisées. Des interfaces typées séparent le dialogue et l'orchestration du monitoring, des commandes robot, de la récupération de contexte et du contrôle critique pour la sécurité. L'IA agentique y joue le rôle de coordinateur à état au-dessus de services bornés et inspectables, et non celui de pilote autonome d'un véhicule. Le prototype d'intégration en boucle matérielle (hardware-in-the-loop) combine un Reachy Mini comme agent incarné et un robot mobile Innate MARS. Deux scénarios l'illustrent. Le premier s'inspire d'une vraie fausse alerte à l'ammoniac sur l'ISS, où une contamination suspectée restreint l'accès de l'équipage. Le second concerne une anomalie d'interface d'alimentation dans une base lunaire habitée, où l'inspection robotisée distingue un défaut local de connecteur d'autres causes que la télémétrie à distance ne permet pas de départager. L'intérêt du travail tient au problème qu'il cible. Lors des missions lointaines, le délai de communication interdit de compter sur un support sol en temps réel. Les alertes initiales sous-déterminent souvent la cause, et les indices décisifs se trouvent soit dans les observations de l'équipage, soit dans des zones dangereuses, coûteuses ou inaccessibles pour un humain. La contribution revendiquée est une boucle de preuves fermée, à autorité bornée : l'IA propose et explique, mais ne détient pas la commande des fonctions critiques. Cette posture contraste avec le discours dominant sur les agents entièrement autonomes, et elle intéresse tout décideur confronté à des environnements où la traçabilité et la responsabilité priment sur la performance brute. Il faut toutefois rester prudent. Il s'agit d'une architecture démontrée sur deux scénarios illustratifs, sans évaluation quantitative annoncée dans le résumé : ni taux de réussite, ni temps de triage, ni comparaison avec une procédure de référence. Le prototype relève de la preuve de concept en laboratoire, loin d'un système qualifié pour le vol. Le travail s'inscrit dans la montée de l'autonomie à bord requise par les programmes d'exploration habitée, notamment les projets de présence lunaire durable, où les opérations dépendront moins du centre de contrôle terrestre. Le choix du matériel est révélateur : Reachy Mini est un petit robot de bureau open source de l'écosystème Hugging Face, et Innate MARS une plateforme mobile accessible. Cela montre que l'on peut prototyper ce type de coordination avec des composants du commerce, loin des robots spatiaux dédiés. Le résumé ne cite ni agence spatiale partenaire, ni calendrier de test en conditions représentatives, ni acteur européen. Les suites naturelles seraient des essais en analogue de mission, des mesures de charge cognitive de l'équipage et une validation des garde-fous face à des pannes de communication ou de capteurs.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Reconnaissance sémantique des activités de plongeurs pour une collaboration sous-marine humain-robot efficace
3arXiv cs.RO 

Reconnaissance sémantique des activités de plongeurs pour une collaboration sous-marine humain-robot efficace

Une équipe de chercheurs a publié sur arXiv (arXiv:2606.12374v1) DAR-Net, un framework basé sur des transformers conçu pour reconnaître automatiquement les activités de plongeurs en milieu sous-marin. Le système classifie six catégories d'activités distinctes à partir de séquences vidéo, en combinant un raisonnement temporel global avec une supervision sémantique au niveau pixel. Pour entraîner et évaluer ce modèle, les auteurs ont constitué le premier jeu de données dédié à cette tâche : l'Underwater Diver Activity (UDA) dataset, qui comprend plus de 2 600 images annotées avec des masques de segmentation pixel-level. Les expériences sont réalisées en environnement contrôlé, et DAR-Net surpasse les modèles de référence actuels sur ce benchmark maison. Aucun déploiement opérationnel n'est rapporté à ce stade. L'enjeu industriel est réel : les véhicules sous-marins autonomes (AUV) sont de plus en plus utilisés pour assister les plongeurs dans des opérations à risque élevé, de l'inspection d'infrastructures offshore à la maintenance de câbles sous-marins. Pour qu'un AUV soit un véritable coéquipier et non un simple observateur, il doit interpréter les gestes et postures d'un humain en temps réel, dans des conditions de faible visibilité et de bruit visuel important. L'approche multi-loss de DAR-Net, qui couple la reconnaissance d'activité globale à la compréhension locale des interactions humain-robot via des contraintes de segmentation sémantique, adresse précisément ce gap. C'est une piste prometteuse, mais les validations restent en bassin contrôlé, loin des conditions réelles d'une inspection sous-marine à 30 mètres de profondeur avec turbidité variable. La reconnaissance d'activité humaine sous-marine est un domaine de niche mais en croissance, porté par l'essor des AUV commerciaux de sociétés comme Saab (BlueZone), Kongsberg, ou l'Ifremer en France. L'absence historique de datasets annotés a freiné les approches deep learning dans ce secteur, là où la robotique terrestre bénéficie de corpus massifs. La contribution principale de ce travail est précisément cette ressource de données fondatrice. Les auteurs positionnent explicitement DAR-Net comme une première brique, destinée à servir de baseline pour des travaux futurs sur la collaboration humain-robot en milieu subaquatique. Des extensions vers des environnements non contrôlés et des AUV réels constitueront le vrai test de généralisation du modèle.

UELe dataset UDA et le framework DAR-Net constituent une ressource de référence pour les acteurs européens de l'inspection sous-marine autonome (Ifremer, Kongsberg, Saab BlueZone), mais la validation en conditions réelles reste à démontrer.

RecherchePaper
1 source
AquaWorld : génération de mondes sous-marins structurellement cohérents pour la simulation robotique
4arXiv cs.RO 

AquaWorld : génération de mondes sous-marins structurellement cohérents pour la simulation robotique

Des chercheurs ont présenté AquaWorld, un framework de génération de mondes sous-marins pour la simulation robotique, détaillé dans un article publié sur arXiv (2609.22670v1). L'outil génère terrain 3D, placement d'assets, définition de tâches et champs de courants à partir d'un plan conditionné par le langage, tout en conservant la cohérence structurelle entre ces éléments grâce à une bibliothèque de plus de 10 000 assets compatibles milieu sous-marin et un modèle résiduel supervisé par CFD (mécanique des fluides numérique) qui prédit des champs de flux moyens réutilisables et conditionnés au terrain. Le système prend en charge aussi bien les véhicules sous-marins conventionnels que les robots-poissons bio-inspirés. Sur 24 paires de terrains testées, la randomisation structurée produit une consistance croisée nettement supérieure à une randomisation indépendante des facteurs, et dans une comparaison d'entraînement de politiques à budget égal, elle atteint un taux de succès en validation supérieur de 21%. En conditions physiques réelles, une politique de navigation visuelle entraînée uniquement en simulation réussit 95% des essais en bassin, sans mise à jour de ses modules de perception ou de contrôle. Pour l'industrie robotique sous-marine, ce résultat s'attaque à un goulot d'étranglement connu: contrairement aux robots terrestres ou aériens, les systèmes sous-marins doivent composer avec courants, visibilité dégradée et dynamique fluide complexe, ce qui limitait jusqu'ici la quantité de données synthétiques réellement exploitables pour l'entraînement. En montrant qu'une randomisation tenant compte de la structure du terrain améliore le transfert simulation-réalité jusqu'à un taux de réussite physique de 95% sans recalibrage, AquaWorld apporte une preuve empirique que le fossé sim-to-real, souvent pointé comme un obstacle majeur dans les publications robotiques, peut être réduit pour des tâches de navigation visuelle sous-marine. Pour les intégrateurs de véhicules sous-marins autonomes ou de robots d'inspection, cela ouvre une voie pour réduire coûts et risques des essais en mer en s'appuyant davantage sur l'entraînement simulé, à condition que les pipelines de génération respectent les contraintes physiques du domaine plutôt que de randomiser chaque facteur indépendamment. Ce travail s'inscrit dans une tendance plus large de la robotique où la génération procédurale de mondes à grande échelle est devenue un levier central de l'entraînement de politiques, un domaine longtemps dominé par les environnements terrestres et la manipulation. Le sous-marin restait en retard faute d'outils intégrant simultanément géométrie de terrain, dynamique des fluides et diversité d'assets de façon cohérente. À ce stade, il s'agit d'une contribution de recherche publiée sur arXiv, sans indication de produit commercial, de partenariat industriel ou de déploiement opérationnel annoncé, et les auteurs ne précisent ni affiliation ni feuille de route de diffusion publique du code ou des assets. Les suites attendues pour ce type de travaux passent généralement par l'extension du nombre de tâches et de robots supportés, ainsi que des essais en environnement réel au-delà du bassin contrôlé.

RecherchePaper
1 source