Aller au contenu principal
CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine
RecherchearXiv cs.RO 

CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente CoralPlan, un système vision-langage conçu pour l'inspection robotique sous-marine de colonies coralliennes, décrit dans un preprint publié sur arXiv (2609.31211v1). Le système sélectionne une compétence d'observation à partir d'une image de caméra courante et d'une consigne textuelle fournie par un "manifeste d'épisode". Une interface de mouvement commune exécute ensuite trois primitives de trajectoire relatives à la cible, orbite, patch ou survey (balayage), les autres champs du plan servant de guide pour l'opérateur humain. Deux critères de succès sont définis: la complétion de l'observation, qui exige le maintien de la cible dans le champ et une couverture propre à chaque primitive, et le succès conjoint, qui exige en plus que la compétence choisie corresponde à la référence enregistrée. Le système a été évalué sur 144 épisodes simulés et 36 paires appariées simulation-matériel, réalisées dans une piscine à eau claire avec des poses de référence de cible mesurées par un système externe. Sur matériel réel, le taux de complétion d'observation atteint 77,8% et le taux de succès conjoint 63,9%.

Ce travail illustre un enjeu concret pour les opérateurs de robotique sous-marine (inspection de récifs, aquaculture, infrastructures immergées) : reconnaître une cible ne suffit pas, le robot doit aussi choisir le bon type de mouvement d'observation selon la tâche demandée, une décision jusqu'ici largement câblée en dur dans les trajectoires pré-programmées des AUV et ROV. En étendant les systèmes vision-langage-action, jusqu'ici concentrés sur la manipulation et les humanoïdes terrestres, au cadrage caméra sous-marin, l'étude teste la portée de cette approche hors de son terrain habituel. L'écart entre les 144 épisodes simulés et les seules 36 paires testées sur matériel, ainsi que la chute du taux de succès conjoint à 63,9% par rapport à la complétion d'observation à 77,8%, rappelle que le passage de la simulation au réel reste un point de friction, même pour une tâche de perception plutôt que de manipulation fine. Les auteurs documentent eux-mêmes des cas d'échec, complétions ne correspondant pas à la référence ou observations incomplètes malgré une sélection de compétence correcte, une transparence qui tranche avec l'emphase habituelle des annonces du secteur.

La surveillance automatisée des récifs coralliens gagne en importance face à leur dégradation, mais les robots sous-marins existants suivent le plus souvent des trajectoires fixes plutôt que des mouvements d'observation adaptés à la tâche. CoralPlan s'inscrit dans la vague plus large des modèles vision-langage-action appliqués jusqu'à présent surtout à la manipulation robotique terrestre, en la transposant à des décisions de cadrage caméra sur une plateforme non humanoïde évoluant en milieu aquatique. Il s'agit d'un travail de recherche publié en preprint, non encore relu par les pairs, testé en piscine à eau claire et non lors de déploiements réels sur récif, ce qui limite pour l'instant sa portée à une preuve de concept en conditions contrôlées. Les auteurs pointent eux-mêmes les cas où la sélection correspond à la référence sans que l'observation soit complète, ouvrant la voie à des travaux futurs visant à combler cet écart avant d'envisager des essais en eau trouble ou sur site naturel.

À lire aussi

Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation
1arXiv cs.RO 

Singe voit, singe fait ? Un benchmark pour évaluer l'apprentissage de compétences robotiques par observation

Une équipe de recherche a déposé sur arXiv, sous la référence 2609.08209 (version 2, remplaçant une publication antérieure), un article présentant RoboReel, un benchmark unifié destiné à évaluer les modèles qui apprennent des politiques de manipulation robotique par observation de vidéos humaines. Le jeu de données regroupe des vidéos de démonstrations humaines réelles, des trajectoires robotiques simulées et des environnements d'évaluation couvrant dix tâches de manipulation. Les auteurs ont conçu quatre suites de tests distinctes, mesurant notamment la robustesse des modèles face aux distracteurs visuels et leur capacité à mener à bien des tâches longues comportant plusieurs étapes. Le benchmark compare plus de sept algorithmes de l'état de l'art en apprentissage par observation (Learning from Observation, LfO), dont des variantes fondées sur des modèles vision-langage-action (VLA) développées par les auteurs eux-mêmes, ainsi que plusieurs choix de représentation des données d'entrée. Le code, les vidéos et la documentation du projet sont mis à disposition sur roboreel.github.io. Cette initiative répond à un problème concret pour le secteur robotique: l'apprentissage à partir de vidéos humaines est présenté depuis plusieurs années comme un moyen de contourner la pénurie de données d'entraînement, la collecte de démonstrations téléopérées restant lente et coûteuse à grande échelle. Or les auteurs constatent que les méthodes publiées jusqu'ici reposent sur des hypothèses, du matériel et des protocoles d'évaluation si divergents qu'il devient impossible de comparer réellement les progrès revendiqués d'un papier à l'autre, un problème classique de fragmentation méthodologique dans un champ en expansion rapide. Plus significatif pour les intégrateurs et décideurs du secteur, l'analyse comparative montre que les tâches à long horizon et celles exigeant une faible tolérance d'erreur restent difficiles pour l'ensemble des modèles testés, quelle que soit leur architecture. Ce constat tempère l'idée selon laquelle l'apprentissage par vidéo suffirait à produire des compétences de manipulation robustes à l'échelle industrielle, et invite à la prudence face aux démonstrations isolées mises en avant par certains laboratoires. RoboReel s'inscrit dans la continuité de travaux récents ayant montré des résultats prometteurs pour l'apprentissage de compétences de manipulation à partir de vidéos humaines, sans télé-opération ni collecte de données directement sur le robot cible, une piste explorée par de nombreux laboratoires académiques et industriels de la robotique manipulatrice. Faute de cadre d'évaluation commun, ces travaux restaient difficiles à situer les uns par rapport aux autres, chaque équipe validant ses résultats sur son propre environnement et son propre matériel. En proposant un socle partagé de dix tâches, de vidéos et de trajectoires simulées librement réutilisables, les auteurs visent à doter le champ du LfO d'un outil de comparaison équivalent à ceux qui existent déjà pour d'autres sous-domaines de l'apprentissage robotique. La publication met le code et les données à disposition de la communauté via la page du projet, sans annoncer à ce stade de déploiement industriel ni de partenariat commercial associé.

RecherchePaper
1 source
COFFAIL : un jeu de données sur les succès et anomalies d'exécution de compétences robotiques pour la préparation du café
2arXiv cs.RO 

COFFAIL : un jeu de données sur les succès et anomalies d'exécution de compétences robotiques pour la préparation du café

L'équipe derrière COFFAIL a publié sur arXiv (référence 2604.18236) un jeu de données consacré à l'apprentissage de compétences robotiques de manipulation, collecté dans un environnement cuisine avec un robot physique. Le dataset couvre plusieurs types de tâches liées à la préparation de café et se distingue par une caractéristique rare dans la littérature : il regroupe à la fois des épisodes d'exécution réussis et des épisodes anomaux, c'est-à-dire des séquences où quelque chose s'est mal passé. Certains épisodes mobilisent une manipulation bimanuell, impliquant la coordination des deux bras du robot. Les auteurs démontrent l'usage concret du dataset en entraînant une politique robotique par imitation learning (apprentissage par démonstration). Ce qui distingue COFFAIL des datasets de manipulation habituellement disponibles, c'est l'inclusion explicite des échecs et des anomalies. La grande majorité des benchmarks publics ne documentent que les trajectoires réussies, ce qui crée un biais structurel dans l'entraînement des modèles : les robots apprennent à réussir, mais pas à détecter ni à récupérer d'une défaillance. Pour les intégrateurs industriels et les équipes de recherche travaillant sur la robustesse et la détection d'anomalies en manipulation, disposer d'exemples négatifs annotés est une ressource directement exploitable, notamment pour entraîner des modules de supervision ou de re-planification. L'application à l'imitation learning suggère aussi une compatibilité avec les architectures VLA (vision-language-action) actuelles. La préparation de café comme domaine applicatif est un choix délibéré dans la robotique de service : c'est une tâche suffisamment structurée pour être reproductible, mais qui implique des objets déformables, des liquides, et des contraintes temporelles, ce qui en fait un banc de test représentatif pour la manipulation fine. Plusieurs labos et startups ont utilisé des scénarios similaires pour tester leurs pipelines, dont Physical Intelligence (pi0), Everyday Robots (avant sa dissolution chez Google) ou des équipes académiques européennes. COFFAIL reste pour l'instant une contribution de dataset sans benchmarking comparatif avec d'autres méthodes, ce qui limite la portée des conclusions : le papier est court et déclaré comme tel par les auteurs. Les prochaines étapes naturelles seraient une évaluation comparative sur des tâches de détection d'anomalies et une extension du protocole à d'autres domaines de manipulation.

UELes équipes de recherche européennes en manipulation robotique peuvent exploiter ce dataset pour entraîner des modules de détection d'anomalies, mais aucun acteur FR/EU n'est directement impliqué dans sa production.

RecherchePaper
1 source
Optimisation d'orientation en espace articulaire sous contraintes d'observation pour l'inspection robotisée de cavités cylindriques
3arXiv cs.RO 

Optimisation d'orientation en espace articulaire sous contraintes d'observation pour l'inspection robotisée de cavités cylindriques

Des chercheurs publient sur arXiv (référence 2608.16442v1) une méthode d'inspection robotique entièrement autonome pour observer le fond de cavités cylindriques, un scénario de référence tiré des protocoles ASTM utilisés pour évaluer les robots d'intervention en recherche et sauvetage. Plutôt que d'imposer une pose de caméra cartésienne unique, souvent rejetée pour cause de limites articulaires ou de risques de collision, le système représente l'objectif d'inspection comme un ensemble de géométries de vue valides, directement dans l'espace des configurations articulaires du robot. Un module de perception RGB estime le centre de l'ouverture et l'axe de la cavité à partir de masques sémantiques, en combinant ajustement d'ellipse par arcs et indices géométriques du corps et des bords. Ces estimations contraignent l'alignement de l'axe caméra, le décalage latéral et la distance axiale. Une recherche multistart sans dérivées optimise ensuite les configurations articulaires selon une priorité lexicographique : satisfaction des contraintes d'abord, puis économie de mouvement, marge articulaire et qualité de vue. Un planificateur tenant compte des collisions valide les candidats, et la pose finale est vérifiée géométriquement et par lancer de rayons. Dans le simulateur Isaac Sim, la méthode réussit 92 configurations cibles sur 100, avec une visibilité moyenne du fond de 91,65%, contre 76 sur 100 et 84,3% pour une méthode de référence par recherche par coordonnées multistart. Des essais complémentaires ont été menés sur table et sur un bras monté sur le robot quadrupède Unitree A2. Pour les intégrateurs de robots d'inspection, l'enjeu est concret : de nombreuses poses caméra théoriquement idéales restent inatteignables à cause des limites cinématiques du bras ou des collisions avec l'environnement, ce qui fait échouer les approches à pose unique. En reformulant l'objectif comme un ensemble de géométries acceptables en espace articulaire, la méthode gagne 16 points de réussite par rapport à une recherche multistart classique, un progrès notable pour l'inspection de canalisations, de cuves industrielles ou de puits en contexte de recherche et sauvetage. Ancré dans les benchmarks ASTM, référence reconnue pour qualifier les robots de réponse d'urgence, le résultat a une valeur comparative au-delà du simple laboratoire. L'étude montre surtout que le goulot d'étranglement n'est pas la perception seule mais l'articulation entre perception, planification de mouvement et contraintes physiques du robot, un enseignement transposable à d'autres tâches d'inspection à géométrie contrainte. Ce travail s'inscrit dans la lignée des recherches sur la planification de vue et l'inspection robotique autonome, domaine où les protocoles ASTM servent de référence commune pour comparer les systèmes indépendamment des plateformes matérielles. La comparaison directe avec une recherche par coordonnées multistart positionne l'apport comme une amélioration incrémentale mais mesurable d'une famille d'approches existantes plutôt qu'une rupture méthodologique. La validation en trois étapes, simulation Isaac Sim, essai de table, puis montage sur un bras porté par le quadrupède Unitree A2, vise à démontrer la portabilité de la méthode entre plateformes avant un déploiement terrain plus large. Les auteurs ne communiquent pas encore de calendrier pour des essais en conditions réelles de recherche et sauvetage ni pour une intégration dans des flottes de robots d'intervention existantes.

RecherchePaper
1 source
Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène
4arXiv cs.RO 

Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène

Les chercheurs proposent un nouveau cadre pour l'exécution robotique s'appuyant sur des modèles fondamentaux hébergés dans le cloud, dans des environnements où la connectivité sans fil varie fortement selon la position du robot. Le problème posé est concret : un robot exécute une primitive de mouvement générée à distance, et doit recevoir la suivante avant d'épuiser la marge de manœuvre de la primitive en cours. Or la qualité de connexion nécessaire pour envoyer une requête et récupérer la réponse dépend de l'endroit où se trouve le robot, pas seulement du temps de latence du réseau. Les auteurs introduisent la notion de "fenêtre requête-réponse", qui intègre le temps de transmission montante, l'inférence cloud, la récupération descendante et l'incertitude d'inférence. Sur cette base, et à partir d'une carte de communication de l'environnement, le système choisit dynamiquement un point d'envoi de requête pendant l'exécution de la primitive en cours, puis guide le robot vers ce point via un planificateur local avant de reprendre sa tâche. Les tests, menés dans un scénario intérieur construit à partir de mesures radio réelles, montrent que la méthode obtient le meilleur taux de réussite de tâche (ou ex æquo) parmi les approches comparées, avec moins de tentatives de requête et un taux d'échec de requête plus faible. L'enjeu dépasse la démonstration académique : il touche directement à la viabilité des architectures robotiques qui délèguent le raisonnement sémantique lourd à des modèles cloud plutôt que de tout embarquer, une tendance de fond dans la robotique VLA (vision-language-action) actuelle. Jusqu'ici, la plupart des optimisations de latence réseau traitaient la transmission comme un problème purement temporel, en ignorant que la position physique du robot détermine si une requête peut même aboutir. En traitant le point de requête comme une décision de mouvement à part entière, intégrée au planificateur local, les auteurs déplacent le problème de la couche réseau vers la couche de contrôle du robot. Pour les intégrateurs qui envisagent des flottes robotiques dépendantes du cloud dans des entrepôts, usines ou espaces publics où la connectivité Wi-Fi ou 5G est hétérogène, cela offre une piste concrète pour réduire les échecs de tâche liés aux zones mortes, sans nécessiter une couverture réseau uniforme coûteuse. Ce travail s'inscrit dans la lignée des recherches sur le déchargement de calcul (offloading) pour la robotique cloud, un axe qui a pris de l'ampleur avec la multiplication des modèles fondamentaux trop volumineux pour tourner entièrement en embarqué, à l'image des architectures VLA de type GR00T ou Helix évoquées dans l'industrie humanoïde. Contrairement aux approches qui se concentrent uniquement sur la compression de modèle ou la réduction de latence par transmission optimisée, cette étude aborde le problème sous l'angle de la planification spatiale de la communication elle-même. L'article, déposé sur arXiv (2606.31497v1), ne précise pas de partenariat industriel ni de déploiement réel au-delà du banc de test indoor basé sur des mesures de terrain ; il s'agit à ce stade d'une contribution méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques réelles opérant dans des environnements de connectivité variable, comme des entrepôts logistiques ou des sites industriels multi-étages.

RecherchePaper
1 source