Aller au contenu principal
RecherchearXiv cs.RO 

AquaCap : un agent incarné sous-marin sans entraînement, piloté par du code comme politique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

AquaCap est un agent robotique sous-marin capable de naviguer et de manipuler des objets de façon autonome sans aucun entraînement préalable ni mise à jour de paramètres, selon le principe dit "Code-as-Policy" décrit dans un article mis en ligne sur arXiv en septembre 2026 (référence 2609.23133). Le système repose sur une architecture à deux niveaux qui traduit les instructions de tâche et les observations de l'environnement en plans adaptés aux conditions rencontrées et en programmes de contrôle directement exécutables. Une couche de perception structurée lui fournit des informations sémantiques, géométriques et évaluées en fiabilité malgré la dégradation typique des images sous l'eau, tandis qu'une mémoire sensible aux échecs diagnostique les actions ratées et déclenche une replanification en boucle fermée avec révision du code généré. En simulation, AquaCap atteint un taux de réussite de 66,43%. Des essais réels avec un véhicule télé-opéré (ROV) ont démontré des saisies et transports d'objets autonomes, y compris la récupération de cibles déplacées par des courants hydrodynamiques.

Cette approche cible un verrou spécifique du secteur : contrairement à la robotique terrestre, qui alimente ses modèles vision-langage-action avec des volumes massifs de données de téléopération, la robotique sous-marine ne peut pas répliquer cette stratégie, chaque campagne de collecte en mer ou en bassin restant coûteuse et rare. En s'appuyant sur la génération de code plutôt que sur l'apprentissage de bout en bout, AquaCap s'adapte en ligne sans réentraînement, ce qui intéresse directement les intégrateurs d'AUV et de ROV pour l'inspection offshore, l'aquaculture ou la maintenance sous-marine. Le taux de succès de 66,43% en simulation, nettement en dessous des standards affichés par les meilleurs systèmes VLA terrestres, rappelle toutefois que l'écart entre démonstration et fiabilité opérationnelle reste large sous l'eau.

AquaCap prolonge les architectures "Code-as-Policy", qui font générer par des modèles de langage du code de contrôle exécutable plutôt que des politiques apprises par renforcement, une piste déjà explorée en robotique terrestre mais encore rare en milieu marin. Le résumé ne mentionne aucune affiliation industrielle ni partenaire commercial, ce qui situe le projet comme une recherche académique et non comme un produit prêt à déployer. Les démonstrations réelles se limitent pour l'instant à un seul ROV et à des tâches de préhension et de transport, sans calendrier de déploiement annoncé. La prochaine étape attendue pour ce type de système serait une validation sur davantage de plateformes et en conditions océaniques réelles, au-delà des bassins contrôlés, avant toute adoption par des opérateurs d'inspection sous-marine ou de robotique offshore.

À lire aussi

OceanGym : un environnement de référence pour les agents incarnés sous-marins
1arXiv cs.RO 

OceanGym : un environnement de référence pour les agents incarnés sous-marins

Des chercheurs du projet OceanGPT ont publié en septembre 2025 sur arXiv (article 2509.26536, version 3) OceanGym, présenté comme le premier benchmark complet pour les agents incarnés évoluant en environnement océanique sous-marin. La plateforme couvre huit domaines de tâches réalistes et repose sur un framework d'agent unifié piloté par des modèles de langage multimodaux de grande taille (MLLM), combinant perception, mémoire et prise de décision séquentielle. Les agents testés doivent interpréter à la fois des données optiques et sonar, explorer de façon autonome des environnements complexes et mener à bien des objectifs à long horizon, dans des conditions marquées par une faible visibilité et des courants océaniques dynamiques. Le code et les données du benchmark sont mis à disposition sur GitHub, sous l'organisation OceanGPT. Les expériences menées par les auteurs montrent un écart substantiel entre les agents MLLM les plus avancés et des experts humains sur les tâches de perception, de planification et d'adaptation en milieu sous-marin, un constat qui tranche avec le discours ambiant sur la maturité des agents vision-langage-action. Pour l'industrie des véhicules sous-marins autonomes (AUV) et des ROV, ce résultat confirme que l'environnement océanique reste nettement plus exigeant que les domaines terrestre ou aérien, où des benchmarks d'agents incarnés existent déjà depuis plusieurs années. OceanGym fournit ainsi aux équipes de recherche et aux intégrateurs un outil d'évaluation standardisé pour mesurer les progrès réels des agents avant tout déploiement physique, plutôt que de se fier à des démonstrations isolées. Le milieu sous-marin figure, selon les auteurs, parmi les dernières frontières inexplorées de la Terre. Jusqu'ici, l'essentiel des benchmarks d'IA incarnée portait sur des environnements terrestres ou aériens, structurés et bien cartographiés, laissant un vide pour les usages océaniques. OceanGym s'inscrit dans la continuité du projet OceanGPT, dont l'équipe avait déjà développé des modèles de langage dédiés aux sciences océaniques, et prolonge cette démarche vers l'évaluation d'agents capables d'agir physiquement sous l'eau. Les auteurs présentent ce travail comme une étape vers le transfert de ces capacités à de véritables véhicules sous-marins autonomes déployés en conditions réelles, sans toutefois communiquer de calendrier de pilote ni de partenariat industriel à ce stade: le projet reste pour l'instant au niveau de la recherche académique en accès ouvert plutôt que du produit commercial.

RecherchePaper
1 source
PhysCaP : ancrer un agent de code-comme-politique par exploration guidée par la physique
2arXiv cs.RO 

PhysCaP : ancrer un agent de code-comme-politique par exploration guidée par la physique

Des chercheurs ont présenté PhysCaP, un agent « code-as-policy » pour la manipulation robotique, dans un article publié sur arXiv (2608.21031) accompagné d'une page projet à physcap.github.io. Contrairement aux politiques vision-langage-action qui imitent des démonstrations par observation passive, PhysCaP ajoute une couche d'exploration physique permettant au robot de chercher activement l'information par l'interaction, grâce à des modules d'extraction sans capteur additionnel qui estiment la masse et la rigidité des objets à partir de la seule proprioception du bras. Son architecture combine un Planner, qui décide quand explorer et quand s'arrêter, et un Prioritizer, qui filtre les interactions peu plausibles et classe les autres selon un score de priorité heuristique. Les auteurs l'ont testé sur des tâches réelles de manipulation sur table (recherche d'objets cachés, détection de canettes vides, repérage d'avocats mûrs) ainsi que sur une tâche simulée dans l'environnement LIBERO. Les approches passives échouent dès que la propriété physique déterminante reste invisible à la caméra, tandis que les méthodes interactives naïves multiplient les manipulations inutiles: PhysCaP obtient des performances comparables avec moins d'interactions et un temps d'exécution réduit. Pour les intégrateurs qui travaillent avec des modèles VLA comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), ce résultat pointe une limite connue de l'imitation pure: elle ne suffit pas quand la tâche dépend de propriétés cachées comme le poids ou la texture d'un objet, ce qui nuance l'idée que le sim-to-real ou l'apprentissage par démonstration seuls résolvent la perception robotique générale. Une couche d'exploration physique ciblée, plutôt qu'une exploration exhaustive coûteuse en temps de cycle, pourrait ainsi devenir un composant utile des piles de perception active pour le tri, le contrôle qualité ou la préhension en environnement non structuré. Ce travail s'inscrit dans la lignée des approches combinant grands modèles et génération de code de politique robotique, un axe distinct des politiques VLA de bout en bout qui dominent la communication du secteur. Il s'agit d'une contribution de recherche académique et non d'un produit commercial ou d'un déploiement industriel: les auteurs valident leurs modules par des études d'ablation et mettent code et démonstrations à disposition sur la page projet, sans partenaire industriel, pilote annoncé ni calendrier de commercialisation à ce stade.

RecherchePaper
1 source
Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique
3arXiv cs.RO 

Au-delà des politiques simples : post-entraînement hiérarchique pour agents incarnés en manipulation robotique

Un preprint publié sur arXiv (2608.05999v1) présente HiRoC (Hierarchical Robotic Control), un cadre de post-entraînement hiérarchique pour les modèles vision-langage-action (VLA) en manipulation robotique. Le principe : séparer la planification de haut niveau de l'exécution des actions. Un module planificateur décompose une tâche complexe en sous-objectifs exécutables, tandis qu'un module exécuteur affine en continu la génération d'actions conditionnées à ces sous-objectifs par apprentissage par renforcement (RL). Avant cette phase de RL, les auteurs alignent d'abord l'exécuteur sur les sous-objectifs du planificateur, pour corriger le désalignement de distribution qui apparaît habituellement entre planification et exécution. Testé sur plusieurs benchmarks de manipulation, HiRoC surpasse de façon constante les méthodes de référence. Le problème est concret : la plupart des méthodes de post-entraînement traitent les VLA comme des politiques plates, ce qui limite la modélisation de la progression d'une tâche et la robustesse sur des manipulations à long horizon. Les approches hiérarchiques existantes reposaient surtout sur de l'apprentissage supervisé à partir de démonstrations hors ligne, sans capacité à s'améliorer par interaction en ligne. En combinant hiérarchie et RL, HiRoC permet au comportement du robot de continuer à s'affiner après l'entraînement initial plutôt que de rester figé aux données de démonstration. Pour les équipes de recherche et les intégrateurs, cela touche une question centrale du secteur : la capacité réelle des VLA à tenir des tâches multi-étapes sans dérive, point faible connu des politiques de bout en bout entraînées uniquement par imitation. Ce travail s'inscrit dans la vague des modèles VLA qui s'appuient sur des modèles vision-langage pré-entraînés pour piloter des bras ou des robots, une approche qui a gagné du terrain ces deux dernières années face aux politiques de contrôle entraînées de zéro. L'article ne mentionne ni déploiement sur robot physique hors simulation, ni partenariat industriel, ni concurrent commercial nommé : il s'agit d'une contribution méthodologique côté recherche. La suite logique passe généralement, pour ce type de méthode, par une validation sur des plateformes robotiques réelles et une comparaison directe avec les cadres hiérarchiques concurrents déjà publiés, un exercice que ce préprint ne couvre pas encore.

RechercheOpinion
1 source
Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement
4arXiv cs.RO 

Auto-évolution d'agents incarnés par évolution de compétences en environnement d'entraînement

Un article publié sur arXiv (2608.11350v1, catégorie "cross-listing", 13 août 2026) présente SHAPER, un cadre pour l'adaptation sans entraînement d'agents incarnés (embodied agents) construits autour de modèles de fondation. Le principe : les poids du modèle restent figés, et c'est la couche non paramétrique autour de lui, compétences réutilisables et "harnais" de contexte-code, qui évolue via des essais répétés (rollouts) dans l'environnement cible. Le même modèle figé joue à la fois le rôle de planificateur et d'optimiseur, affinant ses compétences externes sans aucune mise à jour de paramètres. Les auteurs évaluent SHAPER sur deux bancs d'essai, VLABench et ESI-Bench, qui couvrent des agents disposant d'interfaces d'action bas niveau différentes, et comparent les résultats à l'exécution pure, au fine-tuning supervisé (SFT) et à des méthodes de mise à l'échelle au moment du test comme la sélection sans vérificateur et le vote. L'enjeu pour l'industrie robotique est concret. Le fine-tuning supervisé et l'apprentissage par renforcement exigent des données, des fonctions de récompense et des cycles d'entraînement coûteux ; à l'inverse, les approches sans entraînement centrées sur le code s'appuient d'ordinaire sur des API robotiques programmables, souvent absentes des systèmes à interface fixe. SHAPER propose une troisième voie, faire évoluer les compétences et le harnais logiciel plutôt que le modèle lui-même, ce qui intéresserait particulièrement les intégrateurs qui ne peuvent pas se permettre de réentraîner un modèle à chaque nouvel environnement de déploiement. Les résultats restent toutefois issus de bancs d'essai simulés, pas de déploiements sur robots physiques : c'est une preuve de concept méthodologique, pas encore une validation terrain. Ce travail s'inscrit dans une tendance plus large où la performance des agents incarnés dépend autant du harnais d'exécution, compétences, contexte, interfaces d'action, que des poids du modèle sous-jacent. Il se positionne explicitement entre deux familles d'approches existantes : le fine-tuning et le RL d'un côté, gourmands en données et en calcul, et les approches code-centric sans entraînement de l'autre, limitées par leur dépendance à des API robotiques programmables. L'article ne mentionne ni partenariat industriel ni plateforme robotique commerciale associée ; la suite logique serait une validation sur robots réels pour vérifier si les gains observés sur VLABench et ESI-Bench se transposent hors simulation.

RecherchePaper
1 source