Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage par renforcement sim-vers-réel pour véhicules de surface autonomes avec identification de système

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent un simulateur et une chaîne d'entraînement destinés aux navires de surface autonomes (ASV), publiés sur arXiv (2610.12202). Le travail vise à entraîner par apprentissage par renforcement (RL) des politiques de contrôle pour le suivi de trajectoire et le maintien de position (station keeping), en partant d'une dynamique de véhicule inconnue. La méthode n'exige qu'un modèle CAD et un court jeu de trajectoires relevées en eau libre. Ces données servent à approximer puis à affiner les paramètres hydrodynamiques et ceux des propulseurs, par identification de système (SysID). Les auteurs rapportent un transfert zéro-shot du simulateur vers le réel sur un ASV BlueBoat, sur les deux tâches, sans connaissance préalable de l'hydrodynamique ni des hélices. L'abstract ne donne ni taux de réussite, ni erreurs de suivi, ni durée des essais, ni nombre de trajectoires nécessaires à l'identification.

L'intérêt tient à la barrière que ce travail cherche à lever. Les simulateurs d'ASV existants gèrent rarement les environnements parallèles, indispensables pour entraîner des politiques RL à grande échelle. Ils réclament aussi des paramètres hydrodynamiques précis, issus de solveurs de mécanique des fluides numérique (CFD) ou d'essais en bassin de traction, deux étapes coûteuses et longues. Si le résultat se confirme, un intégrateur pourrait déployer un contrôleur appris sur une coque nouvelle ou modifiée après quelques sorties en mer, sans campagne de caractérisation. Cela renforcerait l'idée que le sim-to-real passe par une identification légère plutôt que par une modélisation exacte. Les réserves sont nettes: la validation semble porter sur une seule plateforme, la BlueBoat, petite et de recherche, et l'abstract ne mentionne aucun test sous vent, vagues ou courants marqués. Ces conditions sont pourtant le cœur des « environnements marins dynamiques » invoqués. Sans métriques chiffrées ni comparaison annoncée avec un contrôleur classique de type PID, l'avantage du RL reste à démontrer.

Ce travail s'inscrit dans la tendance du RL massivement parallèle, popularisée en robotique terrestre par des simulateurs GPU, qui a peu atteint le domaine maritime faute d'outils adaptés. La BlueBoat, plateforme compacte de Blue Robotics, est répandue dans la recherche et l'inspection, ce qui facilite la reproduction. L'approche rejoint les travaux de calibration de simulateurs à partir de données réelles, déjà courants pour les drones et les robots à pattes. La suite logique serait un test sur des coques plus grandes, en conditions de mer difficiles, et une publication du code ou du simulateur. L'abstract n'annonce ni pilote industriel ni calendrier. Il s'agit donc d'un résultat de recherche et non d'un produit disponible.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels
1arXiv cs.RO 

Ce qui compte pour le transfert de l'apprentissage par renforcement en simulation vers l'apprentissage en ligne sur des robots réels

Une étude empirique menée sur trois plateformes robotiques distinctes a testé l'apprentissage par renforcement (RL) en ligne directement sur des robots physiques, à travers 100 sessions d'entraînement réelles. Les chercheurs ont systématiquement isolé les choix de conception algorithmiques, matériels et expérimentaux habituellement laissés implicites dans les travaux précédents sur le sujet. Résultat principal : certains réglages par défaut largement utilisés dans la pratique du RL se révèlent contre-productifs sur du matériel réel, tandis qu'un ensemble restreint de choix de conception robustes, faciles à adopter dans le cadre standard du RL, permet d'obtenir un apprentissage stable sur différentes tâches et différents types de robots. Il s'agit, selon les auteurs, de la première étude empirique à grande échelle de ce type portant sur ces choix de conception. Cette cartographie répond à un point de friction bien identifié chez les intégrateurs et équipes de recherche robotique : le RL en ligne sur robot réel reste réputé fragile, coûteux en ingénierie et peu reproductible d'une plateforme à l'autre, ce qui pousse la majorité des équipes vers l'apprentissage en simulation (sim-to-real) ou l'imitation à partir de démonstrations. En identifiant quels réglages par défaut nuisent réellement à l'apprentissage et lesquels le stabilisent, ce travail réduit potentiellement l'effort d'ingénierie nécessaire pour déployer du RL en ligne directement sur du hardware, sans passer par un simulateur intermédiaire. C'est un signal utile pour évaluer si le RL en ligne peut devenir une option pratique face aux architectures VLA (vision-langage-action) qui dominent actuellement la communication du secteur, en offrant une alternative plus frugale en données de démonstration. Le papier s'inscrit dans une lignée de travaux cherchant à combler l'écart entre les promesses du RL en robotique, démontrées depuis longtemps en simulation, et sa fiabilité en conditions réelles, où le coût d'échantillonnage et les risques matériels limitent les expérimentations à grande échelle. Contrairement aux annonces de plateformes humanoïdes commerciales, ce travail relève de la recherche fondamentale reproductible, avec des ablations systématiques plutôt qu'une démonstration ponctuelle. Publié sur arXiv en tant que version révisée ("replace"), il ouvre la voie à des protocoles standardisés que d'autres laboratoires pourront reprendre et à des comparaisons futures avec des approches sim-to-real ou par imitation sur les mêmes tâches.

RecherchePaper
1 source
2arXiv cs.RO 

Conception de trajectoires à découplage informationnel pour l'identification de systèmes sim-vers-réel

Des chercheurs proposent l'Informationally Decoupled Trajectory Design (IDTD), un cadre de conception de trajectoires d'exploration pour l'identification de système en simulation vers réel (arXiv 2610.10905). L'identification par échantillonnage ajuste un simulateur pour qu'il reproduise la dynamique du système cible, ce qui fournit des paramètres physiques interprétables et améliore le transfert sim-to-real. Le problème apparaît quand les trajectoires collectées ne distinguent pas les effets de paramètres différents: plusieurs combinaisons peuvent alors expliquer les mêmes données, et les estimations deviennent peu fiables. IDTD construit l'objectif de la politique d'exploration à partir du score du complément de Schur, dérivé de la matrice d'information de Fisher. Le score est normalisé par l'information propre à chaque paramètre, le meilleur segment de trajectoire est retenu pour chacun d'eux, puis les scores sont agrégés par un logarithme. La trajectoire optimisée se compose ainsi d'intervalles complémentaires, chacun révélant un sous-ensemble de paramètres dont la contribution au mouvement peut être attribuée sans ambiguïté. Les tests couvrent plusieurs environnements simulés, d'un système linéaire simple au quadrupède Go2, à l'humanoïde G1 et au quadrirotor Crazyflie. L'erreur d'identification des paramètres diminue en moyenne de 39,6 % par rapport à la meilleure méthode d'exploration active antérieure, et le transfert de politique en aval s'améliore. Les auteurs valident aussi la conception de trajectoires sur un humanoïde K1 réel: les paramètres identifiés reflètent fidèlement la dynamique du système physique. Le résumé ne précise ni le nombre de paramètres estimés, ni les baselines exactes, ni l'ampleur du gain de transfert, et la validation matérielle ne porte que sur une plateforme. Il s'agit de résultats de recherche, sans produit ni déploiement. L'enjeu est pratique pour les équipes qui entraînent des politiques de locomotion ou de manipulation en simulation. Le sim-to-real reste un goulet d'étranglement: la randomisation de domaine contourne l'erreur de modèle sans la corriger, alors que l'identification explicite offre des paramètres interprétables, mais seulement si les données les distinguent. En traitant la conception de l'excitation comme un problème de séparabilité des paramètres, IDTD cible une cause de dérive souvent invisible, des paramètres compensés les uns par les autres. Pour un intégrateur, cela peut réduire le temps de calibration d'un robot neuf et rendre les jumeaux numériques plus fiables. L'approche s'applique à des morphologies variées, des drones aux humanoïdes, ce qui suggère une méthode générique plutôt qu'un réglage propre à une plateforme. Le gain moyen de 39,6 % est mesuré surtout en simulation, et l'écart avec la robustesse réelle reste à démontrer à plus grande échelle. Ce travail s'inscrit dans la lignée de l'identification optimale par information de Fisher, issue de la théorie du contrôle, et des méthodes d'exploration active récentes qui l'étendent aux robots appris. Le choix du G1 d'Unitree, du Go2 et du K1 reflète la place prise par les plateformes humanoïdes et quadrupèdes abordables dans la recherche, car elles permettent des validations matérielles à faible coût. Aucune suite n'est annoncée dans le résumé, mais les extensions logiques sont des essais sur davantage de robots réels, des tâches de manipulation et l'intégration dans des chaînes d'entraînement de politiques à grande échelle, là où la qualité du simulateur conditionne directement le résultat.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
AquaOrbit : apprentissage par renforcement simulation-réel pour l'orbite autour d'une cible sous-marine avec retour visuel intermittent
3arXiv cs.RO 

AquaOrbit : apprentissage par renforcement simulation-réel pour l'orbite autour d'une cible sous-marine avec retour visuel intermittent

Des chercheurs ont publié le 22 septembre 2026 sur arXiv (2609.24054) une étude présentant AquaOrbit, un contrôleur par apprentissage par renforcement pour faire orbiter un robot sous-marin autour d'une cible malgré des pertes intermittentes de flux visuel. Un module de récupération exploite, lors d'une perte de détection, des références figées de ligne de visée, de roulis et de profondeur pour stabiliser le véhicule et retrouver la cible. Entraîné dans le simulateur Isaac Sim avec randomisation de la dynamique, des observations et des pertes de vision, le contrôleur a ensuite été évalué sans réentraînement dans Gazebo/ROS2, un moteur physique différent : 20 essais réussis sur 20 en cible statique comme en cible mobile, sur une trajectoire 3D à profondeur variable inédite. Face à une cible mobile, l'erreur moyenne de ligne de visée baisse d'environ 46% par rapport à un contrôleur PID de servovision équipé du même module, pour une précision de trajectoire comparable ; sans ce module, la réussite chute à 9 essais sur 20. Un déploiement physique zero-shot, perception et contrôle entièrement embarqués, a suivi des trajectoires elliptiques, en huit et circulaires à profondeur variable, avec stabilité maintenue lors d'occlusions manuelles jusqu'à 8 secondes et réacquisition de cible en 2,5 secondes. Pour les intégrateurs de véhicules sous-marins autonomes et les opérateurs d'inspection offshore (pipelines, coques, aquaculture), ce travail cible un point de friction concret : la perte de suivi visuel en virage serré ou en eau trouble fait généralement échouer l'orbitage automatisé. Le transfert simulation-vers-réel démontré sans réentraînement, y compris sur un moteur physique distinct de celui de l'entraînement, soutient l'idée que des politiques de RL peuvent généraliser au-delà du simulateur d'origine, un point encore débattu en robotique sous-marine où bruit acoustique et optique diffèrent fortement du monde simulé. L'écart chiffré entre configurations avec et sans module de récupération (20/20 contre 9/20) quantifie l'apport réel du mécanisme plutôt que de s'appuyer sur une vidéo sélective. Il s'agit d'une publication de recherche en preprint, sans entreprise ni produit commercial associé : un résultat scientifique, pas un déploiement industriel. Le travail se positionne face aux méthodes classiques de servovision visuelle par PID, utilisées comme référence de comparaison, et s'inscrit dans le mouvement plus large de transfert simulation-vers-réel déjà exploré pour des robots terrestres et aériens mais encore peu démontré pour l'orbitage sous-marin de cibles mobiles. Aucun acteur français ou européen n'apparaît dans cette étude. Les essais physiques réels, incluant des trajectoires absentes de l'entraînement, dépassent la simple démonstration en environnement contrôlé, mais aucun calendrier de transfert commercial ni volume de déploiement n'est communiqué à ce stade.

RecherchePaper
1 source
IA incarnée : locomotion des quadrupèdes par apprentissage par renforcement (sim-vers-réel dans Isaac Sim)
4arXiv cs.RO 

IA incarnée : locomotion des quadrupèdes par apprentissage par renforcement (sim-vers-réel dans Isaac Sim)

Une équipe de recherche présente un nouveau framework d'apprentissage par renforcement (RL) pour la locomotion de robots quadrupèdes, entraîné avec Isaac Sim et son framework compagnon Isaac Lab, les outils de simulation nouvelle génération de Nvidia. La particularité de l'approche est d'obtenir un transfert "zero-shot" du simulateur vers le robot physique, c'est-à-dire une politique de contrôle qui fonctionne directement sur le matériel réel sans réentraînement ni ajustement supplémentaire. Le système gère le contrôle corps entier (whole-body control) et a été validé expérimentalement sur le Unitree Go1, un quadrupède commercial largement utilisé en recherche. Les résultats montrent des performances de suivi de vitesse comparables à celles du contrôleur intégré d'origine du robot, tout en offrant une meilleure capacité de récupération face à de fortes perturbations externes. Le robot atteint des vitesses linéaires de 2,0 m/s et des vitesses angulaires de 1,8 rad/s. Les travaux sont publiés en preprint sur arXiv (2607.18135v1). L'enjeu central de ces travaux est l'écart sim-to-real, ce fossé de performance qui survient lorsqu'une politique entraînée en simulation échoue une fois déployée sur du matériel réel, faute de correspondre exactement à la physique, aux frottements ou aux latences du monde physique. Démontrer un transfert direct et robuste, avec en prime une meilleure résilience aux chocs qu'un contrôleur classique, renforce l'argument selon lequel le RL en simulation peut désormais produire des contrôleurs de locomotion fiables sans les cycles coûteux d'essais sur robot réel. Pour les équipes d'intégration robotique, cela réduit le temps et le risque associés au déploiement de nouveaux comportements locomoteurs, un point clé pour des usages industriels comme l'inspection ou la logistique en environnement accidenté. Le travail s'inscrit dans la transition des outils Nvidia pour la robotique, Isaac Sim et Isaac Lab succédant à l'ancien Isaac Gym, alors que la firme positionne sa pile de simulation aussi bien pour les quadrupèdes que pour les humanoïdes via ses initiatives GR00T. La communauté RL pour la locomotion inclut des acteurs comme l'ETH Zurich, ANYbotics ou Boston Dynamics, avec qui ces résultats sur Go1 offrent un point de comparaison direct. Les auteurs ouvrent la voie à une extension de la méthode vers d'autres plateformes robotiques.

RecherchePaper
1 source