Aller au contenu principal
RecherchearXiv cs.RO 

AquaOrbit : apprentissage par renforcement simulation-réel pour l'orbite autour d'une cible sous-marine avec retour visuel intermittent

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié le 22 septembre 2026 sur arXiv (2609.24054) une étude présentant AquaOrbit, un contrôleur par apprentissage par renforcement pour faire orbiter un robot sous-marin autour d'une cible malgré des pertes intermittentes de flux visuel. Un module de récupération exploite, lors d'une perte de détection, des références figées de ligne de visée, de roulis et de profondeur pour stabiliser le véhicule et retrouver la cible. Entraîné dans le simulateur Isaac Sim avec randomisation de la dynamique, des observations et des pertes de vision, le contrôleur a ensuite été évalué sans réentraînement dans Gazebo/ROS2, un moteur physique différent : 20 essais réussis sur 20 en cible statique comme en cible mobile, sur une trajectoire 3D à profondeur variable inédite. Face à une cible mobile, l'erreur moyenne de ligne de visée baisse d'environ 46% par rapport à un contrôleur PID de servovision équipé du même module, pour une précision de trajectoire comparable ; sans ce module, la réussite chute à 9 essais sur 20. Un déploiement physique zero-shot, perception et contrôle entièrement embarqués, a suivi des trajectoires elliptiques, en huit et circulaires à profondeur variable, avec stabilité maintenue lors d'occlusions manuelles jusqu'à 8 secondes et réacquisition de cible en 2,5 secondes.

Pour les intégrateurs de véhicules sous-marins autonomes et les opérateurs d'inspection offshore (pipelines, coques, aquaculture), ce travail cible un point de friction concret : la perte de suivi visuel en virage serré ou en eau trouble fait généralement échouer l'orbitage automatisé. Le transfert simulation-vers-réel démontré sans réentraînement, y compris sur un moteur physique distinct de celui de l'entraînement, soutient l'idée que des politiques de RL peuvent généraliser au-delà du simulateur d'origine, un point encore débattu en robotique sous-marine où bruit acoustique et optique diffèrent fortement du monde simulé. L'écart chiffré entre configurations avec et sans module de récupération (20/20 contre 9/20) quantifie l'apport réel du mécanisme plutôt que de s'appuyer sur une vidéo sélective.

Il s'agit d'une publication de recherche en preprint, sans entreprise ni produit commercial associé : un résultat scientifique, pas un déploiement industriel. Le travail se positionne face aux méthodes classiques de servovision visuelle par PID, utilisées comme référence de comparaison, et s'inscrit dans le mouvement plus large de transfert simulation-vers-réel déjà exploré pour des robots terrestres et aériens mais encore peu démontré pour l'orbitage sous-marin de cibles mobiles. Aucun acteur français ou européen n'apparaît dans cette étude. Les essais physiques réels, incluant des trajectoires absentes de l'entraînement, dépassent la simple démonstration en environnement contrôlé, mais aucun calendrier de transfert commercial ni volume de déploiement n'est communiqué à ce stade.

À lire aussi

Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel
1arXiv cs.RO 

Fusion multimodale pour le transfert simulation-réel en apprentissage par renforcement visuel

Une équipe de recherche a soumis sur arXiv (identifiant 2507.09180, actuellement à la version 4) une architecture de fusion multimodale pour améliorer le transfert sim-to-real en apprentissage par renforcement visuel appliqué à la manipulation robotique. L'approche combine deux flux d'entrée, RGB et profondeur (depth), traités en parallèle par des réseaux convolutifs séparés (CNN stems), dont les représentations fusionnées sont transmises à un vision transformer (ViT) scalable. L'information de profondeur, naturellement robuste aux variations d'apparence de scène, fournit des détails spatiaux 3D absents des images RGB seules. Le pipeline intègre un schéma d'apprentissage contrastif à tokens masqués et non masqués pour améliorer l'efficacité d'échantillonnage, combiné à une randomisation de domaine progressive (curriculum-based domain randomization) pour stabiliser l'entraînement. En simulation, la méthode surpasse les baselines comparées. La validation clé se fait en transfert zéro-shot : sans ré-entraînement sur données réelles, le modèle réalise des tâches de manipulation physique. Le sim-to-real gap reste l'obstacle central en robotique d'apprentissage : les politiques entraînées en simulation échouent fréquemment face à la variabilité visuelle du monde réel. La fusion RGB + depth attaque directement ce problème en réduisant la dépendance aux indices visuels fragiles comme l'éclairage ou les textures. L'apprentissage contrastif à tokens partiels suggère une meilleure invariance aux perturbations apparentes sans nécessiter de volumes massifs de données réelles. Pour les intégrateurs industriels et les équipes de développement en manipulation, le transfert zéro-shot validé expérimentalement est un signal concret : la politique capture des abstractions géométriques suffisamment générales pour opérer hors simulation, ce qui est précisément la promesse que le secteur cherche à tenir depuis des années. Ce travail s'inscrit dans une compétition de représentations visuelles pour la robotique qui inclut la randomisation de domaine agressive popularisée par OpenAI dès 2017, les encodeurs préentraînés par masquage (MAE, R3M, DINOv2), et les politiques vision-langage-action (VLA) comme pi0 de Physical Intelligence ou OpenVLA. L'originalité revendiquée est la fusion RGB + depth au niveau du transformer plutôt qu'en aval, couplée au curriculum adaptatif. Le passage à la version 4 sur arXiv signale un travail en révision active, probablement vers une conférence type ICRA ou IROS. Les prochaines étapes attendues incluent une validation sur benchmarks standardisés (RLBench, MetaWorld) et des tests sur plateformes physiques plus complexes.

RecherchePaper
1 source
Squint : apprentissage par renforcement visuel rapide pour la robotique, du simulateur au réel
2arXiv cs.RO 

Squint : apprentissage par renforcement visuel rapide pour la robotique, du simulateur au réel

Une équipe de recherche a publié une version mise à jour (v2) de son article sur arXiv, référencé 2602.21203, décrivant Squint, une méthode d'apprentissage par renforcement visuel fondée sur l'algorithme Soft Actor-Critic. Squint combine simulation parallèle, un critique distributionnel, une technique de réduction de résolution d'image baptisée "résolution squinting", une normalisation par couches, un ratio mise à jour/données optimisé et une implémentation logicielle accélérée. Les auteurs introduisent aussi le SO-101 Task Set, une nouvelle suite de huit tâches de manipulation construite dans le simulateur ManiSkill3, avec une randomisation de domaine poussée pour forcer la robustesse des politiques apprises. Résultat chiffré central : l'entraînement complet tient en 15 minutes sur un unique GPU RTX 3090, la majorité des huit tâches convergeant en moins de 6 minutes, et les politiques ainsi obtenues sont transférées avec succès à un bras robotique SO-101 réel, sans réentraînement supplémentaire signalé. L'enjeu dépasse la simple prouesse technique : le RL visuel est historiquement écarté en robotique car les méthodes off-policy, économes en données, restent lentes en temps réel, tandis que les méthodes on-policy se parallélisent facilement mais consomment beaucoup d'échantillons. Des travaux récents avaient déjà montré qu'une méthode off-policy pouvait battre l'on-policy en temps horloge pour du contrôle basé sur des états, mais l'extension à des entrées visuelles haute dimension restait un verrou, à cause du coût de stockage et d'encodage des images. En démontrant un cycle d'entraînement à l'échelle de la minute sur du matériel grand public, Squint réduit fortement la barrière à l'entrée pour prototyper des politiques visuomotrices en sim-to-real, un argument direct pour les laboratoires et intégrateurs qui cherchent à itérer vite sans cluster GPU dédié. Le SO-101 est un bras robotique peu coûteux popularisé dans l'écosystème open source de la robotique d'apprentissage, ce qui facilite la reproductibilité annoncée par les auteurs. L'article se positionne explicitly contre les approches on-policy et les méthodes off-policy visuelles antérieures jugées trop lentes en pratique. À ce stade, il s'agit d'un résultat de recherche publié sur arXiv, validé sur une suite de tâches maison et un seul robot réel, non d'un produit ou d'un déploiement industriel ; aucune feuille de route commerciale n'est mentionnée.

RecherchePaper
1 source
3arXiv cs.RO 

FinsSim : une plateforme de simulation intégrée alignée sur le réel pour l'apprentissage des robots sous-marins

Une équipe de recherche présente FinsSim, une plateforme de simulation intégrée pour l'apprentissage robotique sous-marin, décrite dans un preprint publié fin septembre 2026 sur arXiv (2609.23943). FinsSim associe une simulation hydrodynamique haute fidélité à moteurs de calcul interchangeables, des lignes de base de contrôle standard et des flux de travail unifiés pour l'apprentissage robotique. Pour le transfert sim-to-real, elle intègre une fusion multi-capteurs pour une localisation précise à faible coût, des modèles calibrés reliant poussée des propulseurs et hydrodynamique, et un algorithme de répartition d'efforts sous contraintes, le tout relié via ROS 2 en un pipeline complet simulation-vers-réel. Les auteurs rapportent avoir validé ce transfert par des expériences appariées simulation/réel, complétées par des études d'ablation testant chaque module séparément. Pour l'industrie de la robotique sous-marine, marché restreint et bien moins médiatisé que celui des humanoïdes terrestres, ce travail cible un verrou concret : l'écart persistant entre simulation et réalité, aggravé sous l'eau par la difficulté à modéliser l'hydrodynamique et à localiser un robot sans GPS. En reliant simulateur calibré, capteurs fusionnés et allocation de commande sous contraintes dans un pipeline reproductible, FinsSim s'adresse aux laboratoires et intégrateurs développant des véhicules sous-marins autonomes pour l'inspection, l'intervention ou la cartographie. Contrairement aux annonces spectaculaires du secteur humanoïde, ce travail reste un outil de recherche : ni produit commercial ni déploiement en conditions réelles, mais une brique méthodologique destinée à être reprise par d'autres équipes. L'article s'inscrit dans une lignée de simulateurs sous-marins de recherche déjà existants, tels que UUV Simulator, Stonefish, HoloOcean ou DAVE, que FinsSim cherche à compléter en combinant fidélité hydrodynamique et pipeline de transfert prêt à l'emploi via ROS 2. Ce créneau reste à l'écart de la vague de financements qui entoure actuellement les robots humanoïdes terrestres et les modèles vision-langage-action, où des acteurs comme Figure AI, NVIDIA ou Physical Intelligence multiplient les annonces. Le preprint, mis en ligne fin septembre 2026, ne précise ni institution porteuse ni calendrier de publication du code source. Les auteurs indiquent vouloir réduire l'écart entre recherche théorique et applications pratiques en robotique sous-marine, sans annoncer de partenariat industriel ni de déploiement programmé à ce stade.

RecherchePaper
1 source
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
4arXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence. Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte. CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

RecherchePaper
1 source