Aller au contenu principal
Méduse robotique actionnée par tendons à commande souple contrainte, avec contrôle de profondeur par apprentissage par renforcement
RecherchearXiv cs.RO 

Méduse robotique actionnée par tendons à commande souple contrainte, avec contrôle de profondeur par apprentissage par renforcement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente un robot méduse sous-marin actionné par câbles (tendons), doté d'une actionnation souple contrainte combinant substrat flexible et contraintes discrètes. Chaque actionneur peut fléchir jusqu'à 150°, avec une relation quasi linéaire entre déplacement du câble et angle de flexion. Le robot embarque huit actionneurs pilotés par seulement quatre servomoteurs, ce qui lui permet de nager de façon stable, d'ajuster son attitude et de se retourner seul en cas de basculement (self-righting). Les chercheurs ont ensuite entraîné un contrôleur par apprentissage par renforcement pour réguler la profondeur en boucle fermée, validé à la fois en simulation et sur le prototype physique. Le travail a été publié sur arXiv (référence 2609.29132v1) le 25 septembre 2026 sous forme de preprint non encore relu par des pairs, sans précision sur les dimensions, le poids du robot, ni le lieu exact des essais physiques, vraisemblablement menés en bassin.

L'enjeu technique visé est bien identifié dans la robotique souple sous-marine: les actionneurs mous permettent une grande déformation et une locomotion économe en énergie proche de celle des méduses réelles, mais leur comportement non linéaire les rend difficiles à contrôler précisément. En ajoutant des contraintes mécaniques discrètes au substrat flexible, les auteurs obtiennent une relation quasi linéaire entre commande et flexion, ce qui simplifie l'apprentissage d'un contrôleur par renforcement et transforme la régulation de profondeur en un comportement reproductible plutôt que purement qualitatif. Pour les concepteurs de robots sous-marins bio-inspirés et les équipes travaillant sur des véhicules autonomes compliants, la démonstration esquisse une voie intermédiaire entre actionneurs rigides faciles à piloter et actionneurs mous difficiles à modéliser, sans sacrifier la compliance qui fait l'intérêt biomimétique de la méduse.

Ce travail s'inscrit dans un courant de recherche en robotique molle bio-inspirée qui explore depuis plusieurs années des robots méduses, poissons ou pieuvres actionnés par matériaux souples, pneumatique ou câbles, en concurrence avec des approches plus classiques d'AUV à hélices pour l'exploration sous-marine discrète et peu consommatrice d'énergie. Contrairement à de simples démonstrations mécaniques de nage, cette étude ajoute une couche de contrôle par renforcement, signe d'une volonté d'aller vers l'autonomie plutôt que la seule preuve de concept de mouvement. À ce stade, il s'agit d'un prototype de laboratoire et d'un preprint: aucun calendrier de test en mer, d'intégration dans une flotte ou de partenariat industriel n'est mentionné, et les auteurs présentent eux-mêmes leurs résultats comme une étape vers des robots méduses manœuvrables et autonomes, non comme un système finalisé.

Dans nos dossiers

À lire aussi

Analyse de l'apprentissage par renforcement profond en continu pour l'apprentissage adaptatif en robotique
1arXiv cs.RO 

Analyse de l'apprentissage par renforcement profond en continu pour l'apprentissage adaptatif en robotique

Des chercheurs publient sur arXiv (référence 2609.28807, soumission nouvelle) une étude qui livre la première analyse de l'apprentissage par renforcement profond en flux comme cadre d'apprentissage continu adaptatif pour la robotique. Contrairement à l'approche dominante, qui consiste à réentraîner hors ligne un modèle sur un jeu de données élargi après une phase de pré-entraînement, la méthode testée met à jour la politique neuronale en continu, à partir de chaque nouvelle expérience, en s'inspirant du fonctionnement de l'apprentissage biologique. Les expériences principales portent sur la locomotion d'un robot quadrupède : avec certains optimiseurs et des techniques de limitation de la perte de plasticité, la politique s'adapte rapidement en ligne à des changements imprévus touchant le robot lui-même, son environnement ou ses objectifs. Elle surpasse les méthodes batch on-policy classiques et améliore le taux de réussite des tâches jusqu'à 90% par rapport à la politique simplement pré-entraînée. Des évaluations complémentaires sur des tâches de manipulation robotique, menées sur une morphologie différente, montrent que ces gains se retrouvent partiellement, avec des limites de stabilité et de performance. Pour l'industrie robotique, ce travail apporte une première preuve empirique qu'un apprentissage en flux, sans réentraînement batch hors ligne massif, peut permettre à un robot déjà déployé de s'adapter à des situations non anticipées lors de la collecte de données initiale, un scénario courant pour les intégrateurs confrontés à des changements d'environnement, à l'usure matérielle ou à des objectifs de mission évolutifs. Cela remet en question l'hypothèse dominante du secteur selon laquelle la robustesse passe nécessairement par l'élargissement continu des jeux de données d'entraînement hors ligne, et suggère une voie alternative pour réduire le coût et la latence de mise à jour des politiques embarquées, un enjeu clé alors que les acteurs des humanoïdes et des robots mobiles autonomes cherchent à généraliser leurs modèles au-delà des scénarios démontrés en laboratoire. Le fait que les gains observés en locomotion quadrupède ne se transposent que partiellement à la manipulation souligne toutefois que la généralisation entre morphologies reste un problème ouvert, ce qui tempère tout enthousiasme prématuré côté commercialisation. Le papier s'inscrit dans un courant de recherche récent ayant démontré la faisabilité technique du deep RL en flux, où chaque mise à jour du réseau utilise uniquement la dernière expérience collectée plutôt qu'un lot de données rejouées, sans qu'aucun travail antérieur n'ait validé cette approche comme cadre viable d'apprentissage continu pour adapter des politiques robotiques à des changements non vus. Les auteurs positionnent explicitement leur contribution comme la première étude de ce type appliquée à la robotique, en s'appuyant sur une phase de pré-entraînement suivie d'une adaptation en ligne. L'étude se conclut par une discussion des limites, notamment les problèmes de stabilité observés en manipulation, et par des pistes pour les futurs systèmes de robot learning continu, sans annoncer de calendrier de déploiement ni de partenariat industriel.

RecherchePaper
1 source
Contrôle de posture par apprentissage par renforcement profond pour robots à double direction Ackermann en conditions d'incertitude
2arXiv cs.RO 

Contrôle de posture par apprentissage par renforcement profond pour robots à double direction Ackermann en conditions d'incertitude

Des chercheurs présentent une méthode de contrôle de pose complète pour robots mobiles à double direction Ackermann, basée sur l'apprentissage par renforcement profond (DRL), en ciblant directement l'un des obstacles centraux à l'industrialisation du DRL : l'écart de performance entre simulation et monde réel. Partant du cadre ManeuverNet, l'équipe étend son objectif initial (contrôle de position) vers un contrôle de pose complet, position et orientation combinées, ce qui constitue une tâche sensiblement plus exigeante. Les robots à double direction Ackermann, utilisés notamment en logistique lourde et inspection industrielle, imposent des contraintes non-holonomes strictes liées à la géométrie du châssis. Les résultats quantifient précisément le problème : une politique entraînée avec des modèles d'actionnement simplifiés atteint 100 % de succès dans PyBullet, mais chute à 25 % dans Gazebo sous des conditions d'évaluation plus strictes, une dégradation qui illustre le sim-to-real gap à un stade intermédiaire, avant même le passage sur robot physique. La contribution principale repose sur une approche "sim-to-sim-to-real" : les effets d'actionnement caractéristiques de Gazebo sont modélisés, puis réinjectés dans l'environnement d'entraînement PyBullet. Combinée à un entraînement multi-environnements via les algorithmes SAC (Soft Actor-Critic) et CrossQ, cette stratégie remonte le taux de succès à 92 % dans Gazebo (69 % sous seuils stricts) et permet un transfert direct sur robot réel sans réajustement supplémentaire. Ce résultat intéresse directement les intégrateurs d'AGV et AMR : il suggère que la modélisation fine de l'actionnement, davantage que la complexité architecturale du réseau, constitue le levier principal pour réduire l'écart sim-to-real sur des plateformes non-holonomes. Le problème de la double direction Ackermann reste moins étudié que les bases omnidirectionnelles ou les rovers différentiels, malgré sa pertinence pour les chariots élévateurs autonomes et les véhicules industriels de grande taille. SAC et CrossQ représentent l'état de l'art en DRL hors politique (off-policy) ; leur combinaison avec une approche sim-to-sim structurée sur ce type de plateforme constitue une contribution nouvelle. L'article est publié en preprint arXiv (2606.00313) et n'a pas encore été évalué par les pairs ; les conditions exactes du test sur robot réel, notamment la diversité des scénarios testés, restent à préciser avant toute conclusion définitive sur la robustesse industrielle de la méthode.

RecherchePaper
1 source
ZAPS-DA : lissage de politique à phase zéro avec acteur découplé pour le contrôle continu en apprentissage par renforcement
3arXiv cs.RO 

ZAPS-DA : lissage de politique à phase zéro avec acteur découplé pour le contrôle continu en apprentissage par renforcement

ZAPS-DA (arXiv:2605.30612, juin 2026) est un cadre d'apprentissage par renforcement qui s'attaque à un problème concret de déploiement : les politiques de contrôle continu entraînées avec des algorithmes off-policy comme Soft Actor-Critic (SAC) produisent des commandes oscillantes à haute fréquence, le "jitter", qui rendent le transfert sur des actionneurs physiques hasardeux. L'approche couple l'acteur RL principal non modifié à un second acteur découplé, entraîné par imitation supervisée à partir de cibles filtrées zéro-phase (filtre Savitzky-Golay) stockées dans le replay buffer. L'acteur déployé est ce second acteur : une fonction feed-forward directe observation-action, sans filtre à l'inférence ni historique d'actions en entrée. Les auteurs nomment ce mécanisme "distillation causale d'un filtre non-causal". Validé sur deux simulateurs de conduite (MetaDrive et un environnement Webots de régulation de vitesse adaptative, protocoles n=150), ZAPS-DA affiche sur MetaDrive une réduction du jitter de direction de 14 à 21x et du jitter d'accélération de 3 à 5x (p < 10^-4, correction Bonferroni), sans dégradation de la complétion de tâche (p=0,28 réussite), pour un coût de 6,3 % en récompense. Sur Webots, l'amélioration est de type Pareto : parité de récompense (p=0,121), réduction du jitter de 8 à 45x, taux d'échec total ramené de 2,0 % à 0,7 %. Le problème est structurant pour le déploiement robotique : un signal de commande oscillant use prématurément les actionneurs, complique le sim-to-real et génère des comportements imprévisibles. Les deux solutions classiques avaient des défauts durs : le filtrage post-hoc introduit un délai de phase qui peut déstabiliser une boucle fermée ; pénaliser le jitter directement dans la perte RL mélange deux objectifs et fait régresser la performance de tâche. ZAPS-DA sépare proprement les deux responsabilités. La perte MSE à magnitude calibrée supprime aussi le besoin de re-tuning selon l'optimiseur, ce qui rend le cadre directement portable. Le papier s'inscrit dans les travaux sur le lissage de politiques RL (TD3 target policy smoothing, action repetition, action chunking d'ACT/Diffusion Policy), mais formalise pour la première fois la distillation d'un filtre non-causal dans un acteur causal. Les expériences restent limitées à deux simulateurs de conduite ; aucune validation sur plateforme physique ni code public ne sont annoncés, ce qui laisse ouverte la question du transfert vers la manipulation ou la locomotion. Les prochaines étapes naturelles seraient un test sur AMR, bras manipulateur ou véhicule RC, et une comparaison directe avec les méthodes de chunking temporel. ZAPS-DA demeure un preprint arXiv sans revue par les pairs confirmée.

RecherchePaper
1 source
Apprentissage par renforcement guidé par contraintes pour le contrôle en impédance variable dans l'insertion robotique à contacts multiples
4arXiv cs.RO 

Apprentissage par renforcement guidé par contraintes pour le contrôle en impédance variable dans l'insertion robotique à contacts multiples

Une équipe de recherche a publié en septembre 2026 sur arXiv (référence 2609.13516) CG-RL (Constraint-Grounded Reinforcement Learning), un contrôleur d'impédance variable pour l'insertion robotique en contact incertain, où la limite de force axiale tolérée et le gain adapté varient selon la tâche et imposent normalement un retuning manuel des contrôleurs classiques. La politique reçoit en entrée la limite de force et le retour de contact, produit un mouvement résiduel, un taux d'insertion et un gain demandé, que le contrôleur projette ensuite dans une plage admissible sans exposer cette plage à la politique elle-même. Testée en simulation sur une tâche d'insertion oblique, sur cinq graines d'entraînement, CG-RL atteint un taux de réussite de 85,8 % ± 7,7 % sans violation de la limite de force, contre seulement 50,1 % pour une référence à gain fixe réglée au point médian de la plage. Pour les intégrateurs travaillant sur l'assemblage à contact riche (connecteurs, pièces mécaniques), l'intérêt tient à la suppression du réglage manuel des gains d'impédance à chaque changement de tâche : une seule politique généralise à des limites de force inédites, y compris plus permissives que celles vues à l'entraînement, sans réentraînement. Privée de l'information sur la limite de force, la même politique ne montre pas cette adaptation continue, ce qui isole clairement l'apport du conditionnement par contrainte. Le gain reste garanti dans la plage admissible par construction du contrôleur, mais le respect effectif de la limite de force n'est validé qu'empiriquement, sans garantie formelle, une limite explicitement assumée par les auteurs. Le travail reste cantonné à la simulation, sans transfert démontré vers un robot physique : il s'agit d'une preuve de concept méthodologique, pas d'une solution prête pour l'usine. Le contrôle d'impédance reste depuis des décennies la référence pour la manipulation en contact, mais son réglage à gain fixe exige une expertise humaine propre à chaque tâche ; l'apprentissage par renforcement appliqué à l'impédance variable cherche depuis plusieurs années à automatiser ce réglage. CG-RL s'en distingue par une séparation explicite entre la politique apprise et la contrainte de sécurité, cette dernière étant appliquée par projection côté contrôleur plutôt qu'apprise par le réseau, ce qui garantit formellement l'admissibilité du gain sans garantir la satisfaction de la contrainte de force. L'article, classé comme nouvelle soumission arXiv sans partenaire industriel cité, appelle logiquement une validation sur robot réel et une extension à d'autres géométries d'insertion que le cas oblique testé ici.

RecherchePaper
1 source