Aller au contenu principal
Cadre d'apprentissage continu pour le contrôle adaptatif de robots souples modulaires
RecherchearXiv cs.RO 

Cadre d'apprentissage continu pour le contrôle adaptatif de robots souples modulaires

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose un nouveau cadre de contrôle pour robots souples modulaires (Modular Soft Robots, MSR), basé sur les principes de l'apprentissage continu, selon un article publié sur arXiv le 7 juillet 2026 (arXiv:2607.06740v1). Les MSR sont des systèmes composés de plusieurs segments interconnectés, hautement déformables et reconfigurables, utilisés notamment en intervention médicale, en rééducation et en manipulation robotique. Le problème que résout ce travail est concret : jusqu'ici, changer la morphologie d'un MSR obligeait à réentraîner entièrement son contrôleur, faute de pouvoir réutiliser les connaissances acquises sur les configurations précédentes. Le framework proposé permet au contrôleur d'apprendre séquentiellement de nouvelles configurations sans oublier les précédentes, et peut aussi fonctionner de façon distribuée pour apprendre la dynamique propre de chaque module sur un robot à configuration fixe. La validation s'est faite en deux temps : des expériences de suivi de trajectoire en boucle fermée en simulation sur un robot souple actionné par tendons, puis un test sur un bras robotique souple pneumatique à trois modules, en conditions réelles.

Pour l'industrie robotique, l'apport principal est méthodologique plutôt qu'un produit prêt à déployer : il s'attaque à un goulot d'étranglement bien identifié dans la robotique souple, à savoir la difficulté à faire évoluer la morphologie d'un robot sans tout reconstruire. Les MSR intéressent particulièrement les intégrateurs travaillant sur des tâches nécessitant une compliance mécanique élevée, comme la chirurgie mini-invasive ou la manipulation d'objets fragiles, où la rigidité des robots classiques est un handicap. Un contrôleur capable de s'adapter progressivement à des changements de structure, tout en activant sélectivement seulement les modules nécessaires pour atteindre une cible (ce qui réduit la charge de calcul), pourrait accélérer l'itération de conception sur ces plateformes reconfigurables, un axe encore peu mature comparé aux robots humanoïdes rigides à actionneurs classiques.

Ce travail s'inscrit dans la lignée des recherches en robotique souple qui cherchent à dompter la nonlinéarité et la redondance hyper-élevée de ces systèmes, deux caractéristiques qui rendent les approches de contrôle classiques inadaptées. L'article ne mentionne pas de partenaire industriel ni de calendrier de commercialisation : il s'agit d'une contribution de recherche académique, à un stade de preuve de concept en laboratoire, dont l'étape suivante logique serait l'extension à des morphologies plus complexes ou à des tâches de manipulation réelles au-delà du suivi de trajectoire.

À lire aussi

Contrôle de forme adaptatif au nombre de modules pour robots souples modulaires en série
1arXiv cs.RO 

Contrôle de forme adaptatif au nombre de modules pour robots souples modulaires en série

Des chercheurs présentent une méthode de contrôle visuel de forme adaptable au nombre de modules pour des robots pneumatiques souples de type modulaire série. Un contrôleur entraîné uniquement sur des données d'actionnement d'un seul module est ensuite réutilisé tel quel sur des robots comptant de un à cinq modules, sans nouvelle collecte de données spécifique à chaque configuration. Le système décompose les images caméra du corps entier en patchs locaux par module grâce à un segmenteur commun capable de localiser chaque module quelle que soit la configuration testée, tandis qu'un même contrôleur local s'applique à chaque patch extrait. Une augmentation de données géométrique améliore le transfert vers les modules situés en aval de la chaîne, et un réseau léger de reconstruction de masque restitue un canal d'actionneur synthétiquement supprimé. Les expériences sur robots physiques valident le contrôle de forme sous des charges variables et des changements environnementaux, pour différents nombres de modules assemblés. Cette approche s'attaque à un verrou concret de la robotique molle modulaire : jusqu'ici, changer le nombre de modules d'un robot obligeait à recollecter des données et réentraîner un contrôleur, ce qui limitait fortement la scalabilité industrielle de ces architectures. En démontrant qu'un apprentissage réalisé sur un seul module suffit à piloter des assemblages de taille variable, les auteurs suggèrent une voie pour standardiser le contrôle de familles entières de robots modulaires reconfigurables, un enjeu direct pour les intégrateurs qui cherchent à adapter la longueur ou la charge utile d'un bras ou d'un manipulateur souple sans repartir de zéro à chaque itération matérielle. Cela renforce aussi l'hypothèse selon laquelle des politiques de contrôle par apprentissage, correctement structurées en composants locaux réutilisables, peuvent généraliser au-delà de la configuration précise sur laquelle elles ont été entraînées, un argument pertinent dans le débat plus large sur la transférabilité des politiques visuo-motrices en robotique souple. Le papier s'inscrit dans le courant du contrôle de forme basé image ("image based shape control"), une alternative aux modèles dynamiques complexes souvent nécessaires pour piloter des structures souples non linéaires. Les approches data-driven existantes restaient jusqu'ici cantonnées à des structures de robot fixes. La contribution ici repose sur une décomposition en patchs locaux couplée à un segmenteur de modules partagé, plutôt que sur un modèle end-to-end du robot entier. L'article, publié sur arXiv (identifiant 2608.29547), ne précise pas de nom de laboratoire ni de partenaire industriel dans le résumé fourni, ni de calendrier de déploiement au-delà des expériences physiques rapportées ; il s'agit à ce stade d'une publication de recherche, sans indication de transfert vers un produit commercial ou un pilote industriel.

RecherchePaper
1 source
Ancrages de mémoire pour l'apprentissage continu des robots
2arXiv cs.RO 

Ancrages de mémoire pour l'apprentissage continu des robots

Des chercheurs présentent, dans un article publie le 28 aout 2026 sur arXiv (2608.26545v1), une méthode baptisée "Memory Anchors" pour lutter contre l'oubli catastrophique des robots qui apprennent de nouvelles taches en continu. Le principe s'appuie sur les buffers de rejeu, habituellement échantillonnés au hasard parmi les expériences passées pour reentrainer la politique sur d'anciennes taches en parallèle des nouvelles. Les auteurs montrent qu'un petit sous ensemble de ces expériences, les "ancres mémoire", concentre l'essentiel de la protection: ce sont les cas ou les représentations internes d'observations d'une nouvelle tache s'effondrent sur celles d'une ancienne tache alors que les deux exigent des actions contradictoires, par exemple manipuler différemment un objet déjà connu. Sur la suite de benchmarks LIBERO, exclure seulement 10% de ces ancres du buffer multiplie par plus de 4,5 l'oubli catastrophique mesure. A l'inverse, enrichir le buffer en ancres mémoire réduit de 63% l'oubli sur les taches a fort conflit et permet un apprentissage continu réussi de deux séquences de taches sur un robot réel. Videos et visualisations sont disponibles sur robot-adaptation.github.io/MemoryAnchors. Pour les intégrateurs qui déploient des politiques robotiques de type VLA en production, l'oubli catastrophique reste un frein concret a la mise a jour continue des flottes: chaque nouvelle compétence ajoutée risque de dégrader des comportements déjà valides sur le terrain. En montrant qu'une fraction minime, environ 10%, du buffer de rejeu porte l'essentiel de la stabilité du système, ce travail suggère que le cout mémoire et calcul de l'apprentissage continu peut baisser sans sacrifier la rétention, un enjeu direct pour les couts de stockage et de reentrainement a l'échelle d'une flotte. La validation sur robot réel, au delà de la simulation LIBERO, renforce la crédibilité de l'approche, même si elle reste limitée a deux séquences de taches et ne démontre pas encore un passage a l'échelle vers des dizaines de compétences. L'approche s'inscrit dans la lignée des méthodes de rehearsal en apprentissage continu, ou le problème central est de choisir quelles expériences rejouer sans faire exploser la taille du buffer ni le temps d'entrainement; l'échantillonnage aléatoire restait jusqu'ici la norme faute de critère fiable. Le benchmark LIBERO, standard pour évaluer l'apprentissage continu de politiques robotiques, sert de terrain de comparaison. Aucun acteur industriel ni déploiement commercial n'est associe a cette publication, qui relève pour l'instant de la recherche académique; les prochaines étapes attendues portent sur l'extension a un plus grand nombre de taches et l'intégration éventuelle de ce critère de sélection dans des pipelines d'entrainement de politiques généralistes.

RecherchePaper
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
3arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source
Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes
4arXiv cs.RO 

Apprentissage de contrôleurs de locomotion perceptifs et adaptatifs pour robots quadrupèdes

Une équipe de chercheurs a publié le 25 juin 2026 sur arXiv (2606.25179) une étude portant sur la conception de contrôleurs de locomotion universels pour robots quadrupèdes, capables de s'adapter à plusieurs morphologies de robots différents tout en intégrant de la perception en temps réel. Les auteurs s'appuient sur le cadre MorAL (Morphology-Aware Locomotion), qu'ils étendent en comparant trois architectures : un contrôleur aveugle (baseline sans perception), MorAL+ (perception intégrée uniquement dans le critique du réseau, pas dans l'acteur), et PPAL (acteur-critique entièrement perceptif). Les politiques ont été évaluées en simulation sur terrains plats et accidentés, puis déployées sur du matériel réel via le robot ANYmal d'ANYbotics. Résultat principal : MorAL+ surpasse les deux autres configurations en robustesse et en cohérence de suivi de trajectoire, notamment parce qu'un acteur entièrement perceptif se révèle sensible au bruit de capteur, tandis qu'un acteur aveugle manque de conscience du terrain. Ce résultat va à contre-courant d'une intuition répandue dans la communauté robotique : intégrer plus de perception n'est pas toujours meilleur. Le fait que la perception placée uniquement dans le critique (et non dans l'acteur) améliore la robustesse sans fragiliser la politique face au bruit de capteur est une contribution architecturale concrète. Pour les intégrateurs industriels qui déploient des quadrupèdes en environnements non structurés (entrepôts, sites industriels, inspection d'infrastructures), cette distinction a des implications directes sur la conception des pipelines de contrôle. Elle indique aussi que le problème du sim-to-real pour la locomotion quadrupède n'est pas uniquement une question de quantité de données perceptives, mais de leur positionnement dans l'architecture d'apprentissage par renforcement. ANYmal, développé par ANYbotics (spin-off de l'ETH Zurich), est l'un des robots quadrupèdes les plus utilisés en recherche académique et en déploiements industriels pilotes, aux côtés de Spot de Boston Dynamics et des modèles Unitree (Go2, B2) qui dominent le segment prix bas. Le cadre MorAL, sur lequel s'appuie ce travail, visait déjà à entraîner des politiques transférables entre morphologies de robots différents, un problème ouvert dans la course à la généralisation inter-robots (cross-embodiment). Ce papier reste pour l'instant un preprint académique sans déploiement industriel annoncé ; les suites naturelles seraient une validation sur un ensemble plus large de morphologies quadrupèdes et des tests en conditions réelles prolongées, en dehors du cadre contrôlé d'un labo.

UEANYbotics étant un spin-off suisse de l'ETH Zurich, les conclusions architecturales sur MorAL+ intéressent directement les intégrateurs européens qui déploient des quadrupèdes en inspection industrielle ou en environnements non structurés.

RecherchePaper
1 source