Aller au contenu principal
Apprentissage par renforcement sur graphe adapté à la morphologie pour la locomotion de robots tenségrité
RecherchearXiv cs.RO 

Apprentissage par renforcement sur graphe adapté à la morphologie pour la locomotion de robots tenségrité

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2510.26067, version 2, octobre 2025) un framework d'apprentissage par renforcement intégrant un réseau de neurones à graphes (GNN) dans l'algorithme Soft Actor-Critic (SAC) pour contrôler la locomotion de robots tenségrité. Le système représente la topologie physique du robot sous forme de graphe, où chaque nœud correspond à un composant structurel (tige rigide ou câble élastique) et chaque arête encode les couplages mécaniques. Validé sur un robot tenségrité à 3 barres, le framework maîtrise trois primitives de déplacement : suivi de trajectoire en ligne droite et virage bidirectionnel. Aucun réglage supplémentaire n'a été nécessaire pour le passage simulation-vers-matériel, et les politiques apprises s'exécutent directement sur le robot physique avec une locomotion stable.

Le résultat le plus significatif pour les intégrateurs et concepteurs de robots est le transfert sim-to-real sans fine-tuning : c'est précisément le point d'échec habituel des méthodes RL appliquées aux structures à dynamique fortement couplée. Les robots tenségrité combinent tiges rigides et câbles élastiques en tension permanente, ce qui rend leur dynamique sous-actionnée et difficile à modéliser fidèlement, un écart classique entre simulation et réalité. Le fait que le GNN encode explicitement les contraintes topologiques du robot explique en partie cette robustesse : la politique apprend la physique structurelle, pas seulement une carte entrée-sortie. Les résultats montrent également une meilleure efficacité d'échantillonnage et une tolérance accrue aux variations de bruit et de raideur des câbles, deux paramètres qui fluctuent inévitablement sur matériel réel.

Les robots tenségrité ont émergé comme plateforme de recherche sérieuse notamment via les travaux de la NASA (robot SUPERball) et des universités comme UC Berkeley, en raison de leur légèreté et de leur résilience aux chocs, des atouts pour l'exploration spatiale ou la recherche et le sauvetage. Jusqu'ici, leur contrôle reposait essentiellement sur des politiques MLP standard ou des méthodes de contrôle classique, peu adaptées à la complexité des couplages internes. Ce travail s'inscrit dans une tendance plus large d'architectures GNN pour robots morphologiquement complexes, en compétition avec des approches comme les transformers de morphologie ou le contrôle basé modèle avec apprentissage des paramètres. Les prochaines étapes naturelles incluent l'extension à des structures plus complexes (6 barres, tenségrités sphériques) et des environnements non structurés, domaines où aucun déploiement industriel n'est encore annoncé à ce stade.

Dans nos dossiers

À lire aussi

Apprentissage par renforcement neuromorphique pour la locomotion de robots quadrupèdes sur terrain accidenté
1arXiv cs.RO 

Apprentissage par renforcement neuromorphique pour la locomotion de robots quadrupèdes sur terrain accidenté

Une équipe de chercheurs a publié mi-mai 2026 sur arXiv (réf. 2605.09595) un framework d'apprentissage par renforcement basé sur l'équilibrium propagation (EP) pour contrôler la locomotion d'un quadrupède Unitree A1 à 12 degrés de liberté sur terrain accidenté. Plutôt que la rétropropagation classique, ils substituent les gradients globaux par des règles d'apprentissage locales pilotées par les états neuronaux, compatibles avec les substrats neuromorphiques et de calcul en mémoire. Le contrôleur combine un générateur de motif central (CPG) bio-inspiré avec une politique d'ajustement postural résiduel, entraîné via une variante PPO (Proximal Policy Optimization) adaptée à l'EP avec un mécanisme de clipping bilatéral du ratio pour stabiliser les mises à jour lors de la relaxation. Les résultats montrent des performances comparables à une baseline PPO classique en taux de succès, suivi de vitesse, consommation des actionneurs et stabilité corporelle, tout en réduisant la mémoire GPU de 4,3× par rapport à la rétropropagation à travers le temps (BPTT). L'ensemble des expériences reste en simulation, aucun déploiement terrain n'est documenté dans la publication. L'enjeu structurel est clair : les politiques de locomotion RL actuelles sont entraînées hors-ligne en simulation massivement parallèle, puis figées au déploiement. Elles ne s'adaptent pas à l'usure des actionneurs, aux variations de charge utile, ou au drift mécanique sur robot réel, limites critiques pour une industrialisation. En remplaçant la rétropropagation par un apprentissage local compatible avec des puces neuromorphiques (type Intel Loihi), cette approche ouvre la voie à une adaptation continue on-robot à faible consommation, sans dépendance à un GPU externe. Le gain de 4,3× en mémoire est déjà tangible pour les équipes embarquées, même si la validation reste entièrement simulée. Ces travaux s'inscrivent dans l'intense activité autour de la locomotion quadrupède par RL, dominée par l'ETH Zurich sur ANYmal et les robots Unitree. L'équilibrium propagation, formalisé par Scellier et Bengio en 2017, reste peu exploré pour le contrôle continu haute dimension, c'est l'une des premières démonstrations sur un robot à 12 DOF. Les approches concurrentes pour l'adaptation en ligne incluent RMA (Rapid Motor Adaptation, UC Berkeley) et les politiques méta-adaptatives de type MAML. L'étape suivante critique serait de valider sur hardware réel avec une puce neuromorphique embarquée et de mesurer la consommation effective en watts, deux points absents de la publication actuelle.

RecherchePaper
1 source
Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL
2arXiv cs.RO 

Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL

Un article de recherche publié sur arXiv (2609.19041v1) en septembre 2026, intitulé "Loco-Loco-RL: Low-Cost Terrain Mapping for Humanoid Locomotion with Reinforcement Learning", propose une méthode de perception de terrain low-cost pour la locomotion humanoïde. Plutôt que les caméras de profondeur ou LiDAR habituels, coûteux et gourmands en calcul, les auteurs utilisent un simple capteur time-of-flight bon marché pour construire une représentation 3D locale du terrain. Pour exploiter ce signal épars, ils introduisent une politique transformer temporelle à compression de tokens: les observations proprioceptives et de terrain sont tokenisées, traitées par un transformer à self-attention multi-tête, compressées via un module MLP en espace latent, puis stockées dans un historique glissant de 15 pas de temps qu'un second transformer à cross-attention exploite pour la politique de renforcement. La méthode a été validée par transfert sim-to-real sur un robot humanoïde physique, sur un benchmark de locomotion en terrain accidenté, avec une marche jugée robuste malgré la faible résolution du capteur. Aucun partenaire industriel ni déploiement commercial n'est mentionné: c'est un travail de recherche, pas une annonce produit, et aucune plateforme humanoïde n'est nommée. L'intérêt pour les intégrateurs reste néanmoins direct, car le coût et la consommation des capteurs de perception pèsent lourd dans le bill of materials des humanoïdes et freinent leur déploiement en volume. En montrant qu'un capteur ToF bon marché et basse résolution suffit à une locomotion robuste sur terrain accidenté grâce à une architecture transformer compressée, le travail apporte un contre-exemple concret à l'idée qu'une perception haute résolution est indispensable au franchissement d'obstacles, une piste pour réduire les coûts de production à l'échelle. L'approche s'inscrit dans une lignée de travaux en apprentissage par renforcement pour la locomotion de robots à pattes, où la perception extéroceptive du terrain reste coûteuse à traiter face à la simple proprioception. Elle se positionne face aux approches concurrentes misant sur des caméras de profondeur ou LiDAR embarqués, plus riches mais plus chers et plus lourds à calculer en temps réel. L'article ne précise ni le robot utilisé pour les essais ni de calendrier de déploiement industriel: à ce stade, c'est un preprint validant un principe en laboratoire, sans partenaire ni pilote annoncés. La suite logique, non détaillée par les auteurs, serait une extension à des terrains plus variés et une comparaison directe des coûts et performances face aux stacks LiDAR ou caméra de profondeur standards du secteur.

RecherchePaper
1 source
Composition de compétences pour l'apprentissage par renforcement des robots à pattes
3arXiv cs.RO 

Composition de compétences pour l'apprentissage par renforcement des robots à pattes

Un article de recherche publié sur arXiv (référence 2609.14647v1, soumission de type "new") intitulé "Skill Composition for Legged Robot Reinforcement Learning" pose un constat simple sur l'état de l'art en robotique humanoïde : les robots à pattes, et les humanoïdes en particulier, maîtrisent de mieux en mieux des comportements isolés, chacun obtenu par l'entraînement d'un contrôleur spécialisé par apprentissage par renforcement. Ces politiques spécialisées s'entraînent vite, convergent de façon fiable puisqu'elles ne traitent qu'un problème restreint, et peuvent être validées indépendamment les unes des autres, trois propriétés qu'une politique unique de bout en bout censée tout couvrir ne possède pas. Le point faible identifié par les auteurs n'est pas l'acquisition des compétences elles-mêmes, mais la transition entre elles : le passage de contrôle d'une politique à une autre reste fragile et mal maîtrisé. L'argument central du papier est que la composition de sous-politiques indépendantes mérite d'être traitée comme un problème de recherche à part entière, et non comme un détail d'implémentation confié au premier mécanisme disponible. Une composition fiable est ce qui transforme une collection de compétences isolées en un répertoire réellement exploitable, extensible et partageable, un enjeu direct pour les intégrateurs qui cherchent à assembler des bibliothèques de comportements réutilisables plutôt que de réentraîner un modèle monolithique à chaque nouvelle tâche. Plus fondamentalement, si le contrôle peut être transféré entre politiques spécialisées de façon sûre et à tout moment, le choix de l'action suivante peut être délégué à un composant de nature différente, comme un planificateur, un automate ou un contrôleur symbolique, dont le comportement est inspectable à l'avance. Les politiques n'auraient alors plus qu'à agir, tandis que ce que le robot est autorisé à faire deviendrait vérifiable, un argument qui va à contre-courant de la course actuelle aux politiques VLA de bout en bout, à l'image de Pi-0, GR00T N2 ou Helix, et qui remet en avant l'intérêt de l'architecture modulaire pour la certification et la sécurité en environnement industriel. Il s'agit d'un article de position et de méthode, sans résultats chiffrés, démonstration matérielle ni annonce de déploiement dans le résumé disponible : aucun robot, aucune entreprise ni aucun site de test n'y sont cités, ce qui le distingue nettement des communiqués produits du secteur. Il s'inscrit dans un débat plus large qui oppose, d'un côté, les laboratoires misant sur des politiques vision-langage-action entraînées de bout en bout pour couvrir un maximum de tâches avec un seul réseau, et de l'autre, une tradition de robotique plus classique fondée sur la planification hiérarchique et les automates symboliques. En proposant de faire de la composition de compétences un objet de recherche autonome, les auteurs ouvrent une voie intermédiaire entre ces deux approches, sans préciser dans l'abstract de calendrier, de prototype ou de partenariat industriel concret pour la suite des travaux.

RecherchePaper
1 source
GLAMDRING : apprentissage de la démarche et co-conception de la morphologie par renforcement de CPG
4arXiv cs.RO 

GLAMDRING : apprentissage de la démarche et co-conception de la morphologie par renforcement de CPG

Un article publié le 18 septembre 2026 sur arXiv sous la référence 2609.19452 présente GLAMDRING (Gait Learning And Morphology co-Design via Reinforcement Learning of CPGs), un framework de recherche qui conçoit simultanément la morphologie d'un robot quadrupède et le contrôleur qui le pilote. À partir de quatre contraintes d'entrée (plage de vitesse d'avancement visée, budget de puissance par actionneur, bibliothèque d'actionneurs disponibles et charge utile cible), le système produit une géométrie de liaisons, un choix d'actionneur par articulation, et une politique de démarche fondée sur des générateurs de patrons centraux (CPG) à oscillateurs de Hopf. Les conceptions candidates sont classées selon un objectif choisi: vitesse maximale, coût de transport (CoT) minimal, ou marge de charge utile maximale. Plutôt que d'entraîner une politique par apprentissage par renforcement pour chaque morphologie candidate, approche jugée trop coûteuse, les auteurs en entraînent un petit nombre fixe sur l'ensemble de l'espace des morphologies, puis déduisent a posteriori longueurs de liaisons et actionneurs à partir de l'enveloppe opérationnelle enregistrée par la politique. Une démonstration en conditions réelles est mentionnée, sans détail sur le robot utilisé ni le nombre d'essais dans le résumé. Le travail s'attaque à un problème central de la locomotion à pattes: corps et démarche sont couplés, la morphologie optimale dictant la façon de piloter le robot, tandis que la démarche optimale dépend de la structure physique. La plupart des méthodes existantes séparent les deux étapes, figeant d'abord le châssis avant d'apprendre le contrôleur, ce qui plafonne les performances. Les auteurs rapportent trois résultats: la co-conception corps-démarche est nécessaire pour satisfaire les contraintes de locomotion; c'est la faisabilité de l'enveloppe des actionneurs, et non le seul succès de la marche, qui détermine la charge utile réellement atteignable; et des démarches animales canoniques émergent naturellement dans la plupart des conceptions à partir de la seule morphologie et des contraintes, sans être imposées. Pour des robots destinés à des terrains non structurés (sites de catastrophe, surfaces planétaires, champs agricoles) où la plateforme idéale n'existe pas encore, la méthode promet de remplacer une recherche exhaustive coûteuse par un nombre réduit et fixe d'entraînements. GLAMDRING s'inscrit dans le courant plus large du co-design corps-contrôleur en robotique, qui cherche à dépasser les pipelines où le châssis est fixé manuellement avant que l'apprentissage n'intervienne seulement sur le contrôle. Classé comme nouvelle soumission sur arXiv, le résumé ne mentionne ni entreprise, ni laboratoire, ni acteur FR/EU associé au projet: il s'agit d'une contribution académique validée en simulation et par une unique démonstration matérielle, non d'un produit commercialisé. Les suites attendues, extension au-delà du quadrupède, validation sur davantage de plateformes physiques, comparaison chiffrée aux méthodes de co-conception existantes, restent absentes de ce résumé.

RecherchePaper
1 source