Aller au contenu principal
RecherchearXiv cs.RO 

Curricula de sécurité prédictifs pour une locomotion à pattes robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent les Predictive Safety Curricula (PSC), un cadre d'entraînement pour les politiques de locomotion de robots à pattes, décrit dans un preprint arXiv (2609.37070v1) qui n'a pas encore été évalué par des pairs. Le système entraîne un critique de sécurité distributionnel à partir des rollouts de la politique. Ce critique prédit le coût de sécurité futur. Ces prédictions servent à prioriser deux éléments : les contextes de terrain et les événements aléatoires déjà rencontrés pendant l'entraînement. La récompense de la tâche et la fonction de perte d'optimisation de la politique restent inchangées, et seule la distribution des données d'entraînement est modifiée. Les auteurs comparent PSC à la progression standard de terrain, au replay basé sur l'avantage et aux curricula fondés sur le learning progress. Les tests couvrent de la locomotion en terrain accidenté contrôlé et deux piles de locomotion de production. Sur le robot ANYmal-D, PSC réduit de 63 % l'incidence des collisions de tibia par rapport au curriculum learning-progress, sur trois seeds d'entraînement appariées, avec une baisse dans chacune. Sur une plateforme de montée d'escaliers de production, non nommée dans le résumé, les auteurs n'observent aucune collision de tibia lors des essais matériels évalués.

Le résultat s'attaque à un écart bien connu des intégrateurs : une politique apprise peut afficher de bonnes performances moyennes tout en gardant des défaillances rares mais coûteuses, comme un choc ou une chute. Les curricula usuels ajustent la difficulté de la tâche, sans cibler la distribution des expériences critiques pour la sécurité. Un allocateur d'expérience qui n'exige ni nouvelle récompense ni modification de l'algorithme d'optimisation est facile à intégrer dans une chaîne d'entraînement existante. C'est un argument pour les équipes qui visent la fiabilité en exploitation plutôt que la démonstration. Le transfert vers deux piles de production distinctes suggère que le principe n'est pas lié à un seul contrôleur. Les gains sont les plus marqués sur terrain difficile et avec des observations dégradées, ce qui correspond aux conditions de chantier ou d'inspection industrielle.

Il faut toutefois relativiser. Le résumé ne donne ni taux absolus de collision, ni nombre d'essais matériels, ni intervalles de confiance. Trois seeds et des essais matériels en nombre non précisé donnent une puissance statistique limitée. La mention « aucune collision observée » sur la plateforme d'escaliers ne prouve pas l'absence de risque. Le travail s'inscrit dans la lignée de l'apprentissage par renforcement sim-to-real sur ANYmal, du ccadre de l'apprentissage sûr par critique distributionnel et des curricula automatiques. Il reste à voir si les résultats se reproduisent sur d'autres morphologies, dont les humanoïdes, et si le coût de calcul du critique reste raisonnable à grande échelle.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Vers une prédictibilité fiable du transfert simulation-réel pour la locomotion quadrupède robuste à base de MoE
1arXiv cs.RO 

Vers une prédictibilité fiable du transfert simulation-réel pour la locomotion quadrupède robuste à base de MoE

Des chercheurs ont présenté dans un preprint arXiv (2602.00678, version 4) un cadre unifié combinant une politique de locomotion Mixture-of-Experts (MoE) et RoboGauge, une suite d'évaluation prédictive du transfert simulation-réel, appliquée à la locomotion quadrupède. L'architecture MoE déploie un ensemble d'experts spécialisés activés par un mécanisme de gating, chacun modélisant un sous-espace distinct de représentation du terrain et des commandes moteur, en s'appuyant uniquement sur la proprioception (encodeurs articulaires, centrale inertielle), sans caméra ni LiDAR. Les expériences sur un Unitree Go2 ont validé une locomotion robuste sur des terrains non vus à l'entraînement: neige, sable, escaliers, pentes et obstacles de 30 cm. En tests haute vitesse, le robot a atteint 4 m/s, avec apparition spontanée d'une allure à faible écartement latéral que les auteurs associent à une meilleure stabilité dynamique à grande vitesse. L'apport central est RoboGauge, qui génère des métriques proprioceptives multi-dimensionnelles via des tests sim-to-sim couvrant plusieurs terrains, niveaux de difficulté et randomisations de domaine, permettant de sélectionner le meilleur checkpoint de politique MoE sans validation physique répétée. Pour les équipes de R&D et les intégrateurs industriels, cela adresse directement le principal goulot d'étranglement du déploiement de robots marcheurs: le coût et le risque des essais terrain. La robustesse obtenue avec proprioception seule est également significative, car elle conteste l'hypothèse fréquente selon laquelle la vision ou le LiDAR seraient indispensables hors d'environnements contrôlés, élargissant l'espace d'application en milieux non structurés (entrepôts, chantiers, extérieurs). Il convient cependant de noter que les métriques de vitesse et d'obstacle sont issues de tests en conditions choisies, sans données de taux d'échec agrégées sur des déploiements prolongés. Ce travail s'inscrit dans une filière de recherche initiée par ETH Zurich avec ANYmal (commercialisé par ANYbotics) et les équipes de Berkeley sur l'apprentissage agile en locomotion. Le Unitree Go2, vendu autour de 1 600 dollars, est devenu la plateforme de référence académique en raison de son accessibilité. Les concurrents industriels comme Boston Dynamics (Spot) ou les acteurs AMR européens comme Exotec développent des approches similaires de robustesse multi-terrain, bien que leurs validations restent largement propriétaires. Les suites naturelles de ce travail incluent la publication de RoboGauge comme outil de benchmark open-source inter-plateformes et son extension potentielle à d'autres morphologies, notamment les humanoïdes dont le transfert sim-to-real reste un défi ouvert.

UESi RoboGauge est publié en open source, les équipes européennes (ANYbotics, intégrateurs industriels UE) bénéficieraient d'un outil de benchmark standardisé réduisant les coûts de validation physique pour la locomotion quadrupède.

RecherchePaper
1 source
Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique
2arXiv cs.RO 

Imiter et affiner le contrôle prédictif par modèle pour une locomotion quadrupède robuste et symétrique

Une équipe de chercheurs a publié le framework IFM (Imitating and Finetuning Model Predictive Control), une approche hybride pour le contrôle de robots quadrupèdes sur des terrains difficiles. La méthode, disponible sur arXiv sous la référence 2311.02304v3, s'articule en trois phases séquentielles : d'abord, un contrôleur MPC classique est construit à partir de la Programmation Dynamique Différentielle (DDP) couplée à l'heuristique de Raibert pour définir une politique experte ; ensuite, ce contrôleur est cloné par apprentissage par imitation afin de le rendre adaptable par gradient ; enfin, un deep reinforcement learning (RL) à exploration volontairement limitée affine la politique sur des terrains exigeants, notamment surfaces rugueuses, revêtements glissants et tapis roulants. Des expériences menées en simulation puis sur matériel réel valident les performances du framework dans ces trois configurations. Le principal apport d'IFM est de combiner la robustesse formelle du contrôle model-based et la flexibilité de l'apprentissage profond, sans les défauts propres à chaque approche prise isolément. En pratique, IFM produit des allures (gaits) significativement plus symétriques, périodiques et économes en énergie que le RL classique dit "Vanilla RL", tout en réduisant considérablement le travail de reward shaping, c'est-à-dire la conception laborieuse de fonctions de récompense qui constitue l'un des principaux freins industriels au RL pour la locomotion. L'exploration limitée en phase RL est une décision architecturale notable : elle contraint le réseau à rester proche de la politique MPC apprise, ce qui stabilise l'apprentissage sur des terrains hors distribution sans divergence comportementale, un résultat difficile à obtenir avec du RL pur. Le contrôle de la locomotion quadrupède est un champ de recherche dense depuis les travaux fondateurs de Marc Raibert au MIT Leg Lab dans les années 1980, dont l'heuristique de placement de pied est encore employée ici comme référence. Les approches récentes se partagent entre contrôle model-based pur (ETH Zurich avec ANYmal et le groupe RSL), RL pur (UC Berkeley, Carnegie Mellon) et hybrides croissants. IFM s'inscrit dans cette troisième catégorie, en compétition directe avec des pipelines teacher-student d'ETH Zurich ou des frameworks comme DribbleBot. La publication ne mentionne aucun déploiement industriel ni partenariat commercial : il s'agit d'une contribution académique, dont la valeur pratique dépendra de sa transferabilité à des robots commerciaux comme l'Unitree Go2 ou le Boston Dynamics Spot, plateformes sur lesquelles plusieurs groupes appliquent déjà des méthodologies similaires.

RecherchePaper
1 source
Cartes de coût conditionnées à la tâche pour la locomotion sur pattes
3arXiv cs.RO 

Cartes de coût conditionnées à la tâche pour la locomotion sur pattes

Une équipe de recherche a publié sur arXiv (identifiant 2605.00261, mai 2025) une méthode permettant aux robots à pattes de naviguer plus fiablement sur des terrains non structurés en modélisant l'incertitude épistémique dans la prédiction des appuis. Le principe : un modèle appris, entraîné à prédire les points de contact viables au sol, intègre désormais une estimation de sa propre incertitude, conditionnée à la fois sur les relevés de hauteur du terrain et sur la commande de mouvement transmise au robot. Testé en simulation et en conditions réelles, le système distingue les zones de terrain "connues" (in-distribution) des zones hors distribution (OOD), c'est-à-dire absentes des données d'entraînement. Cette incertitude est intégrée dans un cadre unifié de génération de costmaps, directement exploitable par un planificateur de trajectoire. Résultat principal : jusqu'à 37 % de réduction de l'erreur de faisabilité en simulation, avec un comportement de planification plus robuste qu'un modèle reposant uniquement sur la géométrie du terrain. L'enjeu est concret pour les intégrateurs de robots à pattes en milieu industriel. La plupart des systèmes appris actuels échouent silencieusement sur des terrains hors distribution : le robot tente quand même le franchissement, avec des risques de chute ou de blocage. En rendant l'incertitude explicite et traduite en coût dans le planificateur, le système peut délibérément éviter les zones qu'il ne reconnaît pas. C'est une avancée pour le déploiement en environnements non contrôlés, là où il est impossible de couvrir exhaustivement tous les types de surface lors de l'entraînement. La méthode offre aussi une voie de sortie au problème des datasets limités : un modèle entraîné sur une distribution restreinte peut opérer en sécurité en sachant délimiter son propre domaine de compétence. Cette problématique s'inscrit dans un effort de recherche plus large visant à combler le gap sim-to-real en locomotion à pattes, défi qui mobilise des acteurs comme ANYbotics (dont l'ANYmal est déployé en inspection industrielle), Boston Dynamics (Spot) ou Unitree Robotics. La tendance dominante jusqu'ici consistait à accumuler davantage de données et à diversifier les terrains de simulation. L'approche par quantification d'incertitude offre une voie complémentaire, particulièrement adaptée aux déploiements à domaine restreint où la collecte de données exhaustive est coûteuse. Les auteurs ne mentionnent ni timeline de commercialisation ni partenariat industriel identifié : il s'agit d'un preprint académique, sans validation sur robot commercial nommé.

RecherchePaper
1 source
SABER : apprentissage d'une affordance sémantique par attention pour la locomotion des robots à pattes
4arXiv cs.RO 

SABER : apprentissage d'une affordance sémantique par attention pour la locomotion des robots à pattes

SABER, une politique d'apprentissage par renforcement sans planificateur, est présentée dans un article publié sur arXiv le 21 septembre 2026 (2609.21572). Elle ajoute à la géométrie du terrain, déjà exploitée par les politiques de locomotion perceptive, une couche de permission de contact sémantique : chaque cellule d'une carte terrain unifiée encode la géométrie 3D locale et un coût de contact. Son mécanisme central modifie la cross-attention par un biais sémantique signé et appris, pondéré selon ce coût et la distance au pied le plus proche, si bien qu'un obstacle n'influence l'attention que tant qu'il peut affecter le prochain appui. Testée en conditions réelles sur un robot quadrupède Unitree B2, en intérieur et extérieur, face à quatre classes d'obstacles sémantiques, la politique montre par ablation qu'un retrait du seul biais sémantique fait grimper les contacts interdits de 55%, sans dégrader le suivi de vitesse. Ce résultat cible un angle mort concret pour la robotique industrielle : une politique purement géométrique peut juger traversable un tuyau, une pelouse ou un carton fragile, alors qu'un contact à cet endroit peut endommager l'équipement, déstabiliser le robot ou mettre en danger le site. Pour les intégrateurs déployant des robots à pattes en usine ou en entrepôt, SABER comble une limite connue des politiques apprises : la géométrie seule ne garantit pas un comportement sûr autour d'objets sensibles. Son apport principal tient à l'absence de coût mesurable sur le suivi de trajectoire, ce qui contredit l'hypothèse répandue selon laquelle des règles de sécurité supplémentaires dégraderaient nécessairement l'agilité. Cela confirme aussi que les mécanismes d'attention, déjà centraux dans les modèles vision-langage-action, peuvent structurer des politiques bas niveau pour la locomotion. SABER prolonge une recherche sur la locomotion perceptive qui a surtout intégré la géométrie du terrain, sans traiter systématiquement le sens des surfaces. Contrairement aux approches à planificateur explicite, elle reste une politique bout-en-bout entraînée directement par renforcement. Le choix du Unitree B2, quadrupède très utilisé en recherche académique, situe ce travail comme une validation scientifique sim-to-real, sans partenaire industriel ni pilote annoncé, les suites possibles visant d'autres morphologies, davantage de classes sémantiques, ou une intégration à des piles combinant perception, navigation et manipulation.

RecherchePaper
1 source