Aller au contenu principal
Apprentissage de la locomotion sur terrain discret via une détection minimale de proximité
RecherchearXiv cs.RO 

Apprentissage de la locomotion sur terrain discret via une détection minimale de proximité

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche propose d'intégrer des capteurs de proximité infrarouges directement dans les pattes d'un robot quadrupède, pour lui donner une perception "pré-contact" du terrain avant même que le pied ne touche le sol. Contrairement aux caméras de profondeur ou aux LiDAR, ces capteurs sont peu coûteux, fonctionnent à haute fréquence et restent insensibles aux auto-occlusions propres à la locomotion dynamique. Les signaux qu'ils produisent sont intégrés dans un pipeline d'apprentissage par renforcement, entraîné en simulation puis transféré sur le robot réel avec, selon les auteurs, une bonne fidélité. Les tests ont porté sur des terrains discontinus, trous et pierres de gué, des configurations réputées difficiles pour les systèmes de perception globale classiques, sujets aux occlusions et à la dérive d'estimation d'état. Le site du projet (sites.google.com/view/foot-tof) présente les démonstrations associées, qu'il convient toutefois de considérer comme des résultats de laboratoire plutôt que comme une validation en conditions réelles à grande échelle.

L'intérêt de l'approche tient à la position qu'elle occupe entre deux extrêmes du secteur : les suites de perception globale (LiDAR, caméras de profondeur), puissantes mais lourdes en calcul et sensibles aux latences et aux occlusions, et la proprioception pure, qui ne réagit qu'après l'impact. En ajoutant une couche de perception locale et quasi instantanée, ce travail illustre une tendance de fond dans la robotique locomotrice : réduire la dépendance à des pipelines de vision denses et coûteux au profit de capteurs simples exploités intelligemment par du RL. Pour les intégrateurs de robots quadrupèdes destinés à des environnements non structurés, chantiers, sites industriels, terrains extérieurs, cela ouvre la voie à des architectures moins gourmandes en puissance de calcul embarquée.

Ce travail s'inscrit dans la lignée des recherches récentes en apprentissage par renforcement pour la locomotion dynamique, qui ont déjà permis à des robots quadrupèdes de franchir des obstacles complexes en s'appuyant sur des perceptions visuelles riches. En proposant une alternative ou un complément low-cost et low-latency à ces stacks visuels, l'étude ouvre des pistes pour des déploiements ultérieurs combinant capteurs de contact et perception globale, sans toutefois préciser à ce stade de calendrier d'industrialisation.

À lire aussi

Apprentissage d'une locomotion humanoïde adaptée au terrain sur sol granulaire
1arXiv cs.RO 

Apprentissage d'une locomotion humanoïde adaptée au terrain sur sol granulaire

Un article publié sur arXiv (identifiant 2609.10286, soumis en septembre 2026) présente une méthode pour faire marcher des robots humanoïdes sur des terrains granulaires (sable, gravats basaltiques) en s'appuyant sur un modèle de contact physique baptisé 3D RFT (three-dimensional resistive force theory). Contrairement aux modèles de contact rigides ou aux modèles granulaires simplifiés qui reposent sur des heuristiques pour la composante tangentielle, ce solveur reproduit fidèlement la pénétration du pied dans le sol meuble et la traînée tangentielle qui en résulte. Les chercheurs entraînent ensuite un contrôleur de locomotion adaptatif par apprentissage par renforcement en configuration "teacher-student", où un autoencodeur variationnel (VAE) compresse les caractéristiques du terrain en une représentation latente compacte permettant une identification et une adaptation en zero-shot. Les simulations, menées avec la méthode des points matériels (MPM) sur le moteur physique NVIDIA Newton, montrent un taux de réussite nettement supérieur aux méthodes de référence sur des terrains granulaires jamais vus. La validation s'étend à des essais matériels réels sur basalte, sable sec et sable de plage. L'enjeu dépasse la simple prouesse académique : la marche sur sol meuble reste un angle mort connu des humanoïdes, dont les politiques de contrôle sont généralement entraînées sur des sols rigides et échouent lorsque le pied s'enfonce de façon imprévisible. En démontrant un transfert simulation vers réel fiable sur granulats, ce travail répond directement à une limite critique pour tout déploiement hors environnement d'usine parfaitement plat, chantiers, carrières, zones côtières ou terrains de secours, où les modèles de contact rigide échouent typiquement. Les auteurs revendiquent la première démonstration de locomotion humanoïde agile sur terrain granulaire réel, un signal utile pour les intégrateurs évaluant la robustesse réelle des plateformes VLA et RL au-delà des sols de laboratoire. Le travail s'inscrit dans la lignée des recherches en RFT appliquées à la locomotion sur sable, jusqu'ici surtout testées sur robots à pattes plus simples ou petits systèmes bio-inspirés, et profite des avancées récentes en simulation physique haute fidélité (MPM, moteur Newton de NVIDIA) pour rendre l'entraînement RL exploitable à l'échelle humanoïde. Les auteurs mettent à disposition une page de projet dédiée avec démonstrations vidéo, sans toutefois préciser de calendrier de déploiement industriel au-delà de la validation expérimentale publiée.

RecherchePaper
1 source
RPL : un apprentissage robuste de la locomotion perceptive humanoïde sur terrains difficiles
2arXiv cs.RO 

RPL : un apprentissage robuste de la locomotion perceptive humanoïde sur terrains difficiles

Des chercheurs présentent RPL (Robust Perceptive Locomotion), un cadre d'entraînement en deux étapes pour la locomotion multidirectionnelle de robots humanoïdes sur terrains difficiles, décrit dans une version révisée (v2) d'un article déposé sur arXiv (2602.03002). La méthode entraîne d'abord des politiques expertes spécifiques à chaque type de terrain, à partir d'observations privilégiées de cartes de hauteur, pour maîtriser séparément locomotion et manipulation. Ces experts sont ensuite distillés dans une politique unique basée sur un transformer, alimentée par plusieurs caméras de profondeur couvrant un large champ de vue. Deux techniques rendent cette distillation robuste en conditions multidirectionnelles : une mise à l'échelle des caractéristiques de profondeur pilotée par les commandes de vitesse, et un masquage aléatoire latéral pour gérer les observations de profondeur asymétriques et les largeurs de terrain inédites. Pour entraîner ce système à grande échelle, les auteurs ont développé un moteur de simulation multi-profondeur qui projette des rayons sur les maillages dynamiques du robot et les maillages statiques du terrain en environnements massivement parallèles, avec un gain de vitesse de 5 fois par rapport aux pipelines de rendu de profondeur des simulateurs existants, tout en modélisant latence, bruit et pertes de capteur réalistes. En conditions réelles, le robot a porté une charge de 2 kg tout en franchissant des pentes de 20 degrés, des escaliers aux marches de 22, 25 et 30 cm, ainsi que des pierres de gué de 25 cm sur 25 cm séparées par des espaces de 60 cm. Cette démonstration s'attaque directement à un angle mort du secteur : la plupart des vidéos promotionnelles de robots humanoïdes montrent une marche avant sur sol plat, alors que la robustesse multidirectionnelle sur terrain irrégulier, avec charge utile, reste rarement documentée en conditions réelles et non scénarisées. Pour les intégrateurs industriels envisageant des humanoïdes en logistique ou en inspection de sites, la capacité à transporter 2 kg sur escaliers et pierres de gué constitue un signal plus parlant que des mesures de vitesse ou de temps de cycle en environnement contrôlé. RPL s'inscrit dans la lignée des approches d'apprentissage par distillation enseignant-élève, déjà utilisées pour la locomotion quadrupède et bipède, mais appliquées ici spécifiquement au défi de la vision par profondeur multidirectionnelle chez l'humanoïde. L'accent mis sur un simulateur maison optimisé pour le rendu de profondeur souligne à quel point le goulot d'étranglement actuel du secteur reste moins l'algorithme de contrôle que l'infrastructure de simulation capable de générer des données réalistes à l'échelle. L'article ne précise pas de plateforme robotique commerciale ni de calendrier de déploiement, s'agissant d'une contribution de recherche plutôt que d'une annonce produit.

RecherchePaper
1 source
Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL
3arXiv cs.RO 

Cartographie de terrain à faible coût pour la locomotion humanoïde par apprentissage par renforcement : Loco-Loco-RL

Un article de recherche publié sur arXiv (2609.19041v1) en septembre 2026, intitulé "Loco-Loco-RL: Low-Cost Terrain Mapping for Humanoid Locomotion with Reinforcement Learning", propose une méthode de perception de terrain low-cost pour la locomotion humanoïde. Plutôt que les caméras de profondeur ou LiDAR habituels, coûteux et gourmands en calcul, les auteurs utilisent un simple capteur time-of-flight bon marché pour construire une représentation 3D locale du terrain. Pour exploiter ce signal épars, ils introduisent une politique transformer temporelle à compression de tokens: les observations proprioceptives et de terrain sont tokenisées, traitées par un transformer à self-attention multi-tête, compressées via un module MLP en espace latent, puis stockées dans un historique glissant de 15 pas de temps qu'un second transformer à cross-attention exploite pour la politique de renforcement. La méthode a été validée par transfert sim-to-real sur un robot humanoïde physique, sur un benchmark de locomotion en terrain accidenté, avec une marche jugée robuste malgré la faible résolution du capteur. Aucun partenaire industriel ni déploiement commercial n'est mentionné: c'est un travail de recherche, pas une annonce produit, et aucune plateforme humanoïde n'est nommée. L'intérêt pour les intégrateurs reste néanmoins direct, car le coût et la consommation des capteurs de perception pèsent lourd dans le bill of materials des humanoïdes et freinent leur déploiement en volume. En montrant qu'un capteur ToF bon marché et basse résolution suffit à une locomotion robuste sur terrain accidenté grâce à une architecture transformer compressée, le travail apporte un contre-exemple concret à l'idée qu'une perception haute résolution est indispensable au franchissement d'obstacles, une piste pour réduire les coûts de production à l'échelle. L'approche s'inscrit dans une lignée de travaux en apprentissage par renforcement pour la locomotion de robots à pattes, où la perception extéroceptive du terrain reste coûteuse à traiter face à la simple proprioception. Elle se positionne face aux approches concurrentes misant sur des caméras de profondeur ou LiDAR embarqués, plus riches mais plus chers et plus lourds à calculer en temps réel. L'article ne précise ni le robot utilisé pour les essais ni de calendrier de déploiement industriel: à ce stade, c'est un preprint validant un principe en laboratoire, sans partenaire ni pilote annoncés. La suite logique, non détaillée par les auteurs, serait une extension à des terrains plus variés et une comparaison directe des coûts et performances face aux stacks LiDAR ou caméra de profondeur standards du secteur.

RecherchePaper
1 source
Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence
4arXiv cs.RO 

Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence

Un nouveau preprint mis en ligne sur arXiv en septembre 2026 (identifiant 2609.24621) présente SpectRobot, un framework qui convertit des signaux tactiles issus d'un capteur unique en spectrogrammes temps-fréquence compacts, sous forme d'images de taille fixe exploitables par des encodeurs de vision standards. Contrairement aux approches dominantes qui misent sur des réseaux de capteurs tactiles répartis spatialement sur la surface de contact, SpectRobot exploite la richesse dynamique d'une mesure ponctuelle à haute bande passante, avec des fréquences d'échantillonnage allant jusqu'à 100 kHz. Dans l'implémentation testée, les capteurs sont montés à distance de la surface de contact tout en restant couplés mécaniquement à elle, ce qui limite leur exposition directe à l'usure. Les auteurs rapportent trois résultats : un robot parvient à résoudre une tâche de manipulation visuellement occultée en s'appuyant uniquement sur des signaux de vibration ponctuels ; la profondeur de l'historique temporel utilisé influence fortement la performance de la politique apprise, tandis que la bande passante du capteur détermine l'information spectrale disponible ; et la même représentation en spectrogramme fonctionne indifféremment avec des capteurs mesurant l'accélération, la force ou la déformation. L'équipe précise avoir reproduit ces résultats avec du matériel disponible dans le commerce, sans instrumentation de laboratoire spécialisée. Ce travail répond à une limite concrète du secteur : les réseaux de capteurs tactiles denses restent coûteux, fragiles et difficiles à industrialiser sur des mains ou pinces robotiques destinées à un usage prolongé. En montrant qu'un unique point de mesure à haute fréquence, converti en image spectrale exploitable par les architectures de vision déjà utilisées dans les pipelines d'apprentissage de type VLA (vision-language-action), peut remplacer ou compléter la densité spatiale, SpectRobot ouvre une voie potentiellement moins chère et plus robuste pour intégrer le retour de contact dans des systèmes de manipulation appris de bout en bout. Pour les intégrateurs et les équipes R&D en robotique dextre, l'intérêt est double : le capteur, éloigné de la zone de friction, dure plus longtemps en environnement industriel exigeant, et la représentation en spectrogramme s'insère directement dans des pipelines de perception déjà construits pour la vision. Le résultat le plus significatif reste la démonstration qu'une tâche masquée visuellement peut être résolue par le seul canal tactile haute fréquence, ce qui appuie l'idée que la fusion de capteurs, plutôt que la seule vision, sera nécessaire pour la manipulation fine en conditions réelles. La démarche s'inscrit dans une tendance plus large de l'apprentissage robotique, où le tactile est de plus en plus intégré aux pipelines de manipulation, mais où la plupart des capteurs employés jusqu'ici privilégient la densité spatiale au détriment de la bande passante temporelle. SpectRobot prend le contrepied de cette course à la résolution spatiale, une direction que les auteurs présentent comme complémentaire, et non substitutive, aux approches à haute densité de capteurs. Le document reste à ce stade un preprint arXiv fraîchement publié, sans validation industrielle ni partenariat annoncé avec un fabricant de robots ou de mains manipulatrices, et sans calendrier de transfert vers un produit commercial. La suite évoquée par les auteurs consiste à étendre l'approche à davantage de tâches de manipulation dextre et à d'autres modalités de capteurs mediées par l'accélération, la force ou la déformation, afin de rendre le tactile haute fréquence accessible sans recourir à une instrumentation de recherche coûteuse.

RecherchePaper
1 source