Aller au contenu principal
Hopping Monopode Alimenté par la Hanche
RecherchearXiv cs.RO 

Hopping Monopode Alimenté par la Hanche

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publié sur arXiv (référence 2608.10387) décrit une nouvelle stratégie de saut pour les monopodes planaires à tangage libre, des robots à une seule jambe dont l'inclinaison avant-arrière n'est pas bloquée mécaniquement. Les couples de réaction produits par le contrôleur PD à anticipation qui stabilise le tangage sont recyclés pour compenser les pertes d'énergie dues au frottement, en déplaçant la position du centre de masse. Une nouvelle politique de pas répartit ensuite cette énergie entre les degrés de liberté radial et angulaire, selon un compromis réglable entre vitesse de croisière et hauteur de rebond. Une analyse mathématique par moyennisation hybride fournit des formules fermées pour les points fixes de la démarche, validées par simulation puis par des essais physiques sur le robot Penn Jerboa, à l'université de Pennsylvanie, avec des vitesses stables de 1,02 à 1,77 m/s (5,10 à 8,85 longueurs de jambe par seconde).

Ce travail s'attaque à un problème rarement explicité dans les vitrines commerciales de robots à pattes : la gestion fine de l'énergie et de la stabilité d'une jambe soumise à des pertes par frottement, hors de tout effet de démonstration. Contrairement aux contrôleurs empiriques ou aux approches par apprentissage qui dominent les démonstrations de locomotion dynamique, l'apport est de fournir des relations analytiques explicites entre paramètres physiques, paramètres de contrôle et performance, facilitant le réglage plutôt que le tâtonnement. Ce cadre intéresse les concepteurs de bipèdes, quadrupèdes et exosquelettes confrontés à l'arbitrage entre vitesse et hauteur de rebond.

Le Penn Jerboa s'inscrit dans une lignée de robots monopodes et bondissants étudiés depuis les hoppers pneumatiques du MIT dans les années 1980, une tradition de recherche en locomotion dynamique aujourd'hui prolongée par des plateformes bipèdes de laboratoire et par les robots à pattes commerciaux de Boston Dynamics ou Unitree. À la différence de ces derniers, cette publication reste un travail de contrôle non linéaire fondamental, sans produit ni calendrier de commercialisation annoncé. Les auteurs présentent leurs résultats comme une base analytique transposable à des architectures bipèdes plus complexes, pour de futurs travaux sur l'intégration de cette gestion d'énergie dans des robots à pattes multiples.

À lire aussi

GLAMDRING : apprentissage de la démarche et co-conception de la morphologie par renforcement de CPG
1arXiv cs.RO 

GLAMDRING : apprentissage de la démarche et co-conception de la morphologie par renforcement de CPG

Un article publié le 18 septembre 2026 sur arXiv sous la référence 2609.19452 présente GLAMDRING (Gait Learning And Morphology co-Design via Reinforcement Learning of CPGs), un framework de recherche qui conçoit simultanément la morphologie d'un robot quadrupède et le contrôleur qui le pilote. À partir de quatre contraintes d'entrée (plage de vitesse d'avancement visée, budget de puissance par actionneur, bibliothèque d'actionneurs disponibles et charge utile cible), le système produit une géométrie de liaisons, un choix d'actionneur par articulation, et une politique de démarche fondée sur des générateurs de patrons centraux (CPG) à oscillateurs de Hopf. Les conceptions candidates sont classées selon un objectif choisi: vitesse maximale, coût de transport (CoT) minimal, ou marge de charge utile maximale. Plutôt que d'entraîner une politique par apprentissage par renforcement pour chaque morphologie candidate, approche jugée trop coûteuse, les auteurs en entraînent un petit nombre fixe sur l'ensemble de l'espace des morphologies, puis déduisent a posteriori longueurs de liaisons et actionneurs à partir de l'enveloppe opérationnelle enregistrée par la politique. Une démonstration en conditions réelles est mentionnée, sans détail sur le robot utilisé ni le nombre d'essais dans le résumé. Le travail s'attaque à un problème central de la locomotion à pattes: corps et démarche sont couplés, la morphologie optimale dictant la façon de piloter le robot, tandis que la démarche optimale dépend de la structure physique. La plupart des méthodes existantes séparent les deux étapes, figeant d'abord le châssis avant d'apprendre le contrôleur, ce qui plafonne les performances. Les auteurs rapportent trois résultats: la co-conception corps-démarche est nécessaire pour satisfaire les contraintes de locomotion; c'est la faisabilité de l'enveloppe des actionneurs, et non le seul succès de la marche, qui détermine la charge utile réellement atteignable; et des démarches animales canoniques émergent naturellement dans la plupart des conceptions à partir de la seule morphologie et des contraintes, sans être imposées. Pour des robots destinés à des terrains non structurés (sites de catastrophe, surfaces planétaires, champs agricoles) où la plateforme idéale n'existe pas encore, la méthode promet de remplacer une recherche exhaustive coûteuse par un nombre réduit et fixe d'entraînements. GLAMDRING s'inscrit dans le courant plus large du co-design corps-contrôleur en robotique, qui cherche à dépasser les pipelines où le châssis est fixé manuellement avant que l'apprentissage n'intervienne seulement sur le contrôle. Classé comme nouvelle soumission sur arXiv, le résumé ne mentionne ni entreprise, ni laboratoire, ni acteur FR/EU associé au projet: il s'agit d'une contribution académique validée en simulation et par une unique démonstration matérielle, non d'un produit commercialisé. Les suites attendues, extension au-delà du quadrupède, validation sur davantage de plateformes physiques, comparaison chiffrée aux méthodes de co-conception existantes, restent absentes de ce résumé.

RecherchePaper
1 source
Apprentissage par renforcement informé par la dynamique pour la locomotion agile et économe en énergie d'un quadricoptère sauteur monopode
2arXiv cs.RO 

Apprentissage par renforcement informé par la dynamique pour la locomotion agile et économe en énergie d'un quadricoptère sauteur monopode

Une équipe de recherche en robotique présente un cadre d'apprentissage par renforcement (RL) appliqué à un quadcopter monopode à sauts, un robot hybride combinant rotors et une jambe unique à ressort pour se déplacer par bonds plutôt que par vol stationnaire pur. Publié sur arXiv (2609.15399v1, article de recherche, pas d'annonce produit), le travail introduit une méthode dite "dynamics-informed" où une valeur cible d'énergie spécifique est intégrée directement dans la fonction de récompense, ce qui contraint l'optimisation à rester sur une trajectoire énergétique physiquement viable. Le système récompense aussi la cohérence de phase entre les appuis au sol, ce qui encourage un mouvement d'impulsion bio-inspiré pendant la phase de contact, et pénalise le gaspillage électromécanique pour que les moteurs génèrent une impulsion efficace sans recourir à des machines à états programmées à la main. Validé uniquement en simulation MuJoCo, et non sur un prototype physique, le contrôleur régule la hauteur de saut et suit une vitesse d'avancement jusqu'à 2,0 m/s malgré un fort couplage entre l'attitude du robot et les phases de contact au sol, tout en réduisant la consommation d'énergie de 82% par rapport à un vol stationnaire classique et de 73% par rapport à une politique RL non contrainte énergétiquement. L'enjeu dépassе la simple performance: les auteurs ciblent explicitement le "reward hacking", un travers connu du RL où l'algorithme trouve des raccourcis qui maximisent la récompense sans produire un comportement physiquement sensé ou économe. En forçant l'optimisation à rester sur une enveloppe énergétique réaliste, l'étude propose une piste méthodologique transférable à d'autres robots hybrides ou legged, un sujet clé pour les intégrateurs qui cherchent à réduire l'autonomie limitée des drones et des robots à pattes. Elle illustre aussi les limites actuelles du secteur: la démonstration reste cantonnée au simulateur, ce qui laisse ouverte la question classique du transfert sim-to-real. Les robots aériens à pattes forment une catégorie encore émergente, cherchant à combiner l'agilité du saut avec l'efficacité énergétique du vol, deux modes de locomotion habituellement traités séparément dans la littérature. L'article ne mentionne ni partenaire industriel ni calendrier de test matériel, ce qui situe cette contribution au stade de la recherche amont, avec un prototype physique et une validation réelle comme suites logiques attendues.

RecherchePaper
1 source
PAVE : alignement prédictif et évolution guidée par la valeur pour les politiques monde-action
3arXiv cs.RO 

PAVE : alignement prédictif et évolution guidée par la valeur pour les politiques monde-action

Un article publié le 30 août 2026 sur arXiv sous la référence 2608.30378 présente PAVE (Predictive Alignment and Value-Guided Evolution for World-Action Policies), une méthode d'entraînement pour les politiques vision-langage-action (VLA) qui génèrent des actions robotiques continues. Les auteurs pointent deux limites du clonage de comportement standard: les représentations apprises ne sont pas explicitement contraintes à décrire l'évolution de la scène à plusieurs échelles temporelles, et les trajectoires de déploiement de qualité inégale sont réutilisées sans distinguer la dynamique physique utile du comportement indésirable. PAVE conserve un objectif JEPA local à décalage fixe et y ajoute un alignement de transition multi-horizon calculé à 25%, 50%, 75% et 100% de l'épisode restant, des cibles qui n'existent que pendant l'entraînement et ne transmettent aucun token futur explicite à la tête d'action. La méthode entraîne en parallèle un critique de valeur distributionnel indépendant sur les trajectoires cumulées de déploiement, calcule des avantages à N pas alignés sur des blocs d'action, puis les convertit en conditions textuelles positives, négatives ou nulles pour un acteur par flow matching. Le prédicteur multi-horizon et le critique sont retirés à l'exécution en ligne, préservant une génération d'action directe à partir de l'observation courante, de l'instruction et de la proprioception. Les auteurs rapportent la meilleure performance globale sur trois benchmarks de simulation. Ce travail s'attaque à deux angles morts des politiques VLA génératives: leur incapacité à raisonner explicitement sur l'évolution d'une tâche dans le temps, et le gaspillage de données de déploiement hétérogènes, habituellement écartées faute de signal de valeur. En couplant un objectif prédictif type JEPA à un critique appris a posteriori, PAVE cherche à faire cohabiter apprentissage de représentation et amélioration de politique guidée par la récompense sans alourdir l'inférence, un compromis qui intéresse directement les intégrateurs cherchant à exploiter des logs de déploiement imparfaits plutôt que de ne s'entraîner que sur des démonstrations propres. Si le résultat se confirme au-delà de la simulation, il renforcerait l'idée que les architectures VLA peuvent absorber un signal d'amélioration proche du reinforcement learning sans sacrifier la latence de l'exécution directe. La validation ne porte toutefois que sur trois benchmarks de simulation non identifiés, sans transfert documenté vers un robot réel: la revendication de "meilleure performance globale" reste une annonce de recherche, pas une preuve de généralisation sim-to-real. PAVE s'inscrit dans une lignée de recherche qui enrichit les politiques robotiques génératives d'un objectif de type modèle du monde, dans la filiation des architectures JEPA conçues pour apprendre des représentations prédictives sans reconstruction pixel par pixel. L'acteur par flow matching, conditionné dynamiquement par un signal de valeur positif, négatif ou nul, rejoint une tendance plus large consistant à coupler génération d'action continue et apprentissage hors ligne à partir de trajectoires de déploiement imparfaites plutôt que de les écarter. Le papier ne mentionne ni partenaire industriel, ni déploiement sur robot physique, ni date de publication de code: il s'agit d'une contribution académique dont la suite logique attendue serait une évaluation sur matériel réel et une comparaison directe avec les politiques VLA de référence du secteur.

RechercheOpinion
1 source
Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence
4arXiv cs.RO 

Apprentissage de la perception tactile à partir d'une détection mono-point haute fréquence

Un nouveau preprint mis en ligne sur arXiv en septembre 2026 (identifiant 2609.24621) présente SpectRobot, un framework qui convertit des signaux tactiles issus d'un capteur unique en spectrogrammes temps-fréquence compacts, sous forme d'images de taille fixe exploitables par des encodeurs de vision standards. Contrairement aux approches dominantes qui misent sur des réseaux de capteurs tactiles répartis spatialement sur la surface de contact, SpectRobot exploite la richesse dynamique d'une mesure ponctuelle à haute bande passante, avec des fréquences d'échantillonnage allant jusqu'à 100 kHz. Dans l'implémentation testée, les capteurs sont montés à distance de la surface de contact tout en restant couplés mécaniquement à elle, ce qui limite leur exposition directe à l'usure. Les auteurs rapportent trois résultats : un robot parvient à résoudre une tâche de manipulation visuellement occultée en s'appuyant uniquement sur des signaux de vibration ponctuels ; la profondeur de l'historique temporel utilisé influence fortement la performance de la politique apprise, tandis que la bande passante du capteur détermine l'information spectrale disponible ; et la même représentation en spectrogramme fonctionne indifféremment avec des capteurs mesurant l'accélération, la force ou la déformation. L'équipe précise avoir reproduit ces résultats avec du matériel disponible dans le commerce, sans instrumentation de laboratoire spécialisée. Ce travail répond à une limite concrète du secteur : les réseaux de capteurs tactiles denses restent coûteux, fragiles et difficiles à industrialiser sur des mains ou pinces robotiques destinées à un usage prolongé. En montrant qu'un unique point de mesure à haute fréquence, converti en image spectrale exploitable par les architectures de vision déjà utilisées dans les pipelines d'apprentissage de type VLA (vision-language-action), peut remplacer ou compléter la densité spatiale, SpectRobot ouvre une voie potentiellement moins chère et plus robuste pour intégrer le retour de contact dans des systèmes de manipulation appris de bout en bout. Pour les intégrateurs et les équipes R&D en robotique dextre, l'intérêt est double : le capteur, éloigné de la zone de friction, dure plus longtemps en environnement industriel exigeant, et la représentation en spectrogramme s'insère directement dans des pipelines de perception déjà construits pour la vision. Le résultat le plus significatif reste la démonstration qu'une tâche masquée visuellement peut être résolue par le seul canal tactile haute fréquence, ce qui appuie l'idée que la fusion de capteurs, plutôt que la seule vision, sera nécessaire pour la manipulation fine en conditions réelles. La démarche s'inscrit dans une tendance plus large de l'apprentissage robotique, où le tactile est de plus en plus intégré aux pipelines de manipulation, mais où la plupart des capteurs employés jusqu'ici privilégient la densité spatiale au détriment de la bande passante temporelle. SpectRobot prend le contrepied de cette course à la résolution spatiale, une direction que les auteurs présentent comme complémentaire, et non substitutive, aux approches à haute densité de capteurs. Le document reste à ce stade un preprint arXiv fraîchement publié, sans validation industrielle ni partenariat annoncé avec un fabricant de robots ou de mains manipulatrices, et sans calendrier de transfert vers un produit commercial. La suite évoquée par les auteurs consiste à étendre l'approche à davantage de tâches de manipulation dextre et à d'autres modalités de capteurs mediées par l'accélération, la force ou la déformation, afin de rendre le tactile haute fréquence accessible sans recourir à une instrumentation de recherche coûteuse.

RecherchePaper
1 source