Aller au contenu principal
WaveForward : un robot quadrupède omnidirectionnel sur roulettes passives
RecherchearXiv cs.RO 

WaveForward : un robot quadrupède omnidirectionnel sur roulettes passives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs présente WaveForward, un robot quadrupède à roues passives (roulettes pivotantes standard, dites casters) capable de se déplacer dans toutes les directions sans roues motorisées. Publiée le 25 juin 2026 sur arXiv (référence 2606.25299), l'étude propose une architecture de contrôle par apprentissage par renforcement de type acteur-critique asymétrique, qui exploite en phase d'entraînement des informations privilégiées sur les angles et vitesses instantanées des roulettes, informations non accessibles à l'inférence sur le robot réel. Le système génère le mouvement en actionnant les articulations des pattes pour modifier l'axe de rotation des roulettes et créer différents modes de propulsion par oscillation. Lors de tests de slalom et de changements de mode de propulsion, le COT (coût de transport) a été réduit jusqu'à 89,1 % par rapport à une locomotion purement en pas de jambes.

Cette réduction de 89,1 % du COT positionne ce type de robot hybride dans une plage d'efficacité énergétique comparable aux AMR à roues conventionnels, sans les contraintes mécaniques et électroniques liées aux roues motorisées. L'usage de roulettes passives standard et bon marché ouvre une voie de conception bien moins coûteuse que les architectures rivales équipées de roues actionnées, comme l'ANYmal-W d'ETH Zurich, le Spot avec module de roues de Boston Dynamics, ou le B2-W d'Unitree. La technique d'acteur-critique asymétrique, où l'acteur opère sans les états des roulettes à l'inférence, illustre concrètement l'apport du privileged learning au sim-to-real en locomotion robotique, une direction de recherche portée depuis quelques années par les labos de l'ETH ASL et de CMU.

Les robots hybrides roues-pattes constituent un champ actif depuis une décennie, avec des jalons comme le Centauro de l'IIT de Gênes, les travaux ETH sur ANYmal-W et les déploiements commerciaux récents d'Unitree (B2-W) et Ghost Robotics. L'originalité de WaveForward réside dans l'élimination du sous-système de roues motorisées, principale source de coût et de complexité électronique, en exploitant la dynamique des roulettes pivotantes via la commande des pattes seules. À ce stade, le travail reste une démonstration académique : aucun déploiement industriel ni partenaire commercial n'est mentionné. Les prochaines étapes logiques incluent des tests sur terrains non structurés et une évaluation de robustesse face aux irrégularités de surface, conditions où les roulettes passives montrent typiquement leurs limites face à des roues actionnées.

Impact France/UE

ETH Zurich (ANYmal-W) et l'IIT de Gênes (Centauro) sont cités comme références de l'état de l'art, mais l'équipe WaveForward n'est pas identifiée comme européenne ; l'approche roulettes passives bon marché reste un signal indirect pour les équipes R&D EU sur les robots hybrides roues-pattes.

À lire aussi

Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes
1arXiv cs.RO 

Apprentissage par renforcement guidé pour les sauts omnidirectionnels en 3D dans les robots quadrupèdes

Une équipe de chercheurs a publié sur arXiv (référence 2507.16481, troisième version) une méthode d'apprentissage par renforcement guidé destinée à permettre aux robots quadrupèdes d'effectuer des sauts omnidirectionnels en trois dimensions. L'approche combine des courbes de Bézier, classiquement utilisées pour la planification de trajectoires lissées, avec un modèle de mouvement rectiligne uniformément accéléré (UARM), qui encode une intuition physique du saut directement dans la boucle d'entraînement. Les résultats sont validés en simulation et sur robot réel, mais le résumé ne précise ni la plateforme matérielle utilisée ni les métriques chiffrées de performance, ce qui limite l'évaluation indépendante de la contribution. L'intérêt principal de ce travail réside dans l'adresse simultanée de deux limitations majeures des approches existantes. Les méthodes d'optimisation classiques (MPC, trajectory optimization) produisent des sauts contrôlables mais exigent une connaissance fine des paramètres du robot et du terrain, ce qui fragilise leur robustesse en conditions réelles. À l'inverse, l'apprentissage par renforcement bout-en-bout souffre d'une complexité d'échantillonnage élevée, de millions de simulations nécessaires, et d'une imprévisibilité des trajectoires qui complique la certification de sécurité, un prérequis non négociable pour les déploiements industriels. En injectant une structure physique dans la boucle d'entraînement, les auteurs visent à réduire le coût d'apprentissage tout en produisant des mouvements explicables, dont la logique peut être auditée et certifiée. Le saut dynamique pour robots quadrupèdes est un problème ouvert depuis plusieurs années, car il concentre les défis du transfert sim-to-réel : contacts impulsionnels, rigidité des actionneurs, imprécision des estimations d'état. Le Robotics Systems Lab d'ETH Zurich (ANYmal) et les équipes de l'UC Berkeley ont déjà démontré des sauts via RL pur, tandis que Boston Dynamics et Unitree intègrent ces capacités dans leurs plateformes commerciales. Ce papier s'inscrit dans la tendance des approches hybrides modèle-apprentissage, qui cherchent à concilier la robustesse du RL avec la prévisibilité des méthodes analytiques, une direction que poursuivent également des équipes européennes comme le LAAS-CNRS ou l'INRIA.

UEDes équipes européennes comme le LAAS-CNRS et l'INRIA travaillent sur des approches hybrides modèle-apprentissage similaires pour la locomotion quadrupède, ce travail s'inscrit dans un domaine de recherche où l'Europe est présente mais sans impact direct immédiat.

RecherchePaper
1 source
Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes
2arXiv cs.RO 

Rester assis : apprentissage de la locomotion omnidirectionnelle d'un humanoïde sur une chaise mobile passive à roulettes

Une équipe de recherche a publié le 28 août 2026 sur arXiv (2608.28090) une étude sur la locomotion omnidirectionnelle d'un robot humanoïde assis sur une chaise mobile passive à roulettes. Contrairement aux humanoïdes debout, dont les actionneurs quasi-direct-drive génèrent en continu du couple articulaire, la position assise délègue le maintien du poids à la chaise. La politique de contrôle, entraînée par apprentissage par renforcement sans récompense d'imitation de mouvement, ne reçoit que la proprioception du robot et les commandes de vitesse, sans capteur de contact ni information sur l'état de la chaise. Lors d'essais à commandes aléatoires, elle a suivi les trajectoires demandées pendant la quasi-totalité de séquences de 20 secondes, dépassant même une politique de référence en position debout sur la précision de suivi. Une analyse factorielle menée sur quatre graines d'entraînement montre qu'une régularisation du glissement du pied réduit le coût de transport mais peut figer le robot dans un optimum stationnaire, un défaut corrigé en la combinant à une régularisation de symétrie ou à un curriculum de commandes. Le coût de transport se classe, du plus bas au plus élevé, marche arrière, déplacement latéral, puis marche avant. Transférée sans réentraînement sur un robot réel Unitree G1, la politique a produit une locomotion assise omnidirectionnelle. Ce travail s'attaque à un angle mort de la course aux humanoïdes, focalisée jusqu'ici sur la marche et la manipulation en position debout pour des tâches d'usine ou de logistique. Une grande partie du travail de bureau ou d'établi se fait pourtant assis, et maintenir un humanoïde debout en continu sollicite inutilement ses actionneurs et son énergie. En montrant qu'une politique entraînée uniquement par récompense de suivi de vitesse, sans imitation de mouvement ni capteurs de contact, transfère en zero-shot vers un robot réel, l'étude conforte l'idée que l'apprentissage par renforcement en simulation franchit l'écart sim-to-real sur des tâches de locomotion toujours plus spécialisées. L'étude reste un travail de recherche académique en prépublication, sans partenaire industriel ni calendrier de commercialisation annoncé, qui étend l'environnement standard de suivi de vitesse en position debout déjà utilisé dans la communauté robotique, avec un modèle de chaise passive et des récompenses propres à l'état assis. Le choix du Unitree G1, plateforme largement diffusée dans la recherche en contrôle moteur, en fait une base accessible plutôt qu'une vitrine commerciale, à la différence des plateformes propriétaires comme Figure ou Optimus. Les auteurs présentent ce résultat comme une première étape vers une locomanipulation assise complète, avant l'ajout probable de tâches de manipulation des bras pendant le déplacement sur la chaise.

RecherchePaper
1 source
Apprentissage d'un contrôle de bout en bout pour le vol omnidirectionnel de quadrirotors à rotors inclinables suractionnés
3arXiv cs.RO 

Apprentissage d'un contrôle de bout en bout pour le vol omnidirectionnel de quadrirotors à rotors inclinables suractionnés

La communauté robotique aérienne franchit une étape avec un article publié sur arXiv (référence 2602.21583, version 2), qui propose un cadre d'apprentissage par renforcement (RL) de bout en bout pour le contrôle omnidirectionnel de quadrirotors surdimensionnés à rotors orientables. Ces plateformes combinent une actionnement hybride, rotors sans balais et articulations rotatives, ce qui leur confère plus de degrés de liberté qu'un quadrirotor classique mais complique fortement le transfert simulation-réel. Le système associe une simulation au niveau actionneur à une architecture acteur-critique asymétrique pour atteindre des poses cibles en 6D, en transformant directement une pose visée en commandes de rotors et d'articulations. Pour fiabiliser le passage du simulateur au matériel réel, les chercheurs combinent identification du système et randomisation de domaine limitée mais physiquement ancrée. La politique entraînée est déployée en zero-shot sur un drone physique et testée en vol stationnaire par points de passage, sous perturbations externes, avec charge utile variable et en suivi de trajectoire, complétée par des essais simulés de configurations singulières d'allocation. Comparée à une base de référence NMPC (commande prédictive non linéaire), état de l'art pour ce type d'actionnement couplé, la politique RL n'égale pas sa précision de position en régime stationnaire, mais affiche une erreur d'orientation plus homogène, des transitions de pose plus rapides et une charge de calcul embarquée réduite. Pour les intégrateurs et ingénieurs du secteur, ce résultat répond à une question ouverte: le RL au niveau actionneur, déjà validé sur des quadrirotors conventionnels pour un vol agile et robuste, peut aussi fonctionner sur des architectures à rotors orientables plus complexes, réputées plus difficiles à transférer du simulateur au réel. Le compromis observé, moins de précision statique contre moins de calcul embarqué et plus de réactivité, ouvre des pistes concrètes pour des drones à bas coût de calcul destinés à l'inspection ou à la manipulation aérienne. Le travail s'inscrit dans la continuité des succès du RL sur les quadrirotors standards, où cette approche a déjà démontré sa robustesse face aux méthodes classiques de contrôle. La question du RL sur les rotors orientables restait ouverte en raison du couplage hybride rotors-articulations, jugé plus délicat à modéliser fidèlement en simulation. Cette version 2 de l'article, republiée après une première soumission, suggère un travail de consolidation méthodologique. Les auteurs positionnent explicitement leur approche face au NMPC plutôt que de la présenter comme son remplacement, et les essais de configurations singulières restant cantonnés à la simulation laissent entrevoir une validation matérielle future comme prochaine étape logique.

RecherchePaper
1 source
Robot Squid Game : locomotion quadrupède pour traverser des tunnels étroits
4arXiv cs.RO 

Robot Squid Game : locomotion quadrupède pour traverser des tunnels étroits

Des chercheurs publient sur arXiv (réf. 2605.13665, mai 2026) un framework d'apprentissage par renforcement (RL) permettant à des robots quadrupèdes de traverser de manière autonome des environnements 3D confinés : tunnels, grottes et structures effondrées, avec des applications ciblées en recherche et sauvetage et en inspection d'infrastructures. La méthode repose sur deux mécanismes complémentaires : une génération procédurale de géométries de tunnels pendant l'entraînement, qui expose le robot à une grande diversité de configurations spatiales, et un paradigme enseignant-étudiant (teacher-student) de distillation de politiques. Des politiques expertes spécialisées sur des géométries spécifiques transfèrent leur connaissance à une politique étudiante unifiée, évitant ainsi le reward shaping complexe habituellement requis dans l'entraînement end-to-end. Les résultats sont validés à la fois en simulation et en expériences physiques réelles sur robot quadrupède. L'enjeu est concret : les approches classiques de locomotion quadrupède échouent régulièrement face à des espaces confinés non structurés, en raison d'allures (gaits) rigides et d'hypothèses environnementales trop simplistes. En décomposant une tâche complexe en sous-tâches apprenables indépendamment, le framework réduit la difficulté d'optimisation et améliore la généralisabilité, un résultat que les approches monolithiques end-to-end peinent à atteindre sur des géométries variées. Pour un intégrateur en sécurité civile ou en inspection de réseaux souterrains, ce type de robustesse comportementale dans des tunnels aux contraintes spatiales variables est un pas mesurable vers des déploiements autonomes réels, au-delà des démonstrations sur terrains balisés. La locomotion quadrupède en milieu confiné a été un axe central du DARPA Subterranean Challenge (2018-2021), compétition qui a exposé les limites des approches heuristiques dans des souterrains non cartographiés, avec des équipes impliquant Boston Dynamics, CMU et ANYbotics. Le paradigme teacher-student appliqué à la locomotion RL s'inscrit dans une tendance active initiée notamment par les travaux d'ETH Zurich sur ANYmal et les recherches de DeepMind sur les locomoteurs polyvalents. Ce travail reste une preprint arXiv non encore évaluée par les pairs, sans partenaire industriel annoncé ni calendrier de déploiement mentionné : les résultats présentés sont encourageants mais restent à confirmer sur des plateformes plus variées et des scénarios de terrain réels.

RecherchePaper
1 source