Aller au contenu principal
MOBIUS : un robot bipède multimodal capable de marcher, ramper, grimper et rouler
RecherchearXiv cs.RO 

MOBIUS : un robot bipède multimodal capable de marcher, ramper, grimper et rouler

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (référence 2511.01774, version 3 de mai 2026) la plateforme MOBIUS, un robot bipède à quatre membres capable d'enchaîner marche, reptation, escalade et déplacement sur roues sans reconfiguration mécanique. La plateforme embarque deux bras à 6 degrés de liberté (6-DoF) équipés de préhenseurs à deux doigts pour la manipulation et l'escalade, ainsi que deux jambes à 4-DoF pour la locomotion. Une architecture de contrôle hybride combine apprentissage par renforcement pour les transitions de gait et contrôle en force pour les interactions de contact compliantes lors des phases de manipulation. Un planificateur haut niveau de type MIQCP (Mixed-Integer Quadratically Constrained Program) sélectionne automatiquement le mode de locomotion optimal selon des critères de stabilité et d'efficacité énergétique. Les expériences sur prototype physique montrent des transitions de marche robustes, une escalade dynamique et un support de charge sur l'ensemble du corps par préhension en pince.

Ce travail s'attaque à l'un des verrous historiques de la robotique mobile : la plupart des plateformes humanoïdes ou quadrupèdes sont optimisées pour un seul mode de déplacement, ce qui limite leur traversabilité réelle en environnement industriel non structuré. MOBIUS démontre qu'une intégration serrée entre morphologie, planification autonome et contrôle multi-modal peut étendre substantiellement l'espace de travail et les capacités d'interaction d'un robot sans multiplier les actionneurs. Pour un intégrateur B2B, le signal est clair : le paradigme "un robot, un usage" n'est plus une contrainte technique incontournable. Il convient toutefois de noter que les démonstrations restent en contexte laboratoire contrôlé ; aucune donnée de déploiement industriel n'est communiquée à ce stade.

MOBIUS s'inscrit dans un courant de recherche en pleine expansion autour des robots loco-manipulateurs, aux côtés de travaux comme ANYmal (ETH Zurich), Spot ARM (Boston Dynamics) ou les plateformes du CMU Robotics Institute. La singularité de MOBIUS réside dans sa capacité à rouler, ce qui le rapproche également des robots hybrides roues-pattes (wheeled-legged) comme Ascento ou Rezero. Aucun partenaire industriel ni calendrier de commercialisation n'est mentionné dans l'article, ce qui en fait pour l'instant une contribution académique solide plutôt qu'une annonce produit. Les prochaines étapes naturelles seraient des tests en environnement semi-structuré (entrepôt, chantier) et une validation de la robustesse du planificateur MIQCP face à des perturbations imprévues.

À lire aussi

Bio-inspiration : les robots capables de marcher, voler, nager et grimper
1Interesting Engineering 

Bio-inspiration : les robots capables de marcher, voler, nager et grimper

Une équipe de chercheurs de l'université de Beihang, de l'université de technologie de Dalian et de l'EPFL vient de publier une revue de littérature sur les robots bioinspirés multimodaux, capables de combiner plusieurs modes de déplacement (marche, vol, natation, escalade, saut) sur une seule et même plateforme mécanique. Contrairement aux robots classiques limités à un seul mode de locomotion, ces machines s'inspirent du vivant pour partager des structures et des systèmes de contrôle entre plusieurs fonctions de déplacement. L'étude identifie les principaux verrous techniques qui freinent leur développement : l'espace embarqué limité, puisque chaque mode de déplacement supplémentaire exige ses propres actionneurs, capteurs, batteries et éléments mécaniques, ce qui alourdit et complexifie la machine ; la reconfiguration corporelle, c'est-à-dire la capacité à modifier physiquement la structure du robot pour passer d'un mode à l'autre ; et l'équilibre entre rigidité et flexibilité des matériaux. Pour combler l'absence de méthode d'évaluation standardisée, les auteurs proposent cinq métriques de performance : le nombre de modes de locomotion disponibles, le coût additionnel lié à chaque nouveau mode, la part de composants mutualisables entre les modes, le temps ou l'énergie nécessaires pour basculer d'un mode à l'autre, et le gain de performance global apporté par la combinaison de plusieurs types de déplacement. Cette grille de lecture arrive à un moment où l'industrie robotique cherche justement à dépasser la simple addition de capacités pour viser une véritable polyvalence opérationnelle : un robot capable de voler puis de marcher peut parcourir de longues distances rapidement avant de basculer en mode inspection au sol, tandis qu'un robot amphibie peut alterner terre et eau pour des missions de recherche et sauvetage ou de surveillance environnementale. En proposant un cadre commun de mesure, les chercheurs offrent aux intégrateurs et décideurs industriels un moyen de comparer objectivement des architectures très différentes, plutôt que de se fier aux démonstrations ponctuelles souvent mises en avant par les fabricants, un enjeu clé pour distinguer les prototypes de laboratoire des solutions réellement déployables sur le terrain. La revue s'inscrit dans une évolution du secteur, qui est passé de robots assemblant des mécanismes séparés pour chaque mode de déplacement à des systèmes intégrés inspirés directement de l'anatomie animale. Les auteurs pointent aussi les limites des algorithmes de planification et de contrôle classiques, mal adaptés aux changements brutaux de dynamique lors d'un changement de mode, et misent sur les progrès de l'apprentissage par renforcement, des modèles vision-langage-action (VLA) et des modèles du monde pour rendre ces robots réellement autonomes. Parmi les pistes de conception évoquées figurent les matériaux souples et déformables, le réemploi de structures à fonctions multiples, ainsi que des architectures de flottes de robots simples coopérant pour obtenir collectivement des capacités multimodales.

UEL'EPFL, institution européenne reconnue en robotique, co-signe cette revue de littérature, renforçant l'expertise européenne en robotique bio-inspirée multimodale.

RecherchePaper
1 source
Robot humanoïde marche sur sable, gravier et pentes grâce à un cadre d'entraînement plus rapide
2Interesting Engineering 

Robot humanoïde marche sur sable, gravier et pentes grâce à un cadre d'entraînement plus rapide

Des chercheurs du Georgia Institute of Technology ont mis au point un nouveau cadre d'apprentissage automatique baptisé « Learn to Teach » (L2T), qui permet à un robot humanoïde bipède de marcher sur du sable, du gravier, de l'herbe détrempée, des pentes, des escaliers et des surfaces glissantes, tout en réduisant nettement le temps et la puissance de calcul nécessaires à l'entraînement du contrôleur. Contrairement à l'apprentissage classique par renforcement de type enseignant-élève, où un modèle « professeur » est d'abord entraîné en simulation avant de transmettre ses connaissances à un modèle « élève » qui pilote le robot réel, la méthode de Georgia Tech entraîne les deux agents simultanément. Selon Feiyang Wu, chercheur principal du projet, l'approche séquentielle classique pose deux problèmes : elle prend trop de temps et gaspille une partie des informations collectées par le professeur en cours d'apprentissage. Le contrôleur a été testé sur un robot humanoïde grandeur nature dans le laboratoire du professeur associé Ye Zhao, où l'équipe a aussi poussé et tiré la machine pendant les essais pour observer sa capacité à ajuster sa démarche et rester stable. Les travaux ont été présentés à l'ICRA (IEEE International Conference on Robotics and Automation). Cette avancée s'attaque à un goulot d'étranglement bien identifié dans la robotique humanoïde : l'entraînement de contrôleurs en simulation nécessite souvent des heures de calcul sur du matériel GPU coûteux, un frein direct à l'itération rapide et au déploiement à grande échelle. En faisant apprendre le professeur et l'élève en parallèle, et en permettant au professeur de tirer des enseignements de l'expérience de l'élève, l'équipe réduit ce que les roboticiens appellent le « fossé d'imitation » entre les conditions idéalisées de la simulation et la réalité du terrain, un problème central dans le débat sur le fameux « sim-to-real gap ». Fait notable, le même contrôleur généraliste a surpassé le logiciel fourni par le fabricant du robot sur plusieurs types de terrains, sans nécessiter de contrôleurs distincts par environnement, ce qui illustre la valeur d'une recherche en apprentissage automatique directement confrontée au monde réel plutôt qu'à des démonstrations scénarisées. Wu reconnaît que l'équipe ne s'attendait pas elle-même à une telle polyvalence pour un robot humanoïde aussi volumineux, la locomotion agile sur terrain accidenté n'ayant jusqu'ici jamais été véritablement démontrée pour ce type de machine. Au-delà de la marche, les chercheurs estiment que le cadre « Learn to Teach » pourrait s'appliquer à d'autres architectures de robots et à des tâches variées exigeant un déplacement fiable en environnement imprévisible, ouvrant une piste de recherche transférable bien au-delà du seul cas d'usage testé à Atlanta.

RecherchePaper
1 source
WiXus : un robot à roues et pattes utilisant des câbles pour combiner mobilité et manipulation
3arXiv cs.RO 

WiXus : un robot à roues et pattes utilisant des câbles pour combiner mobilité et manipulation

Des chercheurs japonais ont publié sur arXiv (arXiv:2505.20932, mai 2025) les travaux décrivant WiXus, un robot à roues et pattes qui intègre un mécanisme de traction par câbles fixés à l'environnement extérieur. L'architecture combine un châssis à locomotion hybride roues-pattes, configuration classique permettant déplacement rapide sur sol plan, avec des câbles motorisés que le robot ancre sur des structures environnantes (murs, arêtes, supports). En phase de démonstration, WiXus effectue une mobilité tridimensionnelle incluant l'escalade de falaises en coordonnant entraînement par câbles et actionnement roues-pattes. Plus distinctif : une fois son corps suspendu par les câbles, le robot libère ses membres inférieurs de toute fonction locomotrice et les repurpose en bras manipulateurs. Les tâches démontrées restent à l'échelle prototype, saisir une peluche (simulation de sauvetage) et couper une fausse pomme avec un sécateur. Aucun chiffre de charge utile, de degrés de liberté (DOF) précis ou de temps de cycle n'est fourni dans l'abstract publié. Le principe architectural est notable pour les intégrateurs robotiques : découpler locomotion et manipulation par un support externe résout une contrainte fondamentale des plateformes à pattes, qui doivent traditionnellement arbitrer entre stabilité posturale et liberté d'effecteur. En suspendant le corps via l'environnement, WiXus contourne cette contrainte sans ajouter de bras dédiés, ce qui réduit la masse embarquée et la complexité mécanique. Pour les décideurs industriels, la question critique reste la fiabilité de l'ancrage câble en environnement non préparé, un point que les démonstrations actuelles, conduites en conditions de laboratoire contrôlées, ne permettent pas encore de valider. WiXus s'inscrit dans une dynamique académique large autour des robots à mobilité hybride. Des plateformes comme ANYmal (ANYbotics), Spot (Boston Dynamics) ou Unitree B2 dominent le marché des robots à pattes, mais restent dédiés à la locomotion avec manipulation optionnelle par bras additionnel. L'approche câble-environnement rappelle des travaux sur les robots grimpeurs (ex. ETH Zurich, IIT Gênes) et les AMR avec bras intégré. WiXus reste au stade de prototype de recherche ; aucun partenaire industriel ni calendrier de commercialisation ne sont mentionnés.

RecherchePaper
1 source
Kepler-Encoder-v0.1 : vers un modèle d'embedding multimodal pour robots
4arXiv cs.RO 

Kepler-Encoder-v0.1 : vers un modèle d'embedding multimodal pour robots

Des chercheurs publient sur arXiv (2607.13522v1) Kepler-Encoder-v0.1, un encodeur multimodal pour robots qui fusionne vision, proprioception et force/couple dans un espace latent partagé, entraîné en auto-supervisé selon l'objectif LeJEPA/SIGReg. Le point de départ est que les features visuelles brutes d'un ViT figé captent très mal la force, avec un R² inférieur ou égal à 0,10 sur chaque robot testé. Sur le corpus multi-robots RH20T, le latent entraîné avec fusion, mais utilisé vision-seule à l'inférence, récupère significativement mieux l'état de l'effecteur terminal et la force que les baselines vision, sur tous les robots dotés de capteurs de force, tout en égalant les meilleures baselines sur l'état moteur déjà visible par la caméra. Un seul encodeur couvre quatre robots différents ; son erreur de prédiction croisée détecte les états invalides sans entraînement supplémentaire (AUROC de 0,90 sur les états hors limites, 0,69 sur les changements de scène), et un décodeur de diffusion (PixNerd) reconstruit l'image caméra depuis ce latent. Pour les intégrateurs robotique, l'intérêt est concret : un encodeur entraîné avec force et proprioception, une fois déployé vision-seule, conserve une partie de l'information de contact dans son espace latent, ce qui ouvre la voie à des robots moins instrumentés à l'inférence tout en restant plus sensibles au contact physique. L'approche se distingue de la course aux modèles VLA généralistes comme Pi-0, GR00T N2 ou Helix, centrés sur la génération d'action : Kepler-Encoder-v0.1 s'attaque à la représentation d'état en amont, y compris ce que la caméra ne voit pas directement. Les auteurs restent toutefois prudents, la récupération absolue de la force à un instant donné demeurant modeste, un signal statistique plutôt qu'une reconstruction fiable image par image. Le travail s'appuie sur RH20T, jeu de données multi-robots déjà utilisé pour entraîner des représentations tactiles et visuelles, et sur LeJEPA/SIGReg, une famille de méthodes type JEPA qui prédit dans l'espace latent plutôt que de reconstruire les pixels bruts. Publié en preprint sur arXiv, le rapport précise explicitement ses limites : il ne valide que le cas à un seul pas de temps, la fusion temporelle à fréquence native étant annoncée comme prochaine étape, et aucun déploiement industriel n'est mentionné à ce stade. Il s'inscrit dans un mouvement de recherche plus large visant des encodeurs d'état généralistes et agnostiques à l'embodiment, en complément des modèles VLA orientés action comme Pi-0 ou GR00T N2.

RecherchePaper
1 source