Aller au contenu principal
RecherchearXiv cs.RO 

Contact multiple réactif pour humanoïdes grâce à des modèles de stabilité appris

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode de planification et de contrôle qui permet à un humanoïde d'utiliser ses mains pour se stabiliser lorsque les pieds seuls ne suffisent plus à éviter la chute. Le système échantillonne des points de contact candidats dans l'espace atteignable du robot, puis simule la dynamique centroïdale à travers trois phases : pré-impact, impact et post-impact. Chaque point est noté selon l'autorité de contrôle du centre de pression (CoP) après l'impact. Le planificateur procède en deux étapes : il choisit d'abord une région d'appui optimale, puis calcule le meilleur point d'appui dans cette région. En simulation, la résilience aux impulsions progresse en moyenne de 89 % par rapport à une récupération sans contact manuel, et de 17 % par rapport à une stratégie naïve consistant à viser la région atteignable la plus proche. Sur robot réel, des tests de poussée ont été menés à l'arrêt et en marche : à l'arrêt, le temps de stabilisation baisse en moyenne de 43 % face à un placement naïf des mains, et en marche, de 18 % face à une récupération sans contact manuel. Le papier, publié sur arXiv, ne précise dans son résumé ni la plateforme utilisée ni l'amplitude des poussées.

L'intérêt tient à un modèle appris de la région de CoP atteignable en post-impact, qui remplace les optimisations en ligne plus coûteuses pour évaluer chaque contact candidat. Cette évaluation rapide est la condition pour réagir en temps réel à une perturbation, et non planifier un appui à froid. Pour les intégrateurs et industriels qui envisagent des humanoïdes dans des environnements encombrés, entrepôts, ateliers ou zones de maintenance, la capacité de s'appuyer sur une paroi, une étagère ou une machine plutôt que de tomber répond à un enjeu de sécurité et de disponibilité. Elle illustre aussi un schéma de plus en plus courant : un modèle appris, léger et ciblé, greffé sur un contrôleur à base de modèle, plutôt qu'une politique de bout en bout. Les gains sont néanmoins modestes dans le cas de la marche (18 %), et la comparaison de référence est faible, puisqu'il s'agit d'un placement naïf ou de l'absence de contact manuel. Aucune comparaison avec une politique apprise par renforcement n'est mentionnée.

Ce travail s'inscrit dans la lignée de la locomotion multi-contact, longtemps traitée par optimisation hors ligne ou par séquences de contacts prédéfinies, avec des temps de calcul peu compatibles avec une réaction aux poussées. Les équipes de robotique humanoïde, qu'elles soient académiques ou industrielles, cherchent à rendre ces stratégies de récupération robustes, en parallèle des politiques de locomotion apprises en simulation. La suite logique consisterait à tester des surfaces et des géométries variées, des contacts non plans et des perturbations moins contrôlées qu'un test de poussée en laboratoire. Pour l'instant, il s'agit d'un résultat de recherche validé en laboratoire, sans déploiement ni calendrier commercial annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

L'écho des pas : apprendre le parkour humanoïde perceptif grâce à une mémoire à portes
1arXiv cs.RO 

L'écho des pas : apprendre le parkour humanoïde perceptif grâce à une mémoire à portes

Des chercheurs présentent dans un article publié sur arXiv (identifiant 2609.28960v1), intitulé "Echo in the Steps: Learning Perceptive Humanoid Parkour with Gated Memory", un système permettant à un robot humanoïde de franchir des terrains hautement discontinus, comme des points d'appui rares ou des surfaces de contact étroites, en s'appuyant uniquement sur des observations de profondeur embarquées, sans capteur externe. Le cœur du système est un module de perception temporelle guidé par la saillance, qui combine un a priori de saillance visuelle avec une mémoire à portes (gated memory) conservant les informations de profondeur pertinentes d'une image à l'autre, même lorsque l'observation instantanée est partielle ou occluse. Les auteurs ajoutent une fonction de perte d'alternance, une régularisation de symétrie qui force le contrôleur à produire un schéma de marche en alternance des appuis, jugée essentielle lors de transitions rapides entre appuis espacés. Le papier rapporte des gains significatifs de taux de réussite et de précision de placement du pied sur des terrains difficiles, validés en simulation et sur un robot réel, sans toutefois préciser de chiffres exacts de performance, de gabarit du robot ou de temps de cycle dans le résumé disponible. Ce résultat cible un verrou précis de la locomotion humanoïde perceptive: si le franchissement de terrains structurés, escaliers, pentes, obstacles réguliers, est déjà largement maîtrisé par les commandes apprises par renforcement, le parkour sur appuis épars reste un problème ouvert, car il exige une sélection anticipée des points de contact à partir de la vision plutôt qu'une simple robustesse proprioceptive. Le travail illustre une tendance de fond en robotique humanoïde: le passage d'une locomotion "aveugle" reposant sur le seul retour proprioceptif vers des architectures exploitant activement une mémoire visuelle pour compenser l'observabilité partielle des capteurs embarqués. Pour les intégrateurs et décideurs industriels, l'enjeu est concret: la capacité à traverser des sols irréguliers, chantiers ou gravats, plutôt que les seuls sols plats d'entrepôt, conditionne l'élargissement des cas d'usage réels des humanoïdes au-delà des démonstrations contrôlées. Il s'agit néanmoins d'un résultat académique publié en preprint, non d'un produit commercialisé ni d'un déploiement en flotte, et l'ampleur exacte des essais réels n'est pas détaillée dans le résumé. Ce travail s'inscrit dans la lignée des avancées récentes en locomotion perceptive pour humanoïdes, un domaine où laboratoires académiques et industriels de la robotique bipède cherchent à combiner apprentissage par renforcement et perception visuelle pour sortir du seul sol plat. Le résumé de l'article ne mentionne aucun partenariat industriel ni acteur français ou européen impliqué dans ces travaux. Les suites attendues pour ce type de recherche restent celles du cycle académique classique: publication détaillée avec code et données, extension des essais réels à davantage de types de terrain et, à terme, un éventuel transfert vers des plateformes humanoïdes commerciales cherchant à renforcer leur robustesse en environnement non structuré.

RecherchePaper
1 source
Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit
2arXiv cs.RO 

Apprentissage d'une navigation sûre pour humanoïdes à partir de modèles d'ordre réduit

Des chercheurs ont publié le 18 septembre 2026 sur arXiv (référence 2609.19272) une méthode de navigation autonome pour robots humanoïdes baptisée RoM-Nav, testée sur un Unitree G1. Le problème de départ est concret: un pipeline d'apprentissage par renforcement (RL) classique à un seul étage échoue à monter en échelle sur des terrains multi-niveaux et multi-étages, freiné par la difficulté des interactions pied-terrain complexes comme les escaliers. La solution proposée décompose la navigation en deux étapes. D'abord, une politique entraînée sur une dynamique d'ordre réduit (reduced order model) mais alimentée par des observations LiDAR 3D complètes apprend à se repérer dans un terrain complexe à plusieurs étages. Cette connaissance sert ensuite à amorcer une seconde politique opérant sur la dynamique complète du robot, avec une politique de locomotion déjà entraînée et figée intégrée dans la boucle. Un filtre de sécurité dit de Poisson est ajouté en sortie de la politique de navigation pour garantir la sécurité face à des obstacles inédits, sans dégrader le taux de réussite. Sur le G1, les essais ont couvert une navigation sans carte préalable (mapless) avec plus de 10 mètres de dénivelé vertical cumulé et plus de 100 mètres de trajet parcouru. L'intérêt pour le secteur tient à ce que ce travail s'attaque directement à un angle mort connu de la robotique humanoïde: la locomotion pure a beaucoup progressé, mais l'autonomie de navigation en environnement bâti réel, avec escaliers et changements d'étage, reste un goulot d'étranglement pour tout déploiement industriel ou logistique. En montrant qu'une décomposition hiérarchique (modèle réduit puis politique complète) permet de dépasser les limites du RL monolithique, et qu'un filtre de sécurité formel peut être ajouté sans sacrifier la performance, l'étude apporte un argument concret dans le débat sur la fiabilité des humanoïdes hors des démonstrations scénarisées. Ce résultat s'inscrit dans une recherche académique en cours plutôt que dans un produit commercial: il s'agit d'un preprint arXiv, non encore validé par relecture par les pairs, mais démontré sur du matériel réel plutôt qu'en simulation seule. Le choix du Unitree G1, plateforme largement utilisée par les laboratoires universitaires pour son accessibilité, souligne aussi que ce type d'expérimentation reste pour l'instant du ressort de la recherche plutôt que du déploiement en flotte. Les auteurs mettent à disposition une page projet avec vidéos (wdc3iii.github.io/rom-nav) mais n'annoncent pas de calendrier de transfert vers l'industrie.

RecherchePaper
1 source
Analyse par polytopes de torseurs optimisée pour le contrôle de stabilité en temps réel de robots à pattes en contacts multiples complexes
3arXiv cs.RO 

Analyse par polytopes de torseurs optimisée pour le contrôle de stabilité en temps réel de robots à pattes en contacts multiples complexes

Un article de recherche mis en ligne en septembre 2026 sur arXiv, référencé 2609.17405v1, présente un algorithme optimisé pour calculer le polytope de wrench actionnable des robots à pattes, soit l'ensemble des forces et couples qu'un robot peut exercer à ses points de contact. Cette optimisation permet de recalculer les couples de chaque articulation à 49 Hz, une cadence compatible avec une boucle de contrôle temps réel, alors que ce calcul restait jusqu'ici trop lourd pour un usage embarqué. Le contrôleur qui en résulte a été testé en simulation puis validé sur un robot marcheur réel, non nommé dans l'article. Il cible des terrains difficiles comme les pentes raides, les grottes ou les échafaudages, et atteindrait selon ses auteurs une stabilité qu'aucun autre contrôleur existant n'obtient actuellement. L'analyse par polytope de wrench offre des garanties de stabilité plus rigoureuses que les marges heuristiques habituelles en robotique de terrain, mais son coût de calcul combinatoire la cantonnait jusqu'ici à la planification hors ligne plutôt qu'au contrôle réactif embarqué. En démontrant un calcul complet, pour des contacts arbitraires, à une cadence exploitable en boucle fermée, ce travail réduit l'écart entre les garanties théoriques de stabilité et ce qu'un contrôleur peut réellement exploiter en temps réel sur le terrain. Pour les intégrateurs de robots à pattes destinés à l'inspection industrielle, aux chantiers avec échafaudages ou aux interventions en milieu confiné, cela ouvre la voie à des appuis simultanés mains et pieds sur des surfaces non coplanaires, sans recourir à des heuristiques simplificatrices. C'est un signal pour le secteur : la lenteur de calcul, souvent citée comme facteur limitant des méthodes de stabilité rigoureuses, n'est plus un obstacle absolu dès lors que l'algorithme est correctement optimisé. Le polytope de wrench actionnable est un outil connu de l'analyse de stabilité des robots humanoïdes et quadrupèdes, mais les implémentations existantes limitaient le nombre ou la géométrie des points de contact, ou exigeaient un précalcul hors ligne incompatible avec des terrains changeants. L'apport revendiqué ici est de généraliser ce calcul à des configurations de contact arbitraires tout en le rendant exécutable en ligne, directement dans la boucle de contrôle. Classé comme nouvelle soumission sur arXiv, l'article ne cite ni fabricant, ni modèle commercial, ni acteur français ou européen comme Wandercraft, Pollen Robotics ou Enchanted Tools : il s'agit d'une contribution académique validée sur un prototype de laboratoire, et non d'un produit commercialisé. Les suites attendues pour ce type de travaux passent typiquement par une publication en conférence, puis des essais élargis sur d'autres plateformes et terrains réels au-delà du cadre contrôlé de l'étude.

RecherchePaper
1 source
MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares
4arXiv cs.RO 

MARCH : apprentissage par renforcement assisté par modèle pour le contrôle perceptif de robots humanoïdes sur appuis rares

Des chercheurs ont publié sur arXiv (2606.10288) MARCH, un cadre d'apprentissage par renforcement assisté par modèles pour la locomotion bipedale sur appuis épars. La méthode repose sur trois étapes : générer une trajectoire de référence sûre à partir de modèles dynamiques simplifiés, entraîner une politique "enseignante" guidée par un reward basé sur une Control Lyapunov Function (CLF), puis distiller cette politique dans une politique "étudiante" visuelle déployable sur robot réel. L'ensemble a été validé en simulation et déployé sur un Unitree G1, humanoïde commercialisé autour de 16 000 dollars, naviguant sur des appuis épars avec contraintes latérales. L'enjeu est de réconcilier deux familles de méthodes historiquement opposées : les approches basées modèle (MPC, optimisation de contact) sont précises mais fragiles face à l'incertitude de terrain, tandis que le RL pur est robuste mais peine à découvrir les mouvements finement contraints nécessaires à la locomotion safety-critical, où une erreur de quelques centimètres peut provoquer une chute. Le reward CLF injecte une connaissance physique dans la boucle d'apprentissage sans curriculum d'entraînement complexe, améliorant l'efficacité d'échantillonnage et produisant une locomotion plus fluide. Les performances sur stepping stones sont déclarées comparables aux baselines RL purs, ce qui suggère que l'hybridation modèle/apprentissage est viable à coût computationnel comparable. Ce travail s'inscrit dans l'axe locomotion perceptive porté par ETH Zurich (parkour RL, 2023), Carnegie Mellon et Berkeley. La distillation teacher-student, popularisée par Agility Robotics et ANYbotics dans leurs pipelines de développement, est ici enrichie d'une contrainte CLF théoriquement fondée. Le Unitree G1 est devenu une plateforme quasi-standard dans les labos de locomotion pour sa documentation et son prix accessible. Il s'agit d'un preprint arXiv non évalué par les pairs, sans déploiement industriel ni timeline commerciale annoncés. Les prochaines étapes naturelles seraient une validation sur terrain extérieur non structuré et une comparaison directe avec les approches MPC de nouvelle génération.

UEImpact marginal : ETH Zurich (Suisse, hors UE) est cité en travaux connexes, mais aucun labo ou industriel européen n'est directement impliqué dans ce preprint.

RecherchePaper
1 source