Aller au contenu principal
Whole-body planning pour humanoïdes en espace confiné : évitement des auto-collisions
RecherchearXiv cs.RO 

Whole-body planning pour humanoïdes en espace confiné : évitement des auto-collisions

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv, sous la référence 2608.10220, un nouveau framework de planification de mouvement "corps entier" en trois étapes destiné à la locomotion humanoïde dans des espaces fortement confinés. L'approche a été validée sur le robot humanoïde Unitree G1, à travers trois bancs d'essai dépassant les normes NIST applicables à l'intervention d'urgence, avec des ratios de confinement inférieurs à 1,5 (Cr < 1,5). Le système génère des trajectoires faisables sur des tâches de 12 à 18 secondes impliquant des contacts complexes des pieds et des mains, là où les méthodes de référence standard échouent. Concrètement, la planification cinématique s'effectue directement sur des volumes de corps rigide atteignables plutôt que sur une abstraction "particule" du robot ; un module d'évitement de collision différentiable, intégré à une formulation contrainte par l'atteignabilité, produit des guides informés par le volume qui orientent ensuite un optimiseur de trajectoire complet sur de longs horizons temporels. Ces plans optimisés servent enfin de référence pour entraîner une politique d'apprentissage par renforcement résiduelle, chargée de l'exécution robuste en ligne. Toute la validation, y compris celle de la politique apprise sous randomisation étendue du domaine, a été réalisée en simulation physique, sans mention de test sur robot réel.

L'enjeu identifié par les auteurs est concret : les optimiseurs de trajectoire classiques, qui représentent le robot par des splines sur une abstraction ponctuelle, peinent à naviguer les vastes espaces de collision propres aux environnements confinés et tombent dans des minima locaux médiocres. En combinant planification géométrique par volumes et apprentissage résiduel, ce travail illustre une tendance de fond dans la recherche en robotique humanoïde : dépasser les démonstrations en espace ouvert pour s'attaquer à des scénarios exigus et multi-contacts, comme les décombres, les tunnels ou les espaces industriels denses, qui restent un angle mort pour la plupart des piles de contrôle actuelles. Pour les intégrateurs et décideurs B2B suivant la course aux humanoïdes, l'intérêt réside moins dans un produit prêt à déployer que dans la preuve de concept : un pipeline planification puis apprentissage par renforcement peut tenir des contraintes de contact complexes que les méthodes purement optimisées ne résolvent pas. Il faut toutefois noter que cette démonstration reste cantonnée à la simulation physique, ce qui en fait un jalon de recherche plutôt qu'un déploiement terrain.

Le papier s'inscrit dans un courant de recherche académique sur la planification de mouvement pour humanoïdes, distinct des approches de bout en bout par modèles vision-langage-action comme GR00T N2 ou Helix, qui misent sur l'apprentissage direct de politiques à partir de données plutôt que sur l'optimisation explicite de trajectoires. Le choix du Unitree G1, plateforme largement utilisée par les laboratoires académiques pour sa disponibilité et son coût, confirme son rôle de banc d'essai de référence, aux côtés de robots comme Figure 03 ou Optimus chez les acteurs commerciaux. Aucune entreprise ni laboratoire n'est nommé dans l'abstract, et aucun calendrier de portage vers le matériel réel n'est communiqué ; les auteurs positionnent volontairement leurs bancs d'essai au-delà des normes NIST d'intervention d'urgence, suggérant une visée vers la robotique de secours et l'inspection en espaces restreints, sans qu'aucun pilote ni partenariat ne soit pour l'instant annoncé.

À lire aussi

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions
1arXiv cs.RO 

Contrôleur à horizon glissant dans l'espace des tâches pour l'évitement rapide de collisions

Des chercheurs publient sur arXiv (2607.15733v1) un nouveau contrôleur à horizon glissant dans l'espace des tâches pour l'évitement de collision en temps réel sur bras manipulateurs robotiques. La méthode combine un rollout court et "contact-consistant", basé sur un solveur dynamique itératif appliqué à des géométries convexes gonflées du robot et des obstacles, pour générer une référence cinématique terminale respectant les contraintes de non-pénétration internes. Seule la première commande d'une transition lisse à accélération minimale vers cette référence est ensuite calculée à chaque cycle, en partant d'une loi de régulation par cinématique inverse en boucle fermée. Les auteurs démontrent une régulation exponentielle locale dans l'espace des tâches lorsque les contacts sont inactifs, et bornent l'effet des obstacles mobiles sur les ensembles de fonctionnement réguliers lorsque des contacts s'activent pendant le rollout. Les tests incluent des simulations sur un système multi-chaînes à 40 degrés de liberté (DOF) et des expériences matérielles sur une plateforme à 6 DOF. L'enjeu pratique est le compromis classique entre anticipation et réactivité en robotique industrielle: le contrôle prédictif complet (MPC) offre une vision à long terme mais son coût de calcul explose avec l'horizon, la fidélité du modèle et le nombre de contraintes géométriques actives, tandis que les méthodes réactives sans horizon restent rapides mais peu clairvoyantes en environnement encombré et dynamique. Les résultats montrent que des horizons intermédiaires équilibrent ces deux exigences, avec des taux de succès supérieurs à des baselines MPC et à des "dynamic optimization fabrics" en clutter dynamique, tout en gardant des temps de résolution compatibles avec l'exécution temps réel testée. Point notable pour les intégrateurs: le comportement reste cohérent entre simulation et réel sans estimation précise des paramètres inertiels, ce qui limite l'effort de calibration habituellement nécessaire au transfert sim-to-real. Ce travail s'inscrit dans la lignée des recherches en contrôle prédictif appliqué à la manipulation en environnement dynamique, un axe où les laboratoires universitaires cherchent à réduire le fossé entre démonstrations en simulation et déploiements réels sur bras industriels ou collaboratifs. La comparaison directe avec des baselines MPC et fabrics d'optimisation dynamique positionne la méthode comme une alternative moins coûteuse en calcul pour l'évitement d'obstacles mobiles, un enjeu croissant pour les cellules robotiques partagées avec des opérateurs humains ou d'autres machines mobiles (AMR). Les auteurs ne mentionnent pas de partenariat industriel ni de calendrier de transfert vers un produit commercial à ce stade.

RecherchePaper
1 source
RoboStriker : jeux stratégiques en espace latent pour la boxe humanoïde autonome
2arXiv cs.RO 

RoboStriker : jeux stratégiques en espace latent pour la boxe humanoïde autonome

RoboStriker, un système d'apprentissage par renforcement multi-agent conçu pour la boxe entre robots humanoïdes autonomes, est présenté dans un article déposé sur arXiv en août 2026 (référence 2608.16195). Le constat de départ est un échec structurel : appliquer l'apprentissage multi-agent directement à l'espace moteur brut d'un humanoïde provoque un effondrement physique au niveau des articulations, empêchant toute tactique de combat viable d'émerger. Les auteurs formulent donc la boxe comme un jeu de Markov à somme nulle joué non pas dans l'espace des actions brutes, mais dans un espace latent structuré. RoboStriker distille d'abord des mouvements de boxe prédéfinis dans une variété latente topologiquement bornée, puis fait évoluer les stratégies de combat via une méthode nommée Latent-Space Neural Fictitious Self-Play. Les politiques obtenues ont ensuite été déployées et validées sur des robots humanoïdes réels, au-delà de la simulation. Ce travail cible un problème central pour la robotique humanoïde : l'écart entre démonstrations spectaculaires et robustesse réelle sur des tâches riches en contacts. La boxe, où l'équilibre et la réactivité sont critiques, sert de banc d'essai pour des applications humanoïdes plus posées comme la manipulation ou la collaboration en environnement imprévisible. En montrant qu'une contrainte structurelle de l'exploration, via un décodeur de mouvements pré-entraîné, réduit fortement les échecs catastrophiques d'équilibre par rapport à un apprentissage direct dans l'espace des actions brutes, l'étude prouve empiriquement que l'apprentissage multi-agent de bout en bout reste difficilement exploitable sans garde-fou architectural sur du matériel réel. Pour les intégrateurs, cela suggère que l'autonomie tactique complexe n'émerge pas encore de manière fiable d'un entraînement non contraint. RoboStriker s'inscrit dans la lignée des recherches sur l'auto-jeu et l'apprentissage multi-agent, popularisées par des systèmes de jeu comme AlphaGo et désormais transposées à la robotique physique, où une chute ou une collision matérielle coûte bien plus cher qu'une partie simulée. L'article ne cite aucune plateforme humanoïde commerciale ni aucun laboratoire industriel précis : il s'agit d'une contribution académique déposée sur arXiv, pas encore validée par relecture par les pairs, dont les auteurs publient le code, des vidéos et du matériel supplémentaire pour permettre une reproduction indépendante avant toute adoption industrielle. La boxe humanoïde rejoint une liste croissante de tâches extrêmes, parkour, danse, sports de combat, utilisées pour stress-tester la robustesse des contrôleurs avant leur transfert vers des usages industriels comme la logistique ou la manipulation en entrepôt.

RecherchePaper
1 source
Vision-Langage vers Exécution Humanoïde : Retargeting Guidé pour l'Éxécution de la Langue des Signes avec Atténuation des Collisions
3arXiv cs.RO 

Vision-Langage vers Exécution Humanoïde : Retargeting Guidé pour l'Éxécution de la Langue des Signes avec Atténuation des Collisions

Le laboratoire de robotique a publié le 24 juillet 2026 sur arXiv (2607.17769v1) un système reliant la génération de langue des signes (SLG, sign language generation) à l'exécution sur robot humanoïde. Les modèles SLG récents produisent des représentations corporelles 3D denses au format SMPL-X, jugées plus fidèles pour préserver la cinématique et la géométrie du corps entier en vue d'un transfert vers un robot. Le problème identifié : ces mouvements générés présentent fréquemment des auto-intersections, notamment des pénétrations main-main et main-torse. Tolérables en rendu vidéo offline, ces artefacts deviennent bloquants à l'exécution réelle, car ils produisent des solutions de cinématique inverse (IK) infaisables, des collisions et des trajectoires retargetées instables. Les auteurs proposent deux briques : un module volumétrique de mitigation des collisions sur SMPL-X qui reprojette les postures générées vers des configurations physiquement plausibles en s'écartant le moins possible de la trajectoire d'origine, et un algorithme de retargeting guidé par un modèle vision-langage (VLM), construit sur un socle IK, où le VLM agit comme critique visuel sur le mouvement humanoïde rendu, détecte les modes d'échec propres à l'embodiment, et déclenche des corrections ciblées dans l'espace des tâches. Cette contribution s'attaque à un angle mort concret de la course aux humanoïdes polyvalents : la plupart des démonstrations de génération de mouvement (langue des signes comprise) restent évaluées en rendu visuel, sans jamais passer le test du transfert vers un corps robotique réel avec ses contraintes articulaires et ses risques de collision physique. En pointant explicitement le fossé entre motion generation qui a l'air correcte à l'écran et motion generation exécutable sans collision sur un robot, les auteurs infirment implicitement l'hypothèse selon laquelle un bon modèle génératif SMPL-X suffit à garantir un retargeting robuste. Pour les intégrateurs travaillant sur l'accessibilité ou l'interaction homme-robot (interprétation automatisée en langue des signes par humanoïde), c'est un rappel que la chaîne complète, génération plus collision-checking plus correction perceptuelle en boucle, reste nécessaire avant tout déploiement, et que le retargeting IK seul ne suffit pas à garantir la sécurité et la stabilité des trajectoires. Le travail s'inscrit dans la lignée des systèmes de génération de langue des signes qui ont basculé ces dernières années vers des sorties 3D corps entier plutôt que des séquences 2D ou des squelettes simplifiés, afin de mieux capturer les nuances gestuelles nécessaires à une communication fidèle. Il rejoint aussi une tendance plus large de la robotique humanoïde consistant à utiliser des modèles vision-langage non pas comme générateurs de commandes bas niveau, mais comme superviseurs ou critiques de mouvements déjà produits, une approche qui recoupe les architectures VLA (vision-language-action) évoquées dans des systèmes comme Helix ou GR00T N2, sans toutefois se positionner comme un concurrent direct de ces plateformes de bout en bout. Le papier reste à ce stade une contribution de recherche publiée en preprint, sans mention de partenaire industriel, de plateforme humanoïde spécifique ni de calendrier de déploiement pilote, ce qui en fait une brique méthodologique plutôt qu'une annonce produit.

RecherchePaper
1 source
Whole-Body UMI : transfère les compétences de manipulation aux humanoïdes par génération de mouvement en temps réel
4arXiv cs.RO 

Whole-Body UMI : transfère les compétences de manipulation aux humanoïdes par génération de mouvement en temps réel

Un article publié le 22 septembre 2026 sur arXiv (2609.22829) présente Whole-Body UMI (WB-UMI), une méthode qui étend l'Universal Manipulation Interface (UMI), protocole de collecte de démonstrations par préhenseur portatif qui évite la téléopération, au contrôle corps entier des robots humanoïdes. Le système ajoute un générateur de mouvement temps réel conditionné par la position de l'effecteur, entraîné séparément sur des données de capture de mouvement retargetées, sans capteurs corporels ni démonstrations appariées. En déploiement, une architecture asynchrone combine une politique de diffusion apprise sur les démonstrations UMI natives, ce générateur de mouvement et un contrôleur corps entier avec compensation de latence. Testée sur le robot G1 d'Unitree, l'approche atteint 90% de réussite pour fermer un tiroir, 80% pour un pick-and-place sur étagère, 40% pour une tâche combinant déplacement et prise (Loco-PnP), et 30% pour un lancer de balle. Cet écart de performance, de 90% à 30% selon les tâches, montre que le transfert de compétences captées à la main vers un contrôle corps entier reste partiel, les mouvements dynamiques comme le lancer restant nettement plus difficiles que des gestes quasi-statiques. Pour l'industrie humanoïde, l'enjeu dépasse la démonstration technique : la téléopération demeure le principal goulot d'étranglement pour entraîner des politiques vision-language-action sur des robots à jambes, et découpler l'apprentissage de la coordination corps entier de celui de la sémantique de tâche réduirait la dépendance à des données coûteuses capturées directement sur le robot. Le travail teste ainsi, en boucle fermée sur robot réel, l'hypothèse qu'une interface de collecte générique comme UMI peut s'étendre aux humanoïdes sans instrumentation corporelle supplémentaire. UMI avait été conçu comme un outil de collecte à bas coût pour l'apprentissage de politiques de manipulation, via un préhenseur instrumenté plutôt qu'un robot téléopéré. WB-UMI s'inscrit dans une compétition plus large de modèles vision-language-action et d'architectures de contrôle humanoïde, aux côtés d'approches comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent toutes à réduire le coût de la collecte de données réelles. Contrairement à ces initiatives industrielles, WB-UMI reste une contribution académique en preprint, validée sur quatre tâches avec un seul robot, le G1 d'Unitree, sans partenaire annoncé ni calendrier de déploiement.

RecherchePaper
1 source