Aller au contenu principal
PRIMO : odométrie guidée par le suivi du mouvement humain pour robots humanoïdes
RecherchearXiv cs.RO 

PRIMO : odométrie guidée par le suivi du mouvement humain pour robots humanoïdes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Agibot Spatial Intelligence a publié sur arXiv, sous la référence 2609.23610, une méthode d'odométrie pour robots humanoïdes baptisée PRIMO (Prior-Informed Odometry from Human-Motion Tracking), conçue pour s'attaquer à deux failles du transfert simulation-vers-réel : des données d'entraînement limitées à une seule politique de contrôle, et des écarts sim-to-real qui fragilisent les prédictions non contraintes. La méthode génère sa supervision en faisant suivre au robot, en simulation, des mouvements humains retargetés et variés, indépendamment de la politique de déploiement finale, puis s'appuie sur un estimateur intégrant des priors physiques et de symétrie ainsi qu'une voie de contexte capteur brut. Sous un protocole unifié sur robot réel, elle réduit l'erreur moyenne d'odométrie de 31,6 à 61,7% face à la meilleure base externe testée ; l'entraînement croisé entre deux révisions de politiques de locomotion abaisse l'erreur de 86,8 à 94,6% en simulation et de 69,2 à 81,7% sur des mouvements dynamiques réels. Le code source est publié sur GitHub sous Agibot-Spatial-Intelligence/PRIMO.

L'odométrie proprioceptive, qui estime position et orientation d'un robot à partir de ses seuls capteurs internes sans caméra ni LiDAR, est une brique critique pour la marche autonome des humanoïdes en usine ou en entrepôt, là où le GPS est absent et la vision peut être occultée. Le problème ciblé est structurel : la plupart des modèles existants restent liés à la politique de locomotion ayant servi à générer leurs données d'entraînement, ce qui les fragilise à chaque mise à jour de contrôleur, un frein concret pour les intégrateurs qui doivent faire évoluer leurs flottes sans tout réentraîner. En découplant l'odométrie du contrôleur de déplacement, PRIMO suggère que la généralisation sim-to-real de l'estimation d'état, faiblesse reconnue du secteur, peut se traiter par des contraintes physiques structurantes plutôt que par un simple ajout de données, une piste distincte des efforts de généralisation menés sur les modèles de manipulation de type VLA.

Agibot, fabricant chinois de robots humanoïdes également connu sous le nom Zhiyuan Robotics, publie ce travail via sa division Spatial Intelligence, dédiée aux briques de perception et d'estimation d'état plutôt qu'à la seule vente de plateformes matérielles. Le recours à des mouvements humains retargetés pour combler le manque de données robotiques réelles rejoint une tendance plus large du secteur, où des laboratoires travaillant sur des modèles VLA comme GR00T N2 de Nvidia ou Helix de Figure explorent des voies similaires pour étendre la diversité des données d'entraînement au-delà de la téléopération. À ce stade, PRIMO reste une contribution de recherche accompagnée de code source public, sans annonce de déploiement en production ni de partenariat industriel associé, et sa validation indépendante sur d'autres plateformes humanoïdes que celles d'Agibot reste à venir.

À lire aussi

PGMT : suivi de mouvement général perceptif pour robots humanoïdes
1arXiv cs.RO 

PGMT : suivi de mouvement général perceptif pour robots humanoïdes

Un article arXiv mis à jour (2609.08511v2) présente PGMT, Perceptive General Motion Tracking, une méthode qui permet à un robot humanoïde d'adapter ses mouvements au terrain plutôt que de suivre une trajectoire de référence pensée pour un sol plat. Le système apprend d'abord un socle générique de suivi de mouvement et de récupération, puis ajoute une perception du sol via des aperçus de terrain conditionnés par le mouvement en cours, complétés par un relâchement du suivi qui autorise des écarts de trajectoire sans perdre l'intention du geste. Testé en zero-shot sur un robot Unitree G1, sans réentraînement spécifique, PGMT assure une locomotion stable sur des obstacles réels atteignant 37 cm de hauteur, tout en gérant dans une seule politique téléopération, suivi de mouvements dynamiques et récupération après chute. L'enjeu dépasse la prouesse technique : la plupart des démonstrations de motion tracking humanoïde reposent sur un sol plat et prévisible, un terrain "agnostique" qui devient physiquement infaisable dès que le sol se complique, marches, gravats ou dénivelés. En montrant qu'une politique unique gère locomotion adaptative, mouvements complexes et récupération de chute sans contrôleurs séparés par terrain, PGMT s'attaque à l'écart entre démonstrations scénarisées et usage réel, un point sensible pour les intégrateurs visant un déploiement en entrepôt, en usine ou sur chantier. Obtenu par apprentissage par renforcement plutôt que par un modèle vision-langage-action massif, ce résultat rappelle que plusieurs voies techniques coexistent encore pour franchir l'écart simulation-réel. PGMT prolonge des travaux de suivi de mouvement humanoïde qui supposaient jusqu'ici un sol plat pour transférer capture de mouvement, vidéos ou téléopération vers un robot physique. Le choix du Unitree G1, plateforme très utilisée en recherche académique pour son coût maîtrisé, situe ces travaux dans un cadre scientifique plutôt que commercial : c'est une démonstration de laboratoire, sans pilote industriel ni calendrier de déploiement annoncé. Les auteurs présentent PGMT comme une politique unifiée généralisable au-delà du sol plat, documentée sur une page de projet dédiée, ouvrant la voie à une intégration future dans des piles de contrôle humanoïdes plus larges.

RecherchePaper
1 source
Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde
2arXiv cs.RO 

Suivi simplifié : retargeting neural des mouvements pour le contrôle global du robot humanoïde

Une équipe de chercheurs a publié NMR (Neural Motion Retargeting), un framework d'apprentissage automatique conçu pour résoudre l'un des verrous fondamentaux de la robotique humanoïde : transférer des mouvements humains bruts vers un robot physique sans générer d'artefacts cinématiques. Testé sur le Unitree G1, un humanoïde à 23 degrés de liberté commercialisé autour de 16 000 dollars, NMR démontre sa capacité sur des tâches dynamiquement exigeantes comme les arts martiaux et la danse. Les résultats publiés montrent une élimination quasi-totale des "joint jumps" (discontinuités articulaires) et une réduction significative des auto-collisions par rapport aux méthodes de référence actuelles, tout en accélérant la convergence des politiques de contrôle en aval. Le problème que NMR adresse est structurel. Les approches traditionnelles par optimisation géométrique sont non-convexes et convergent systématiquement vers des optima locaux, produisant des mouvements physiquement incohérents inutilisables pour l'entraînement de politiques de contrôle. NMR reformule le problème différemment : au lieu de chercher une solution optimale, il apprend la distribution des données de mouvement valides. Le pipeline repose sur CEPR (Clustered-Expert Physics Refinement), qui utilise un VAE pour regrouper les mouvements humains hétérogènes en motifs latents homogènes, puis fait intervenir des experts en reinforcement learning massivement parallèle pour projeter chaque cluster sur le manifold de mouvements réalisables du robot. Ces données haute-fidélité supervisent ensuite un réseau hybride CNN-Transformer non-autoregressif capable de raisonner sur le contexte temporel global, évitant les pièges géométriques locaux. L'implication pour les intégrateurs est directe : un pipeline de retargeting plus robuste signifie moins de curation manuelle des données de démonstration, goulot d'étranglement majeur dans le développement de politiques whole-body. Ce travail s'inscrit dans une compétition intense autour du sim-to-real et du retargeting humain-robot, domaine où s'affrontent des approches comme SMPL-based retargeting, PhysHOI ou encore les pipelines de Berkeley Humanoid. Unitree, fabricant chinois qui positionne le G1 comme plateforme de recherche accessible face aux robots Figure, Agility ou Boston Dynamics, bénéficie directement de ces avancées publiées en open research. La prochaine étape naturelle sera la validation sur des tâches de manipulation en environnement non structuré, où la cohérence whole-body entre locomotion et bras reste le défi non résolu du secteur.

RecherchePaper
1 source
Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs
3arXiv cs.RO 

Vers un style de tennis professionnel pour robots humanoïdes grâce à une planification et un suivi de mouvement adaptatifs

Des chercheurs ont publié le 21 août 2026 sur arXiv (référence 2608.20087v1) AdaPT, un système de planification et de suivi de mouvement adaptatif qui apprend à des robots humanoïdes à servir et échanger au tennis avec un style proche de celui des joueurs professionnels, directement à partir de vidéos de retransmissions télévisées. L'architecture est hiérarchique : un planificateur génère la trajectoire cinématique stylisée, tandis qu'un module de suivi (tracker) l'exécute en interférant le moins possible avec le plan initial. Validée en simulation, l'approche a ensuite révélé un écart important entre simulation et réel sur le robot Unitree G1, la précision du suivi se dégradant à cause de la planification autorégressive et du bruit de perception ; pour corriger cela, les auteurs ont entraîné le tracker à suivre des vitesses d'exécution randomisées et conditionné le planificateur via un adaptateur de vitesse appris. Les politiques AdaPT ont ensuite été déployées sur le robot humanoïde grand format Dobot Atom (1,7 mètre), capable de servir en conditions réelles sans capture de mouvement, avec vidéos et code publiés sur le site du projet. Ce résultat illustre concrètement la possibilité de transférer un mouvement stylisé et physiquement exigeant, appris depuis de simples vidéos, vers un robot humanoïde grande taille opérant sans motion capture ni environnement contrôlé, un enjeu central pour l'industrie face au fossé habituel entre démonstrations et performance réelle. Il faut toutefois le lire comme un résultat de recherche académique et non comme un produit commercialisé : aucune annonce de volumes, de prix ni de partenariat industriel n'accompagne la publication, et les essais restent limités en nombre. La méthode elle-même dépasse le seul tennis, puisqu'elle traite un problème plus général, générer des mouvements stylistiques complexes sans sacrifier la performance de la tâche, pertinent pour toute application humanoïde exigeant dextérité et fluidité. Ce travail s'inscrit dans une vague récente de recherches sur des humanoïdes jouant à des sports de balle, un domaine où plusieurs laboratoires ont récemment montré des frappes ou services au tennis, badminton ou ping-pong, souvent via des architectures de type VLA ou du renforcement pur. AdaPT se distingue par la combinaison d'une imitation de style issue de vidéos de diffusion et d'une architecture planificateur/tracker pensée spécifiquement pour limiter la dégradation lors du transfert simulation-réel. Les tests ont porté sur deux plateformes, le Unitree G1, standard courant en recherche sur la locomotion, et le Dobot Atom, humanoïde grand format du fabricant chinois Dobot. Les auteurs n'annoncent aucun calendrier de pilote commercial, se limitant à publier code et vidéos et à souligner des enseignements algorithmiques et d'ingénierie pour de futurs systèmes humanoïdes sportifs.

RecherchePaper
1 source
PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes
4arXiv cs.RO 

PAMoR : génération en temps réel de mouvements affectifs paramétrés pour robots humanoïdes

Des chercheurs ont publié le 28 août 2026 sur arXiv (2608.28213) un système baptisé PAMoR, qui génère des mouvements de robot humanoïde porteurs d'une émotion mesurable, plutôt qu'imitée depuis une vidéo de référence ou un simple mot-clé comme le font les systèmes existants pour avatars virtuels. Le système calcule en forme fermée une coordonnée de valence-arousal directement depuis la cinématique du robot, à partir de l'expansion posturale et de l'énergie du mouvement, sans aucune annotation humaine. Un modèle d'action et deux modèles affectifs, entraînés dans un espace latent partagé, se combinent à chaque étape de débruitage: le premier fixe la tâche exécutée, les seconds en modulent la tonalité émotionnelle. Le mouvement corps entier tourne en temps réel, en boucle autorégressive, sur un Unitree G1 à 29 degrés de liberté, action et émotion restant modifiables à la volée. Lors d'une étude perceptuelle, des évaluateurs humains ont identifié l'émotion commandée dans 38% des essais, contre 44% pour des mouvements joués par des acteurs humains. Le secteur humanoïde communique surtout sur la manipulation et la locomotion; l'expressivité émotionnelle des robots reste le plus souvent démontrée par des vidéos sélectionnées plutôt que mesurée par un protocole contrôlé. PAMoR propose un paramètre affectif quantifiable et éditable en temps réel, exploitable dans une boucle de contrôle, ce qui intéresse les intégrateurs travaillant sur l'accueil, l'assistance ou l'interaction sociale, sans dégrader la fidélité texte-mouvement des modèles d'action pure. Le score de reconnaissance de 38%, inférieur au niveau humain mais validé par une comparaison perceptuelle explicite plutôt que par une démo triée, fournit une mesure rare et vérifiable de l'expressivité d'un humanoïde, un exercice auquel peu d'annonces du secteur se prêtent. La génération de mouvement expressif existait déjà pour les avatars virtuels, où le style émotionnel provient d'un clip de référence ou d'un mot d'émotion, deux entrées jugées non quantifiables par les auteurs de PAMoR. Le travail transpose cette approche à la robotique physique via le Unitree G1, plateforme de recherche largement utilisée en académie: il s'agit d'une démonstration reproductible et non d'un produit commercial, issue d'une publication arXiv non encore évaluée par les pairs. Elle se distingue des efforts commerciaux centrés sur la manipulation et la locomotion, à l'image des modèles vision-langage-action Pi-0 ou GR00T N2, en ciblant spécifiquement l'affect social du mouvement. Aucun calendrier de transfert vers une plateforme commerciale ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source