Aller au contenu principal
LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré
RecherchearXiv cs.RO 

LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent LHM-Humanoid, un système de contrôle physique pour humanoïdes simulés capable d'enchaîner en continu des cycles complets de collecte, transport et dépôt d'objets, sans réinitialisation entre chaque cycle. L'approche a été testée sur 350 configurations de pièces encombrées, réparties en quatre types d'environnements. Elle repose sur deux contrôleurs conditionnés par objectif : le premier exécute le cycle « aller chercher, porter, déposer » et apprend un comportement de relâchement et de retrait pour terminer dans un état récupérable ; le second prend ensuite le relais depuis cette distribution d'états. Les deux sont régularisés par un a priori de mouvement adversarial, puis distillés en une seule politique capable d'exécuter toute la séquence en un unique passage continu, sans reset. Les travaux, publiés sur arXiv (2508.16943v3, version révisée), montrent des performances nettement supérieures à celles du RL de bout en bout, du RL hiérarchique et des méthodes antérieures d'interaction humain-scène.

Le problème central n'est pas la marche, le levage ou le dépôt pris isolément, ces briques sont déjà bien maîtrisées en simulation, mais la transition entre cycles : chaque dépôt laisse le personnage dans une posture déséquilibrée non canonique, où l'apprentissage par renforcement de bout en bout échoue généralement. En traitant ce passage de relais comme un problème de récupérabilité à double contrainte, préserver l'objet tout juste posé tout en atterrissant dans un état permettant une reprise équilibrée, l'équipe s'attaque à un angle mort classique du secteur : la plupart des démonstrations de robotique humanoïde restent des clips courts réinitialisés entre chaque prise, loin des scénarios de production continue visés en logistique ou en usine. Pour les chercheurs et intégrateurs, ce résultat éclaire un vrai obstacle vers l'autonomie longue durée, plutôt qu'une simple performance ponctuelle sur une tâche isolée.

Ces travaux s'inscrivent dans le champ du contrôle de mouvement humain basé sur la physique, orienté simulation et réalisme biomécanique, à distinguer des approches VLA appliquées à du matériel réel comme Pi-0 ou GR00T N2, qui elles ciblent le transfert sim-to-real sur robot physique. LHM-Humanoid demeure pour l'instant un résultat purement simulé, validé sur scènes connues et inédites, sans mention de déploiement sur plateforme réelle. La suite logique consisterait à transposer cette stratégie de transition récupérable vers des humanoïdes physiques, à l'image de ceux développés par Figure, Tesla ou Boston Dynamics, où l'enchaînement sans interruption de tâches de manutention reste aujourd'hui un défi ouvert pour l'industrie.

À lire aussi

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier
1arXiv cs.RO 

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier

Des chercheurs présentent HOTICE, un framework d'apprentissage pour robots humanoïdes dédié au transport d'objets en environnement encombré, détaillé dans un preprint publié sur arXiv (2609.25363v1). Le système combine des « champs de potentiel découplés humanoïde-objet », qui calculent simultanément l'évitement de collision pour le corps du robot et pour l'objet porté, et une architecture de renforcement à deux agents séparant le contrôle du haut et du bas du corps tout en gardant une coordination globale via des observations et récompenses partagées. Pour généraliser à des scènes variées, les auteurs distillent plusieurs politiques enseignantes « privilégiées » en une seule politique étudiante déployable. HOTICE a été testé en simulation MuJoCo puis sur un robot Unitree G1 réel, transportant des objets de formes différentes à travers des obstacles ; le papier ne cite toutefois aucun chiffre de taux de réussite, de charge utile ou de temps de cycle, se limitant à des qualificatifs comme « efficace » et « robuste ». Le transport d'objets en espace contraint reste une capacité rare dans les démonstrations humanoïdes actuelles, la plupart des systèmes commerciaux comme Figure 03 ou Optimus Gen 3 étant montrés en environnement dégagé. En traitant simultanément l'évitement de collision du robot et de sa charge, HOTICE cible un problème concret pour les intégrateurs logistiques confrontés à des couloirs d'entrepôt ou des ateliers exigus. L'approche illustre aussi une alternative aux modèles vision-langage-action monolithiques comme Pi-0 ou GR00T N2 : découper la loco-manipulation en agents spécialisés coordonnés réduit l'espace d'action à apprendre et facilite, selon les auteurs, le transfert de la simulation vers un robot réel. HOTICE demeure un résultat de recherche en preprint, sans affiliation institutionnelle précisée ni partenariat industriel ou pilote commercial annoncé. Il s'inscrit dans une recherche active sur la loco-manipulation humanoïde, où plusieurs équipes explorent des architectures multi-agents pour coordonner bras et jambes, aux côtés de modèles généralistes comme Helix chez Figure AI ou GR00T N2 chez NVIDIA. Le choix du Unitree G1, plateforme chinoise largement adoptée par les laboratoires académiques pour son coût abordable, confirme son rôle de banc d'essai de référence pour ce type de travaux. Aucun calendrier de transfert vers un produit n'est mentionné ; les auteurs annoncent seulement la validation technique de leur méthode.

RecherchePaper
1 source
Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement
2arXiv cs.RO 

Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement

Un article de recherche publie sur arXiv (2609.21467v1) présente Distance-Conditioned Reference Recomposition (DCRR), une méthode pour entrainer des robots humanoïdes a la loco-manipulation d'objets a partir d'un seul clip de mouvement démontre. Les auteurs identifient un biais qu'ils nomment le "termination-versus-passage gap": une politique de suivi de mouvement entraînée sur une trajectoire fixe ne reproduit fidèlement que le point d'arrivée démontre, alors que la source visite déjà des positions intermédiaires de l'objet. DCRR déplace le segment de fin de démonstration vers ces états intermédiaires, les rejoue via un teacher de suivi fige, puis distille les résultats reetiquetes dans une politique sans référence. Sur quatre taches (porter, pousser au pied, pousser accroupi, trainer), DCRR-BC obtient une erreur moyenne normalisée de 0,15 contre 0,28 pour un clonage comportemental classique; un affinage par renforcement améliore ensuite la robustesse, confirmée sur robot physique. Cette contribution s'attaque a une limite connue des pipelines d'imitation pour humanoïdes: une politique apprise par retargeting d'un mouvement humain unique reproduit généralement une seule démonstration figée, sans capacité a viser une distance de transport arbitraire a l'inférence. Pour un intégrateur industriel, déposer une caisse a 30 centimètres ou a 1,20 mètre exigerait normalement autant de démonstrations que de distances cibles. En montrant qu'un clip source unique, recompose puis redistribue, suffit a produire un comportement conditionne par la distance, l'étude réduit le besoin de collecte de données, un goulot d'étranglement reconnu face aux approches VLA gourmandes en téléopération. Elle rappelle aussi que le transfert simulation-vers-réel reste teste, non acquis: les auteurs vérifient d'abord la robustesse en sim-to-sim avant le matériel. Il s'agit d'une publication de recherche (arXiv, catégorie "new"), sans robot ni entreprise identifies dans le résume: la méthode est validée en simulation puis sur du matériel générique, sans que la plateforme humanoïde soit précisée. Elle s'inscrit dans la lignée des travaux combinant retargeting de mouvement humain et apprentissage par renforcement pour la loco-manipulation, une famille distincte des modèles VLA comme Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus multi-taches plutôt que sur un clip unique. Aucun pilote industriel ni calendrier de déploiement n'est annonce: c'est un résultat méthodologique destine a de futures politiques de transport conditionne, pas un produit prêt a intégrer.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde
3arXiv cs.RO 

Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde

Un preprint arXiv (2609.18732v1) publié mi-septembre 2026 présente PASSAGE, un système de planification et de suivi de mouvement conditionné par la perception, pour des robots humanoïdes traversant des environnements encombrés en enjambant, contournant ou se baissant devant les obstacles. Entraîné sur 100 heures de mouvements humains captés en réalité virtuelle et par capture inertielle sur 1500 scènes, un planificateur par flow-matching génère des trajectoires courtes exécutées à 50 Hz par un contrôleur corps entier avec retour géométrique, puis affiné par apprentissage par renforcement, contrôleur figé. Passer de 6 à 100 heures de données porte le taux de succès sans contact de 48,1% à 68,9% sur des scènes inédites, jusqu'à 70,3% avec augmentation de scène validée. Le système fonctionne entièrement en embarqué sur un Jetson AGX Orin, avec LiDAR 3D, cartographie en ligne, planification à 6,25 Hz et contrôle à 50 Hz, testé sur 50 configurations physiques inédites sans carte préconstruite ni calcul déporté. Le résultat s'attaque à un verrou du déploiement humanoïde hors laboratoire : choisir et enchaîner, depuis la seule perception embarquée, le bon comportement de franchissement selon la géométrie rencontrée, sans bibliothèque de mouvements ni récompense spécifique à chaque obstacle. Une seule paire planificateur-contrôleur généralise ici à des géométries jamais vues, ce qui va dans le sens d'un passage à l'échelle des données de démonstration plutôt que de l'ingénierie tâche par tâche, comme le montrent déjà les modèles vision-langage-action en manipulation tels que Pi-0, GR00T N2 ou Helix. Ce travail illustre un basculement de la recherche humanoïde, concentrée jusqu'ici sur la manipulation avec les modèles vision-langage-action, vers la locomotion en environnement non structuré, restée en retrait malgré la course menée par Figure, Tesla ou Unitree. Le choix du flow-matching pour générer les trajectoires prolonge une tendance déjà observée après les modèles de diffusion. Le preprint ne précise ni plateforme robotique commerciale ni entreprise porteuse : il reste, à ce stade, un résultat de recherche testé en simulation et sur un nombre limité de configurations physiques réelles, sans calendrier de transfert vers un produit. Aucun acteur français ou européen n'y figure.

RecherchePaper
1 source
Calibration main-oeil en continu pour la manipulation robotique en environnement ouvert
4arXiv cs.RO 

Calibration main-oeil en continu pour la manipulation robotique en environnement ouvert

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.15814) un framework d'étalonnage main-oeil continu (continual hand-eye calibration) destiné aux robots manipulateurs déployés dans des environnements ouverts et changeants. Le problème adressé est précis : les modèles de calibration basés sur le deep learning perdent leur précision sur les scènes précédemment apprises dès qu'ils s'adaptent à un nouvel environnement, un phénomène connu sous le nom d'oubli catastrophique (catastrophic forgetting). Le framework proposé repose sur deux composants distincts. Le premier, SARS (Spatial-Aware Replay Strategy), construit un buffer de rejeu géométriquement uniforme qui couvre l'espace de poses de chaque scène sans redondance, en sélectionnant les points de vue les plus informatifs plutôt que les frames adjacentes. Le second, SPDD (Structure-Preserving Dual Distillation), décompose la connaissance de localisation en deux niveaux, la structure grossière de la scène et la précision fine de pose, puis applique une distillation séparée pour préserver les deux dimensions lors des adaptations successives. Les expériences sur plusieurs datasets publics confirment que le modèle maintient la précision sur les scènes passées tout en s'adaptant aux nouvelles. L'enjeu industriel est réel : un bras manipulateur recalibré pour une nouvelle cellule de production ne devrait pas perdre sa précision sur les postes précédents. C'est le problème quotidien des intégrateurs qui déploient des robots dans des lignes flexibles ou multi-produits. La plupart des approches actuelles imposent soit un recalibrage complet à chaque changement de scène, soit acceptent une dégradation progressive des performances sur les configurations antérieures. Ce travail propose une voie intermédiaire via l'apprentissage continu structuré, sans recourir à un replay naïf qui ne suffit pas à enrayer l'oubli. L'approche par distillation duale est notamment pertinente car elle distingue deux types d'erreur, positionnement global et précision locale, ce que les méthodes monolithiques ne font pas. Ce travail s'inscrit dans un champ de recherche en forte activité depuis 2022, où la robustesse de la calibration visuelle en conditions réelles est identifiée comme l'un des goulots d'étranglement pour le passage à l'échelle des manipulateurs autonomes. La localisation visuelle pour la calibration main-oeil emprunte aux techniques de Visual Place Recognition (VPR) et de relocalisation utilisées en navigation mobile, mais les contraintes de précision sous-millimétrique propres à la manipulation y ajoutent une difficulté spécifique. Parmi les acteurs qui travaillent sur des problèmes adjacents figurent des équipes comme Physical Intelligence (pi) avec Pi-0, ou des laboratoires comme le Stanford AI Lab et ETH Zurich sur la sim-to-real calibration. En France, des acteurs comme Enchanted Tools et Pollen Robotics, qui développent des plateformes d'interaction physique, sont directement concernés par ce type de verrou. La prochaine étape naturelle pour ce framework serait une validation sur des données industrielles réelles et une intégration dans des pipelines de déploiement multi-cellules, que les auteurs n'ont pas encore annoncée.

UEEnchanted Tools et Pollen Robotics, qui développent des plateformes de manipulation physique en France, sont directement concernés par ce verrou de calibration continue, susceptible de réduire les coûts de redéploiement en production flexible.

RecherchePaper
1 source