Aller au contenu principal
HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier
RecherchearXiv cs.RO 

HOTICE : transport d'objets en environnement encombré par un robot humanoïde en corps entier

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent HOTICE, un framework d'apprentissage pour robots humanoïdes dédié au transport d'objets en environnement encombré, détaillé dans un preprint publié sur arXiv (2609.25363v1). Le système combine des « champs de potentiel découplés humanoïde-objet », qui calculent simultanément l'évitement de collision pour le corps du robot et pour l'objet porté, et une architecture de renforcement à deux agents séparant le contrôle du haut et du bas du corps tout en gardant une coordination globale via des observations et récompenses partagées. Pour généraliser à des scènes variées, les auteurs distillent plusieurs politiques enseignantes « privilégiées » en une seule politique étudiante déployable. HOTICE a été testé en simulation MuJoCo puis sur un robot Unitree G1 réel, transportant des objets de formes différentes à travers des obstacles ; le papier ne cite toutefois aucun chiffre de taux de réussite, de charge utile ou de temps de cycle, se limitant à des qualificatifs comme « efficace » et « robuste ».

Le transport d'objets en espace contraint reste une capacité rare dans les démonstrations humanoïdes actuelles, la plupart des systèmes commerciaux comme Figure 03 ou Optimus Gen 3 étant montrés en environnement dégagé. En traitant simultanément l'évitement de collision du robot et de sa charge, HOTICE cible un problème concret pour les intégrateurs logistiques confrontés à des couloirs d'entrepôt ou des ateliers exigus. L'approche illustre aussi une alternative aux modèles vision-langage-action monolithiques comme Pi-0 ou GR00T N2 : découper la loco-manipulation en agents spécialisés coordonnés réduit l'espace d'action à apprendre et facilite, selon les auteurs, le transfert de la simulation vers un robot réel.

HOTICE demeure un résultat de recherche en preprint, sans affiliation institutionnelle précisée ni partenariat industriel ou pilote commercial annoncé. Il s'inscrit dans une recherche active sur la loco-manipulation humanoïde, où plusieurs équipes explorent des architectures multi-agents pour coordonner bras et jambes, aux côtés de modèles généralistes comme Helix chez Figure AI ou GR00T N2 chez NVIDIA. Le choix du Unitree G1, plateforme chinoise largement adoptée par les laboratoires académiques pour son coût abordable, confirme son rôle de banc d'essai de référence pour ce type de travaux. Aucun calendrier de transfert vers un produit n'est mentionné ; les auteurs annoncent seulement la validation technique de leur méthode.

À lire aussi

LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré
1arXiv cs.RO 

LHM-Humanoid : commande longue portée du mouvement humain pour le transport continu d'objets en environnement encombré

Des chercheurs présentent LHM-Humanoid, un système de contrôle physique pour humanoïdes simulés capable d'enchaîner en continu des cycles complets de collecte, transport et dépôt d'objets, sans réinitialisation entre chaque cycle. L'approche a été testée sur 350 configurations de pièces encombrées, réparties en quatre types d'environnements. Elle repose sur deux contrôleurs conditionnés par objectif : le premier exécute le cycle « aller chercher, porter, déposer » et apprend un comportement de relâchement et de retrait pour terminer dans un état récupérable ; le second prend ensuite le relais depuis cette distribution d'états. Les deux sont régularisés par un a priori de mouvement adversarial, puis distillés en une seule politique capable d'exécuter toute la séquence en un unique passage continu, sans reset. Les travaux, publiés sur arXiv (2508.16943v3, version révisée), montrent des performances nettement supérieures à celles du RL de bout en bout, du RL hiérarchique et des méthodes antérieures d'interaction humain-scène. Le problème central n'est pas la marche, le levage ou le dépôt pris isolément, ces briques sont déjà bien maîtrisées en simulation, mais la transition entre cycles : chaque dépôt laisse le personnage dans une posture déséquilibrée non canonique, où l'apprentissage par renforcement de bout en bout échoue généralement. En traitant ce passage de relais comme un problème de récupérabilité à double contrainte, préserver l'objet tout juste posé tout en atterrissant dans un état permettant une reprise équilibrée, l'équipe s'attaque à un angle mort classique du secteur : la plupart des démonstrations de robotique humanoïde restent des clips courts réinitialisés entre chaque prise, loin des scénarios de production continue visés en logistique ou en usine. Pour les chercheurs et intégrateurs, ce résultat éclaire un vrai obstacle vers l'autonomie longue durée, plutôt qu'une simple performance ponctuelle sur une tâche isolée. Ces travaux s'inscrivent dans le champ du contrôle de mouvement humain basé sur la physique, orienté simulation et réalisme biomécanique, à distinguer des approches VLA appliquées à du matériel réel comme Pi-0 ou GR00T N2, qui elles ciblent le transfert sim-to-real sur robot physique. LHM-Humanoid demeure pour l'instant un résultat purement simulé, validé sur scènes connues et inédites, sans mention de déploiement sur plateforme réelle. La suite logique consisterait à transposer cette stratégie de transition récupérable vers des humanoïdes physiques, à l'image de ceux développés par Figure, Tesla ou Boston Dynamics, où l'enchaînement sans interruption de tâches de manutention reste aujourd'hui un défi ouvert pour l'industrie.

RecherchePaper
1 source
Interaction-Aware : contrôle du corps entier pour un transport d'objets compliant
2arXiv cs.RO 

Interaction-Aware : contrôle du corps entier pour un transport d'objets compliant

Le transport coopératif d'objets en environnement non structuré reste un défi majeur pour les robots humanoïdes assistants, car les forces d'interaction fortes et variables dans le temps rendent peu fiable le contrôle corps entier classique axé sur le suivi de trajectoire, notamment lors de tâches de soutien en contact rapproché. Une équipe de recherche propose IO-WBC (Interaction-Oriented Whole-Body Control), un contrôle bio-inspiré fonctionnant comme un "cervelet artificiel" : un agent moteur adaptatif qui traduit des commandes de haut niveau en comportements corps entier stables et physiquement cohérents sous contact. L'architecture sépare structurellement l'exécution des interactions du haut du corps du contrôle de soutien du bas du corps, permettant au robot de garder l'équilibre tout en modulant les échanges de force avec l'objet transporté. Un générateur de référence optimisé par trajectoire fournit un a priori cinématique, tandis qu'une politique d'apprentissage par renforcement gère les réponses du corps sous charges lourdes et perturbations. Cette politique est entraînée en simulation avec masse et inertie de charge randomisées, puis déployée via une distillation asymétrique enseignant-élève, l'élève ne s'appuyant à l'exécution que sur l'historique proprioceptif. L'article, republié en version révisée sur arXiv (2603.03751v2), rapporte des expériences montrant un comportement corps entier stable même quand le suivi précis de vitesse devient impossible. Ce travail s'attaque à un point de friction connu de la robotique humanoïde assistive : les contrôleurs classiques, optimisés pour suivre une trajectoire, décrochent dès que les forces de contact deviennent imprévisibles, ce qui limite les cas d'usage réels de transport ou de manipulation coopérative. En démontrant qu'une politique RL entraînée sur charge et perturbations randomisées peut maintenir la stabilité sans suivi de vitesse parfait, l'étude apporte un argument concret dans le débat sur l'écart entre démonstrations en simulation et robustesse en conditions réelles, un sujet sensible pour tout intégrateur évaluant des humanoïdes pour la logistique ou l'assistance physique. Il s'agit d'une publication académique, sans lien annoncé avec un produit commercial ou une plateforme robotique spécifique ; l'article ne mentionne ni partenaire industriel ni calendrier de déploiement. La distillation enseignant-élève et l'entraînement par domain randomization s'inscrivent dans une lignée de méthodes désormais courantes en contrôle locomoteur par apprentissage, appliquées ici à un problème encore peu traité : la manipulation coopérative sous forte charge de contact.

RecherchePaper
1 source
Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement
3arXiv cs.RO 

Apprentissage du transport d'objets conditionné par la distance pour la loco-manipulation humanoïde à partir d'un seul clip de mouvement

Un article de recherche publie sur arXiv (2609.21467v1) présente Distance-Conditioned Reference Recomposition (DCRR), une méthode pour entrainer des robots humanoïdes a la loco-manipulation d'objets a partir d'un seul clip de mouvement démontre. Les auteurs identifient un biais qu'ils nomment le "termination-versus-passage gap": une politique de suivi de mouvement entraînée sur une trajectoire fixe ne reproduit fidèlement que le point d'arrivée démontre, alors que la source visite déjà des positions intermédiaires de l'objet. DCRR déplace le segment de fin de démonstration vers ces états intermédiaires, les rejoue via un teacher de suivi fige, puis distille les résultats reetiquetes dans une politique sans référence. Sur quatre taches (porter, pousser au pied, pousser accroupi, trainer), DCRR-BC obtient une erreur moyenne normalisée de 0,15 contre 0,28 pour un clonage comportemental classique; un affinage par renforcement améliore ensuite la robustesse, confirmée sur robot physique. Cette contribution s'attaque a une limite connue des pipelines d'imitation pour humanoïdes: une politique apprise par retargeting d'un mouvement humain unique reproduit généralement une seule démonstration figée, sans capacité a viser une distance de transport arbitraire a l'inférence. Pour un intégrateur industriel, déposer une caisse a 30 centimètres ou a 1,20 mètre exigerait normalement autant de démonstrations que de distances cibles. En montrant qu'un clip source unique, recompose puis redistribue, suffit a produire un comportement conditionne par la distance, l'étude réduit le besoin de collecte de données, un goulot d'étranglement reconnu face aux approches VLA gourmandes en téléopération. Elle rappelle aussi que le transfert simulation-vers-réel reste teste, non acquis: les auteurs vérifient d'abord la robustesse en sim-to-sim avant le matériel. Il s'agit d'une publication de recherche (arXiv, catégorie "new"), sans robot ni entreprise identifies dans le résume: la méthode est validée en simulation puis sur du matériel générique, sans que la plateforme humanoïde soit précisée. Elle s'inscrit dans la lignée des travaux combinant retargeting de mouvement humain et apprentissage par renforcement pour la loco-manipulation, une famille distincte des modèles VLA comme Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus multi-taches plutôt que sur un clip unique. Aucun pilote industriel ni calendrier de déploiement n'est annonce: c'est un résultat méthodologique destine a de futures politiques de transport conditionne, pas un produit prêt a intégrer.

RecherchePaper
1 source
Planification de trajets robotiques adaptée à la congestion en environnements encombrés
4arXiv cs.RO 

Planification de trajets robotiques adaptée à la congestion en environnements encombrés

Des chercheurs ont publié sur arXiv (réf. 2606.19031, juin 2026) un planificateur de tournées probabiliste pour robots mobiles autonomes (AMR) en espaces publics encombrés. Le système vise à guider un robot de service, qu'il soit guide en centre commercial, livreur en entrepôt de préparation de commandes ou médiateur muséal, à travers une séquence de points de passage en tenant compte du comportement stochastique des foules. L'approche repose sur des cartes CLiFF (Circular Linear Flow Field), des modèles statistiques appris qui prédisent les trajectoires piétonnes à partir d'une observation initiale. Ces prédictions alimentent un processus de décision markovien (MDP) résolu en ligne, autorisant un recalcul d'itinéraire à chaque nouvelle observation de passants. La validation s'appuie sur un jeu de données réel collecté dans un centre commercial. Le problème est concret et régulièrement sous-estimé dans les déploiements AMR : les manoeuvres d'évitement de collision déclenchées par la présence humaine dégradent les temps de cycle de manière non linéaire, particulièrement dans les espaces à densité variable selon l'heure de la journée. Traiter la foule comme un processus stochastique temporel plutôt que comme un simple bruit à filtrer représente un changement d'approche pertinent pour les intégrateurs opérant en logistique retail ou en accueil public. La contribution d'ingénierie centrale est la replanification en ligne sans recalcul global du MDP, ce qui conditionne l'utilisabilité réelle en environnement dynamique. A noter : les métriques de performance (gains de temps de cycle, taux de succès de tournée) ne sont pas quantifiées dans le résumé publié, et l'évaluation reste limitée à un seul site, ce qui limite la généralisation des conclusions. Les cartes CLiFF constituent un cadre existant de modélisation des flux piétons, ici couplé pour la première fois à un MDP online dans un contexte de planification multi-points de passage. La navigation sociale est un champ de recherche actif depuis une décennie, avec des approches concurrentes basées sur les modèles de force sociale, le protocole ORCA, ou des méthodes d'apprentissage profond sur trajectoires piétonnes (GNN, Transformer). Ce travail reste au stade de preprint académique, sans partenaire industriel ni déploiement commercial annoncé. La prochaine étape logique serait une validation multi-sites et une comparaison quantitative directe avec ces méthodes concurrentes, en particulier sur des géométries d'espaces plus complexes et des horizons temporels plus longs.

RecherchePaper
1 source