Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage de la locomotion humanoïde adaptée à la scène en environnement 3D encombré à partir de démonstrations humaines immersives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent Moving Through Clutter (MTC), un système d'apprentissage par démonstration pour la locomotion humanoïde en environnement encombré, décrit dans un article publié sur arXiv (2609.21107) fin septembre 2026. Alors que les travaux précédents sur l'imitation de mouvements humains ont surtout produit des prouesses dynamiques en espace dégagé, comme la danse ou les arts martiaux, MTC s'attaque à la traversée d'espaces tridimensionnels contraints par des obstacles. Le pipeline collecte des démonstrations humaines dans des environnements de réalité virtuelle générés de façon procédurale, ce qui évite de construire physiquement des décors d'obstacles coûteux. Un algorithme de retargeting tenant compte de la scène convertit ensuite ces mouvements humains en trajectoires exploitables par le robot, en imposant une marge de sécurité stricte entre le corps du robot et la géométrie environnante pour garantir une traversée sans collision. La politique de locomotion ainsi entraînée est déployée sur un humanoïde Unitree G1. Sur le benchmark interne MTC-Challenge, conçu pour la traversée multi-obstacles, le robot atteint un taux de réussite sans collision de 70,2% sur des scénarios variés, incluant la reptation dans des passages à faible hauteur et le passage par des interstices étroits.

Ce travail cible un angle mort de la robotique humanoïde actuelle: la plupart des démonstrations publiques (marche, danse, sauts) se déroulent en terrain dégagé, alors que les usages industriels visés, entrepôts, usines, chantiers, exigent une navigation fine autour d'obstacles tridimensionnels denses comme des étagères basses, tuyauteries ou racks. Pour les intégrateurs et décideurs qui évaluent le déploiement d'humanoïdes en environnement logistique, un taux de 70,2% de traversées réussies signale que le problème est loin d'être résolu au niveau de fiabilité attendu en production, même si la méthode montre que l'apprentissage par démonstration immersive en VR peut générer des comportements corporels complexes sans motion capture sur décor physique coûteux. Cela confirme aussi que la génération procédurale de données synthétiques reste un levier clé pour faire monter en échelle l'apprentissage de compétences humanoïdes avancées.

Le champ de la locomotion humanoïde par imitation a produit ces deux dernières années des démonstrations spectaculaires sur des plateformes comme Unitree G1, Figure ou Optimus, mais la traversée d'environnements encombrés restait peu explorée. MTC s'inscrit dans cette lignée en élargissant le périmètre à des scènes tridimensionnelles complexes plutôt qu'à du terrain plat. Le choix du G1 d'Unitree, plateforme abordable largement utilisée en recherche académique, confirme son rôle de banc d'essai de référence face à des plateformes plus onéreuses comme Figure 03. L'article ne mentionne ni partenaire industriel ni calendrier de déploiement pilote: il s'agit à ce stade d'un travail de recherche évalué sur un benchmark maison, sans validation en environnement réel de production.

Dans nos dossiers

À lire aussi

HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines
1arXiv cs.RO 

HALOMI : apprentissage de la loco-manipulation humanoïde avec perception active à partir de démonstrations humaines

Une équipe de chercheurs vient de publier sur arXiv (réf. 2606.18772) HALOMI, un framework permettant à un humanoïde d'apprendre la "loco-manipulation" -- navigation et manipulation d'objets combinées -- à partir de démonstrations humaines captées en conditions réelles. Le système étend l'Universal Manipulation Interface (UMI) avec une perception égocentrique double : caméras en vue subjective (ego-view) et au niveau du poignet (wrist-view), enregistrant simultanément les trajectoires tête-mains de l'opérateur. La validation s'effectue sur le Unitree G1, humanoïde équipé d'un cou motorisé, sur cinq catégories de tâches réelles : navigation, préhension, manipulation bimane, coordination corps entier, et comportements dynamiques incluant lancer d'objets et accroupissement profond. HALOMI atteint un taux de réussite moyen de 85 % sur les trois tâches évaluées quantitativement. Ce résultat cible l'un des obstacles fondamentaux du retargeting humain-humanoïde : au-delà du sim-to-real gap, il existe un "human-to-humanoid gap" dans la perception égocentrique et l'exécution motrice. HALOMI l'attaque sur deux fronts : un alignement de la vue subjective, et une adaptation de trajectoire dite "controller-aware" qui intègre les contraintes dynamiques propres au robot. Le contrôleur de suivi tête-main opère dans un espace latent appris (manifold contraint), ce qui le rend plus robuste face aux cibles hors distribution -- écueil classique du retargeting direct. Le 85 % est à nuancer : les tâches qualitatives comme le lancer dynamique n'ont pas de métriques publiées, et les conditions expérimentales exactes (nombre d'essais, variabilité de scène) restent non précisées dans le papier. HALOMI s'inscrit dans la tendance qui exploite les démonstrations humaines pour réduire le coût de collecte de données sur robot, dans la lignée directe d'UMI (Stanford, 2023), et en parallèle des approches Vision-Language-Action comme Pi-Zero (Physical Intelligence) ou GR00T N2 (NVIDIA). La particularité ici est l'accent mis sur la perception active : le cou motorisé du G1 est un élément fonctionnel du pipeline, pas un détail cosmétique. Le Unitree G1, commercialisé autour de 16 000 dollars, s'est imposé comme banc de test académique commun depuis 2024. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans le papier : HALOMI reste pour l'heure une contribution de recherche, sans annonce de commercialisation.

RechercheOpinion
1 source
HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines
2arXiv cs.RO 

HoMMI : apprentissage de la manipulation mobile corps entier à partir de démonstrations humaines

Une équipe de chercheurs a publié sur arXiv (arXiv:2603.03243v2) HoMMI, pour Whole-Body Mobile Manipulation Interface, un framework d'apprentissage par imitation permettant à un robot mobile de maîtriser la manipulation bimanuelle et la navigation à partir de démonstrations humaines réalisées sans robot. Le principe : un opérateur humain porte une interface portative héritée du projet UMI (Universal Manipulation Interface), enrichie d'une caméra égocentrique capturant le contexte global de la scène (position dans l'espace, état de l'environnement). Ces données brutes alimentent une politique apprise, transférée ensuite sur un robot à corps entier (bras, torse, base mobile) sans que celui-ci n'ait été présent lors de la collecte. La difficulté centrale que HoMMI cherche à résoudre est l'"embodiment gap" : la différence morphologique et sensorielle entre humain et robot rend le transfert de politique difficile, particulièrement en perception égocentrique où les champs de vue et hauteurs d'oeil divergent fortement. Les auteurs proposent trois briques techniques pour combler cet écart : une représentation visuelle agnostique à l'embodiment, une représentation d'action "head relaxed" qui neutralise les variations de mouvement de tête, et un contrôleur corps entier réalisant les trajectoires main-oeil sous contraintes physiques du robot. Ces choix permettent des tâches longue-séquence mobilisant navigation, perception active et coordination bimanuelle, le type de scénario que les architectures Vision-Language-Action (VLA) comme pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA visent également à résoudre. Les résultats, présentés sous forme de vidéos sur hommi-robot.github.io, restent à valider en conditions non contrôlées et sur des benchmarks standardisés. HoMMI s'inscrit dans la continuité directe du projet UMI (Columbia/Stanford, 2024), qui avait popularisé la collecte portable de démonstrations pour la manipulation fixe sur table. L'extension au robot mobile ajoute la dimension navigation, saut de complexité majeur pour le sim-to-real et la généralisation hors laboratoire. Les approches concurrentes incluent Mobile ALOHA (Stanford), les pipelines de distillation de données de Physical Intelligence, et les travaux de manipulation bimanuelle ALOHA/ACT de Berkeley. HoMMI reste à ce stade un preprint arXiv sans déploiement industriel annoncé ni métriques de taux de succès publiées, une limite habituelle des publications en robotique d'apprentissage avant revue par les pairs.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde
3arXiv cs.RO 

Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde

Un preprint arXiv (2609.18732v1) publié mi-septembre 2026 présente PASSAGE, un système de planification et de suivi de mouvement conditionné par la perception, pour des robots humanoïdes traversant des environnements encombrés en enjambant, contournant ou se baissant devant les obstacles. Entraîné sur 100 heures de mouvements humains captés en réalité virtuelle et par capture inertielle sur 1500 scènes, un planificateur par flow-matching génère des trajectoires courtes exécutées à 50 Hz par un contrôleur corps entier avec retour géométrique, puis affiné par apprentissage par renforcement, contrôleur figé. Passer de 6 à 100 heures de données porte le taux de succès sans contact de 48,1% à 68,9% sur des scènes inédites, jusqu'à 70,3% avec augmentation de scène validée. Le système fonctionne entièrement en embarqué sur un Jetson AGX Orin, avec LiDAR 3D, cartographie en ligne, planification à 6,25 Hz et contrôle à 50 Hz, testé sur 50 configurations physiques inédites sans carte préconstruite ni calcul déporté. Le résultat s'attaque à un verrou du déploiement humanoïde hors laboratoire : choisir et enchaîner, depuis la seule perception embarquée, le bon comportement de franchissement selon la géométrie rencontrée, sans bibliothèque de mouvements ni récompense spécifique à chaque obstacle. Une seule paire planificateur-contrôleur généralise ici à des géométries jamais vues, ce qui va dans le sens d'un passage à l'échelle des données de démonstration plutôt que de l'ingénierie tâche par tâche, comme le montrent déjà les modèles vision-langage-action en manipulation tels que Pi-0, GR00T N2 ou Helix. Ce travail illustre un basculement de la recherche humanoïde, concentrée jusqu'ici sur la manipulation avec les modèles vision-langage-action, vers la locomotion en environnement non structuré, restée en retrait malgré la course menée par Figure, Tesla ou Unitree. Le choix du flow-matching pour générer les trajectoires prolonge une tendance déjà observée après les modèles de diffusion. Le preprint ne précise ni plateforme robotique commerciale ni entreprise porteuse : il reste, à ce stade, un résultat de recherche testé en simulation et sur un nombre limité de configurations physiques réelles, sans calendrier de transfert vers un produit. Aucun acteur français ou européen n'y figure.

RecherchePaper
1 source
Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré
4arXiv cs.RO 

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré

VulcanVoxel, un nouveau système de perception robotique présenté dans un article publié le 2 juillet sur arXiv (2607.02549), résout un problème concret de la logistique automatisée : comment une lame robotique doit-elle balayer des articles entassés dans des bacs en tissu pour créer un espace d'insertion, lors des opérations de stowing (rangement) en entrepôt. Plutôt que de prédire une pose unique pour la lame comme le font les approches classiques, le système reconstruit un champ d'occupation 3D voxel par voxel via un autoencodeur masqué, conditionné sur la géométrie de la scène. Entraîné sur 10 000 épisodes réels de rangement en entrepôt sans aucune annotation humaine, VulcanVoxel atteint un taux de couverture top-5 de 0,89, contre 0,71 pour la meilleure référence basée sur des poses SE(3). Une version distillée du modèle permet une inférence directe RGB vers voxel en seulement 30 millisecondes, contre 1,4 seconde pour l'approche voxel-à-voxel complète. Les chercheurs ont aussi publié un jeu de données d'épisodes réels d'insertion de lame, avec observations RGB-D et trajectoires de pose, disponible sur armbench.com. L'intérêt de ce travail dépasse le cas d'usage de la lame de stowing : il pointe une limite structurelle des méthodes actuelles d'apprentissage d'affordances, y compris les objectifs génératifs récents comme le flow matching. Ces méthodes, entraînées sur des données produites par une seule politique d'exécution, n'apprennent qu'une distribution unimodale et ne peuvent pas récupérer les alternatives géométriques équivalentes qui existent réellement dans une scène encombrée. En reformulant le problème dans l'espace plutôt que dans l'espace des poses, VulcanVoxel capture nativement cette multimodalité. Pour les intégrateurs et responsables d'automatisation d'entrepôt, le gain de vitesse (times 45 environ) est ce qui rend l'approche déployable en cadence de production réelle, là où le calcul voxel-à-voxel complet resterait trop lent. Le contexte de cette recherche est celui des systèmes de stowing en production qui génèrent, selon les auteurs, des millions d'épisodes de manipulation, un volume caractéristique des opérations d'automatisation logistique à grande échelle, comme celles qu'on associe généralement au jeu de données ArmBench. L'article positionne explicitement son approche contre les méthodes de pose SE(3) et les modèles génératifs unimodaux dominants dans le secteur, et la publication du jeu de données d'insertion de lame ouvre la voie à des comparaisons futures sur ce type de tâche de manipulation par affordances de volume libre, un sous-problème encore peu étudié comparé à la préhension classique.

RecherchePaper
1 source