Aller au contenu principal
Immersion sociale en réalité virtuelle avec des humanoïdes assistés par LLM
RecherchearXiv cs.RO 

Immersion sociale en réalité virtuelle avec des humanoïdes assistés par LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent un système de téléopération immersive pour robots humanoïdes combinant casque Apple Vision Pro et modèle de langage, testé sur un robot Unitree H1 équipé de mains dextres. L'opérateur reçoit un flux vidéo à la première personne directement depuis les caméras du robot, pilote ses déplacements par commandes vocales en langage naturel converties en instructions de haut niveau par un module LLM, et contrôle les bras et les doigts du robot par suivi du poignet et des mains, retranscrit via cinématique inverse et régulation PD. Le système enregistre en parallèle des données multimodales : images RGB égocentriques, commandes vocales et texte, états articulaires, mouvements des mains et signaux de regard, en vue d'un futur entraînement par apprentissage par imitation. Les auteurs rapportent que des utilisateurs novices, après une brève familiarisation, atteignent 80% de réussite sur des tâches de manipulation d'objets et 70% sur une tâche d'interaction sociale consistant à se faire passer un cube avec le robot.

L'intérêt de ces travaux tient moins à la performance brute qu'à la démonstration d'une interface de téléopération accessible à des non-experts, sans entraînement lourd ni contrôle bas niveau exigeant. C'est un signal pertinent pour le secteur : la plupart des démonstrations de téléopération humanoïde restent réservées à des opérateurs entraînés maniant des contrôleurs spécialisés, ce qui freine leur adoption pour l'assistance à distance ou la collecte de données d'entraînement à grande échelle. En couplant retour visuel immersif, langage naturel et capture de mouvement fine, cette approche illustre une piste concrète pour réduire la charge cognitive et physique de l'opérateur, un frein connu au déploiement commercial des humanoïdes téléopérés. Il faut toutefois noter que les taux de réussite annoncés, 70 à 80%, restent modestes face aux standards industriels et proviennent d'un nombre d'essais limité en laboratoire, loin d'un déploiement réel.

Ce travail s'inscrit dans la lignée des systèmes de téléopération immersive qui se sont multipliés avec l'essor des VLA (modèles vision-langage-action) comme Pi-0 ou GR00T N2, où la collecte de démonstrations humaines de haute qualité est un goulot d'étranglement majeur pour l'apprentissage. Le choix du Vision Pro comme interface, plutôt que des combinaisons de capture de mouvement traditionnelles, reflète une tendance plus large du secteur à exploiter le matériel grand public pour réduire les coûts de téléopération, une direction également explorée par plusieurs laboratoires américains et chinois. Il s'agit ici d'une publication de recherche académique arXiv, sans partenaire industriel ni calendrier de commercialisation annoncé : les prochaines étapes attendues porteraient sur l'exploitation des données multimodales collectées pour entraîner des politiques autonomes, transformant à terme cette téléopération assistée en un système capable d'agir de façon plus indépendante.

À lire aussi

Apprendre à empiler : imitation learning par démonstrations en réalité virtuelle pour empiler des cubes
1arXiv cs.RO 

Apprendre à empiler : imitation learning par démonstrations en réalité virtuelle pour empiler des cubes

La collecte de démonstrations reste le principal frein à l'apprentissage par imitation pour les tâches manipulatoires en plusieurs étapes, qui exigent de réinitialiser la scène après chaque essai humain. Un article publié sur arXiv en septembre 2026 (arXiv:2609.19040v1) décrit un pipeline de collecte de données en réalité virtuelle conçu pour contourner ce goulot d'étranglement, appliqué à une tâche d'empilement de cubes avec un bras robotique personnalisé à 5 degrés de liberté (DoF) simulé dans NVIDIA Isaac Sim et Isaac Lab. Équipé d'un casque HTC Vive Pro 2, de gants Manus Quantum et du standard OpenXR, un opérateur envoie des commandes SE(3) à l'effecteur terminal pour générer les démonstrations. La tâche consiste à empiler le cube rouge sur le cube bleu puis le cube vert sur le cube rouge, avec des positions de départ randomisées à chaque essai. En 30 minutes, l'équipe a collecté 200 démonstrations virtuelles, à comparer aux 45 démonstrations réalisées par téléopération physique sur le robot réel, et le module Isaac Mimic a généré 100 échantillons supplémentaires par augmentation automatique. Une politique de clonage comportemental a ensuite été entraînée sur les démonstrations virtuelles avec des observations double caméra au format LeRobot, puis évaluée en simulation. L'apport principal tient moins au volume brut qu'à la séparation entre capture des trajectoires et construction du jeu de données : une démonstration enregistrée peut être rejouée, ses commandes converties de l'espace des tâches vers l'espace articulaire, puis re-rendue avec de nouvelles configurations de capteurs ou d'états, sans nouvelle session de téléopération humaine. Pour les laboratoires et intégrateurs qui cherchent à entraîner des politiques de manipulation à grande échelle, cette approche promet de réduire le coût humain récurrent associé à chaque changement d'observation ou d'action, un enjeu central alors que le secteur multiplie les tentatives de données synthétiques ou téléopérées pour nourrir des modèles de type vision-langage-action. Le travail reste néanmoins circonscrit à une tâche simple à trois cubes et évalué uniquement en simulation, ce qui ne constitue pas une démonstration de transfert sim-to-real sur robot physique et appelle à la prudence sur la généralisation des résultats. Ce travail s'inscrit dans la lignée des efforts recourant à la téléopération VR/AR, déjà explorée par plusieurs équipes de robotique, pour remplacer ou compléter la téléopération physique classique jugée trop lente et coûteuse à grande échelle. L'écosystème NVIDIA Isaac (Isaac Sim, Isaac Lab, Isaac Mimic) sert ici de socle de simulation et d'augmentation de données, une plateforme de plus en plus utilisée par la communauté recherche pour générer des jeux d'entraînement sans dépendre exclusivement d'un robot physique disponible en continu. Les auteurs positionnent leur contribution comme une preuve de concept méthodologique plutôt qu'un système prêt au déploiement, et les suites logiques annoncées portent sur l'extension à des bras à davantage de degrés de liberté, des tâches multi-étapes plus complexes, et une validation sur robot réel pour confirmer que les politiques apprises en réalité virtuelle se transfèrent effectivement hors simulation.

RecherchePaper
1 source
Validation de la réalité virtuelle pour l'étude de l'interaction humain-robot multimodale en navigation sociale de robots
2arXiv cs.RO 

Validation de la réalité virtuelle pour l'étude de l'interaction humain-robot multimodale en navigation sociale de robots

Une équipe de recherche a testé si la réalité virtuelle (VR) permet d'étudier fidèlement les interactions humain-robot dans des scénarios de navigation sociale partagée. L'étude, menée avec 21 participants, a comparé leurs réactions face à un robot mobile manipulateur PR2 dans deux conditions identiques : une arène réelle équipée de capture de mouvement, et sa réplique virtuelle immersive en VR. Deux situations classiques de co-navigation ont été examinées, le croisement orthogonal et le dépassement latéral (pass-by). Les chercheurs ont recueilli à la fois des mesures subjectives, la perception de la conscience sociale du robot et le confort ressenti par les participants, et des données comportementales objectives, trajectoires de déplacement et orientation de la tête, pour comparer précisément les deux environnements. Résultat central : les participants perçoivent la navigation socialement consciente du robot de façon similaire dans les deux conditions, et les comportements observés en VR, trajectoires évitées, orientations du regard, correspondent à ceux mesurés en conditions réelles. Cette validation compte pour tout le secteur de la robotique sociale et des humanoïdes déployés en environnement partagé avec des humains, entrepôts, usines, espaces publics. Concevoir et tester des algorithmes de navigation socialement acceptable exige normalement des essais physiques coûteux, lents et parfois risqués pour les sujets humains. Si la VR reproduit fidèlement les dynamiques d'interaction multimodale, comme le suggèrent ces résultats, elle devient un outil d'itération rapide et sûr pour les équipes qui développent des comportements de navigation robotique, avant tout déploiement réel. C'est aussi une réponse partielle à un scepticisme répandu dans le secteur sur l'écart entre les études HRI menées en environnement contrôlé ou simulé et le comportement humain effectif face à un robot physique. Ce travail s'inscrit dans une lignée de recherches antérieures ayant déjà exploré la VR pour la navigation robotique socialement consciente, mais sans jamais confirmer explicitement que les dynamiques d'interaction multimodale observées en réel s'y retrouvaient. Le protocole within-subjects, chaque participant testant les deux conditions, renforce la robustesse de la comparaison. Les auteurs positionnent leur prototype VR comme une plateforme flexible pour de futures études sur des interactions humain-robot plus riches, ouvrant la voie à des campagnes de test à plus grande échelle sans dépendre systématiquement d'un robot physique et d'une arène de capture de mouvement, deux ressources rares et coûteuses dans les laboratoires de recherche en robotique.

RecherchePaper
1 source
Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée
3arXiv cs.RO 

Priorité aux gestes, voix assistée par LLM : téléopération 'Puppeteer' via un double virtuel en réalité augmentée

Une équipe de chercheurs a publié sur arXiv (2506.13189) une étude comparative portant sur la téléopération de robots via réalité augmentée. Leur système, baptisé "puppeteer", utilise un casque Meta Quest 3 pour permettre à un opérateur de piloter un robot physique en interagissant avec son jumeau virtuel superposé dans l'espace réel. Deux modalités ont été testées en protocole intra-sujet avec 42 participants : geste seul (GO) et combinaison voix assistée par grand modèle de langage (LLM) plus geste (VG), sur une tâche de pick-and-place avec correspondance de motifs. Dans la condition VG, la voix gérait la navigation de haut niveau tandis que le geste assurait la manipulation fine, selon une allocation séquentielle des rôles et non une interaction simultanée. Les résultats montrent que la modalité geste seul offre actuellement un contrôle plus fiable et plus efficace pour les tâches à contrainte temporelle forte. L'ajout de commandes vocales via LLM introduit de la flexibilité mais génère une latence supplémentaire et des erreurs de reconnaissance qui augmentent la charge cognitive de l'opérateur. Ce constat nuance une hypothèse courante dans la communauté HRI (human-robot interaction) : l'accumulation de modalités n'est pas universellement bénéfique. Pour les intégrateurs et décideurs industriels, cela signifie que la multimodalité doit être traitée comme une stratégie adaptative, calibrée au profil de l'utilisateur et à la nature de la tâche. L'étude révèle par ailleurs que l'expertise robotique préalable des participants différencie significativement les performances et l'expérience utilisateur selon les conditions. La téléopération par réalité augmentée s'inscrit dans un effort plus large visant à abaisser la barrière d'entrée au pilotage de robots pour des opérateurs non spécialisés. Des approches concurrentes incluent la téléopération en vue subjective (first-person), les interfaces haptiques et les méthodes d'apprentissage par démonstration directe. La métaphore "puppeteer" se distingue par l'usage d'un double virtuel colocalisé, distinct des flux vidéo classiques. Les auteurs formalisent leurs conclusions en un ensemble de directives de conception pour ce type d'interface, insistant sur la nécessité d'adapter dynamiquement les modalités disponibles au contexte d'usage. Les prochaines étapes naturelles concerneront des tests sur des robots à degrés de liberté (DOF) plus élevés et des environnements industriels réels, au-delà du cadre contrôlé de laboratoire.

RecherchePaper
1 source
Vers la téléopération et manipulation locomotrice miniature humanoïde par réalité virtuelle et apprentissage par renforcement
4arXiv cs.RO 

Vers la téléopération et manipulation locomotrice miniature humanoïde par réalité virtuelle et apprentissage par renforcement

Le stack de téléopération pour humanoïdes complets a connu des progrès rapides ces dernières années, combinant réalité virtuelle pour le contrôle du haut du corps et apprentissage par renforcement pour l'équilibre et la locomotion du bas du corps, permettant à un seul opérateur distant de voir, manipuler et se déplacer dans un environnement physique réel. Un article publié sur arXiv (2607.20399v1) transpose cette approche vers les humanoïdes miniatures, testée sur la plateforme ROBOTIS OP3. Le système développé permet une marche jusqu'à 0,45 m/s, indépendamment des mouvements des bras de l'opérateur. Une expérience de télé-loco-manipulation a été menée avec un opérateur humain expert chargé de relocaliser des cubes de 40 grammes : en moyenne, deux cubes différents ont été déplacés en moins de 10 minutes, pour une distance totale parcourue de 5 mètres. L'enjeu dépasse la simple démonstration technique. Les stacks combinant VR et RL restent aujourd'hui réservés aux robots humanoïdes de taille adulte, coûteux et souvent inaccessibles à la communauté académique. Les humanoïdes miniatures, plus répandus et abordables, embarquent en général moins de capteurs et de degrés de liberté, ce qui limitait jusqu'ici l'application de ces techniques de contrôle avancées. En portant ce contrôle compliant de bout en bout sur du matériel accessible, les chercheurs ouvrent la possibilité d'expérimenter la télé-loco-manipulation sans dépendre de plateformes à plusieurs dizaines de milliers de dollars, ce qui pourrait démocratiser la recherche sur le contrôle whole-body des humanoïdes. Le ROBOTIS OP3 est une plateforme open-source largement utilisée dans les laboratoires de robotique pour prototyper des algorithmes de contrôle, contrairement aux plateformes propriétaires des acteurs commerciaux du secteur humanoïde. L'expérience reste limitée en échelle, un seul opérateur expert et une tâche simple de déplacement de cubes, et les auteurs présentent leurs résultats comme une preuve de potentiel plutôt qu'un système finalisé. Les prochaines étapes attendues concernent l'élargissement des tâches de manipulation testées et une évaluation plus systématique face aux stacks équivalents développés pour les humanoïdes de taille réelle.

RecherchePaper
1 source