Aller au contenu principal
RecherchearXiv cs.RO 

Assistant IA conversationnelle basée sur un LLM pour le robot humanoïde MyBuddy

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente, dans un preprint publié en septembre 2026 sur arXiv sous la référence 2609.24742, un assistant conversationnel basé sur des grands modèles de langage (LLM) intégré au robot humanoïde MyBuddy, une plateforme compacte à deux bras et 13 axes, pilotée par un Raspberry Pi et commercialisée par le fabricant chinois Elephant Robotics, connu pour ses bras robotiques éducatifs. Le système associe reconnaissance vocale en temps réel, compréhension du langage naturel et raisonnement via LLM, récupération de connaissances en ligne auprès de sources ouvertes comme Wikipedia et arXiv, gestion flexible du dialogue multi-tours et synthèse vocale naturelle. L'objectif affiché est de remplacer les dialogues à base de règles et de réponses prédéfinies, jusque là dominants sur ce type de plateforme, par des échanges continus et un accompagnement à caractère émotionnel dans l'interaction humain-robot.

Ce travail illustre une tendance de fond dans la robotique humanoïde : l'usage des LLM ne se limite plus au contrôle moteur ou à la planification de tâches, comme dans les architectures vision-langage-action de type Pi-0 ou GR00T N2, il gagne aussi la couche conversationnelle et sociale des robots destinés à l'assistance aux personnes. Pour les intégrateurs et concepteurs de robots de service, la démonstration suggère qu'il est possible de dépasser les bases de connaissances fermées en connectant un robot à des moteurs de recherche externes pour répondre à des questions arbitraires, un enjeu clé pour l'accueil, l'éducation ou l'accompagnement de personnes âgées. Le travail reste toutefois un prototype de recherche en preprint, sans évaluation par les pairs ni benchmarks chiffrés sur la latence, le taux d'erreur de reconnaissance vocale ou la satisfaction des utilisateurs, ce qui invite à la prudence avant toute extrapolation vers un usage en production.

MyBuddy est une plateforme robotique peu coûteuse, déjà utilisée dans plusieurs laboratoires universitaires pour la recherche en interaction humain-robot, ce qui en fait un support de prototypage logiciel courant plutôt qu'un produit commercial à grande échelle comparable à l'Optimus Gen 3 de Tesla ou au G1 d'Unitree. Le champ de l'assistance conversationnelle embarquée compte déjà plusieurs approches concurrentes, des architectures orientées action physique comme Helix de Figure jusqu'à des chatbots embarqués plus simples sur robots grand public. Les auteurs ne mentionnent ni calendrier de déploiement pilote ni partenariat industriel ; la suite logique de ce type de travail académique passe généralement par une évaluation utilisateur plus poussée et une soumission à une conférence spécialisée en interaction humain-robot.

À lire aussi

Assistance sans interruption : un benchmark et un cadre basé sur les LLM pour l'aide humain-robot non intrusive
1arXiv cs.RO 

Assistance sans interruption : un benchmark et un cadre basé sur les LLM pour l'aide humain-robot non intrusive

Une équipe de chercheurs a publié en mai 2026 sur arXiv (arXiv:2605.01368) un cadre formel et un benchmark dédié à l'assistance robotique non intrusive, qu'ils nomment NIABench. Le problème étudié est précis : comment un robot peut-il soutenir un humain en train d'exécuter une séquence d'actions complexes, sans jamais l'interrompre ni attendre une commande explicite ? Les chercheurs proposent également une architecture hybride combinant un grand modèle de langage (LLM) et un modèle de scoring à deux étages : une première couche de récupération sémantique réduit l'espace des actions candidates, puis un module de ranking évalue les paires (étape humaine, action robot) pour arbitrer sur le moment et la nature de l'intervention. Les expériences sont conduites sur NIABench et validées sur des scénarios réels, avec des métriques inédites adaptées à ce paradigme. Ce travail est significatif parce qu'il déplace le curseur de la robotique collaborative vers un mode opératoire radicalement différent : le plan humain devient le processus principal, et le robot se positionne en assistant discret plutôt qu'en agent concurrent. Pour les intégrateurs de robots de service ou de cobots industriels, cela ouvre une voie concrète vers des déploiements où le robot n'exige ni formation de l'opérateur, ni protocole de communication explicite. La formalisation du problème joint, décider simultanément du quand et du quoi, est également un apport méthodologique, car la littérature HRI traitait jusqu'ici ces deux dimensions séparément. La présence d'un benchmark public avec métriques standardisées facilite la comparaison future entre approches. Ce travail s'inscrit dans un courant de recherche HRI qui cherche à dépasser les modèles maître-esclave ou les systèmes à déclenchement explicite. Des approches concurrentes, notamment dans les travaux sur les VLA (Vision-Language-Action models) de DeepMind ou Stanford, adressent la réactivité contextuelle mais sans formaliser explicitement la contrainte de non-intrusion. NIABench pourrait devenir un point de référence pour évaluer ces modèles sur cette dimension précise. Les prochaines étapes naturelles incluent le transfert vers des plateformes embarquées et des tests en environnements industriels réels, bien qu'aucun partenariat ou calendrier de déploiement ne soit mentionné dans cette publication.

RecherchePaper
1 source
Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation
2Interesting Engineering 

Le nouveau système de Galbot aide les robots humanoïdes à bouger naturellement pendant une conversation

Galbot, entreprise chinoise de robotique, a dévoilé RoboGesture, un framework destiné à générer en temps réel des gestes synchronisés avec la parole pour les robots humanoïdes. Développé avec des chercheurs de l'université Tsinghua, de l'université de Pékin, du Beijing Institute of Technology, du Harbin Institute of Technology et du Shanghai Qi Zhi Institute, le système sera présenté à l'European Conference on Computer Vision (ECCV) 2026. Annoncé le 5 septembre 2026 sur le compte X de Galbot, RoboGesture ferme la boucle écoute-réponse-geste en environ deux secondes. Le système convertit la parole entrante en tokens audio via le codec Mimi, puis analyse le signal à plusieurs niveaux : les caractéristiques de bas niveau captent le rythme et les variations de ton, tandis que les couches plus profondes extraient le sens sémantique. La composante sémantique a été entraînée sur 300 catégories de gestes. Les signaux sont ensuite transmis à un modèle de génération de mouvement fondé sur un transformer à diffusion, qui produit des trajectoires dans un espace de mouvement continu plutôt que des commandes fixes, permettant un enchaînement fluide des gestes. Cette annonce vise une limite récurrente des robots humanoïdes commerciaux : des mouvements souvent perçus comme mécaniques, répétitifs ou déconnectés du discours, un défaut qui nuit à l'acceptation des robots dans des rôles d'accueil, de guide ou d'assistance sociale. Les chercheurs affirment s'attaquer à trois obstacles concrets : le manque de données d'entraînement, la difficulté à relier la parole au mouvement approprié, et les risques de sécurité lorsque des gestes générés par IA sont transférés à un robot physique. Ils identifient également un problème baptisé « éclipse de modalité », où le modèle se met à répéter des gestes issus de ses mouvements précédents au lieu de réagir à la nouvelle parole ; une méthode de guidage nommée Anti-Inertia classifier-free guidance masking est présentée comme correctif. Ces travaux restent toutefois au stade de la recherche académique : la démonstration diffusée sur X ne constitue pas une validation indépendante, et aucun chiffre de déploiement, de coût ou de robustesse en conditions réelles n'est fourni, ce qui invite à la prudence sur la portée réelle du système hors laboratoire. Galbot s'inscrit dans la vague des start-up chinoises de robotique généraliste qui, comme leurs homologues américaines telles que Figure avec son modèle Figure 03, Tesla avec Optimus, ou les initiatives fondées sur des modèles VLA comme Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia, cherchent à doter les humanoïdes de capacités de manipulation et de perception avancées. RoboGesture se distingue en ciblant spécifiquement la communication non verbale plutôt que la manipulation ou la locomotion, un axe encore peu exploré par une concurrence surtout focalisée sur les tâches industrielles ou logistiques. La présentation prévue à l'ECCV 2026, conférence académique de référence en vision par ordinateur, signale une publication scientifique plutôt qu'un lancement commercial : l'article ne mentionne ni pilote annoncé, ni calendrier de déploiement, ni partenaire industriel identifié à ce stade.

RecherchePaper
1 source
Un cadre conversationnel pour la manipulation collaborative humain-robot avec des modèles d'IA générative distribués
3arXiv cs.RO 

Un cadre conversationnel pour la manipulation collaborative humain-robot avec des modèles d'IA générative distribués

Des chercheurs de l'Université de Tampere (Finlande) publient sur arXiv (2606.06061) un framework distribué permettant à un opérateur humain de piloter un robot manipulateur par commandes vocales ou textuelles en langage naturel. L'architecture repose sur ROS 2, avec quatre nœuds indépendants : compréhension linguistique (LLM local), ancrage visuel (VLM), orchestration, et exécution moteur. À partir d'une instruction libre, le système génère des requêtes structurées pour des tâches de saisie, dépose et transfert d'objet. Le VLM retourne des cibles en espace-image, ensuite converties en objectifs métriques dans le référentiel robot grâce à la profondeur et à la calibration. Les expériences sont menées sur un bras Franka FR3 ; les auteurs mesurent la fiabilité bout-en-bout et la latence en faisant varier le degré d'ambiguïté de la scène sur la table de travail, et comparent plusieurs configurations LLM/VLM dans le même pipeline. Un tableau de bord web affiche les intentions intermédiaires et les superpositions d'ancrage visuel (pixel, profondeur, référentiel robot), et exige une confirmation explicite de l'opérateur avant tout mouvement. L'intérêt principal de cette approche pour un intégrateur ou un COO industriel tient à trois points. Premièrement, le choix de modèles locaux, pas de dépendance cloud, répond directement aux contraintes de latence et de confidentialité en environnement de production. Deuxièmement, la modularité ROS 2 permet de substituer un modèle par un autre sans refondre la stack, ce qui facilite le benchmarking et la mise à jour. Troisièmement, la boucle de confirmation opérateur est un signal clair que les auteurs ne cherchent pas à masquer le gap demo-versus-réalité : le système ne prétend pas être autonome, il vise une collaboration vérifiable. À noter que les métriques de fiabilité ne sont pas chiffrées dans l'abstract, les résultats quantitatifs précis restent à vérifier dans le corps du papier. Ce travail s'inscrit dans un courant de recherche actif autour des VLA (vision-language-action) pour la manipulation, où Physical Intelligence (Pi-0), Google DeepMind (RT-2, π0) et Stanford (Mobile ALOHA) occupent le devant de la scène avec des approches end-to-end à grande échelle. Le choix de Tampere d'utiliser des modèles légers et locaux contraste délibérément avec ces acteurs : c'est un positionnement orienté déploiement industriel frugal plutôt que performance brute. Le code est disponible en open source sur GitHub (cogrob-tuni/franka-llm), ce qui facilite la reproductibilité. La prochaine étape logique serait d'étendre le framework à des scènes dynamiques ou multi-robots, et de publier des benchmarks comparatifs sur des tâches standardisées comme celles de RoboAgent ou BridgeData.

UETravaux issus de l'Université de Tampere (Finlande, UE) proposant une architecture LLM/VLM entièrement locale et open source pour la manipulation collaborative, directement alignée sur les contraintes RGPD et de souveraineté industrielle du marché européen.

RechercheOpinion
1 source
Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle
4arXiv cs.RO 

Robot réceptionniste à tête humanoïde articulée pour interaction humaine naturelle

Une équipe de recherche présente dans une publication arXiv (juillet 2026) une tête humanoïde articulée conçue spécifiquement pour un rôle de robot réceptionniste. Le système compte 21 degrés de liberté (DoF), répartis entre des mécanismes dédiés à la bouche, aux yeux, aux sourcils et au cou, le tout recouvert d'une peau en silicone réaliste destinée à reproduire une apparence et des expressions humaines crédibles. Côté logiciel, l'architecture combine plusieurs modèles spécialisés : SCRFD, ArcFace et ByteTrack pour la reconnaissance et le suivi des visages, associés à Llama pour le traitement du langage naturel et à Whisper pour la reconnaissance vocale. L'ensemble fonctionne en temps réel et intègre une fonction de ré-identification permettant au robot de reconnaître une personne déjà rencontrée. Une étude utilisateur a mesuré quantitativement les capacités conversationnelles et de ré-identification du système, tandis que son expressivité émotionnelle et sa ressemblance humaine ont été évaluées séparément, obtenant un score moyen de similarité humaine de 4,13 sur 5. Ce travail illustre une tendance de fond dans la robotique sociale : la course ne se joue plus seulement sur la mobilité ou la manipulation, comme chez les humanoïdes industriels type Figure 03 ou Optimus, mais aussi sur l'interaction faciale fine, jugée déterminante pour l'acceptabilité dans des rôles d'accueil, d'éducation ou de service. Un score de 4,13/5 en similarité humaine, obtenu via une étude utilisateur et non une simple démonstration vidéo, constitue une donnée relativement solide face à l'inflation habituelle de communiqués promettant un réalisme "sans précédent". Pour les intégrateurs et décideurs B2B envisageant des déploiements en accueil ou en relation client, ce type de plateforme à 21 DoF avec pile logicielle ouverte (Llama, Whisper) montre qu'une expressivité crédible reste accessible sans recourir à des architectures propriétaires fermées. Le développement de têtes robotiques expressives répond à des limites connues du secteur : coûts élevés, complexité mécanique et faible adaptabilité des solutions existantes à des environnements variés. Contrairement aux humanoïdes généralistes de grande taille conçus pour la logistique ou l'industrie, cette approche cible spécifiquement l'interaction sociale localisée, un segment où des acteurs comme Enchanted Tools ou Pollen Robotics explorent également des pistes d'expressivité et d'accueil, sans toutefois atteindre le même niveau de granularité faciale. Les auteurs ne précisent pas encore de calendrier de commercialisation ni de site pilote concret, l'étude restant à ce stade au niveau de la validation en laboratoire.

RecherchePaper
1 source