Aller au contenu principal
RecherchearXiv cs.RO 

MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un preprint arXiv publié fin août 2026 (2608.15549v1) présente MistyPilot, un framework multi-agents à base de LLM pour piloter le robot social Misty à partir d'instructions en langage naturel. Un "Task Router" aiguille chaque instruction vers l'un de deux agents spécialisés : un agent d'interaction physique pour le contrôle déclenché par capteurs et l'invocation directe de compétences, et un agent d'interaction sociale pour la gestion d'état conversationnel et la génération de réponses multimodales contextuelles, qui réutilise les résultats déjà générés quand c'est possible plutôt que de relancer systématiquement une génération complète. Le système a été testé sur cinq suites de composants, avec liaisons capteurs-compétences et invocations de skills exécutées sur un robot Misty physique, ainsi que via une étude utilisateur préliminaire auprès de 12 participants, avec une extensibilité vérifiée jusqu'à 100 compétences et une variance inférieure à celle d'un système mono-agent autrement identique. Le code sera publié via la page du projet.

Le problème ciblé est concret pour les intégrateurs de robotique sociale : composer manuellement des API en compétences, lier des événements capteurs à ces compétences et gérer l'état des tâches à l'exécution freine le passage de démonstrations scriptées à des interactions robustes et durables. En séparant le contrôle réactif physique de la gestion sociale à état persistant, MistyPilot répond à une limite fréquente des architectures mono-agent, à savoir une variance et une instabilité plus élevées des réponses, et illustre une voie de production fondée sur l'orchestration de compétences existantes plutôt que sur le réentraînement complet d'un modèle vision-langage-action. L'étude reste toutefois un prototype de recherche à petite échelle, sans mesure d'usage prolongé en conditions réelles.

Misty, petit robot social de bureau développé par Misty Robotics, dispose d'un écosystème de compétences programmables via API jusqu'ici assemblées manuellement par les développeurs. MistyPilot s'inscrit dans la vague de travaux visant à faire piloter des robots par des LLM ou des modèles vision-langage-action, un champ largement dominé par des approches orientées manipulation physique comme Pi-0, GR00T N2 ou Helix, dont il se distingue en ciblant spécifiquement l'interaction sociale et conversationnelle plutôt que la locomotion ou la préhension. Aucun calendrier de commercialisation ni partenariat industriel n'est annoncé ; seule la publication du code source via la page du projet est confirmée, ce qui permettra une vérification indépendante des résultats revendiqués sur le routage et l'extensibilité à 100 compétences.

À lire aussi

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes
1arXiv cs.RO 

MuGen : un contrôleur de locomotion multi-compétences pour robots humanoïdes

Des chercheurs ont publié le 26 mai 2026 sur arXiv un article présentant MuGen (Multi-Skill Generative Locomotion Controller), un framework d'apprentissage automatique visant à doter les robots humanoïdes d'une locomotion polyvalente et expressive. Le système repose sur des auto-encodeurs à quantification vectorielle (VQ-VAEs) entraînés par apprentissage par renforcement basé sur des modèles, combinés à un pipeline dit "enseignant-élève" avec distillation de politique. Le principe consiste à condenser des heures de données hétérogènes de mouvements humains en une représentation latente compacte, depuis laquelle un robot peut imiter des séquences de mouvement jamais vues à l'entraînement. À noter : l'article ne précise ni plateforme matérielle spécifique, ni métriques quantitatives concrètes (vitesse, payload, temps de cycle), ce qui est habituel pour un preprint de recherche fondamentale à ce stade. Ce qui distingue MuGen des approches classiques de locomotion humanoïde est le choix d'une représentation générative via VQ-VAE, plutôt qu'une politique spécialisée par comportement. Cette architecture permet la réutilisation de l'espace latent appris pour des tâches en aval, ouvrant la voie à un transfert de compétences sans réentraînement complet. La distillation enseignant-élève est un point structurant : la politique enseignante, puissante mais coûteuse en calcul, sert à former une politique élève légère et déployable sur matériel embarqué. Pour les intégrateurs et décideurs industriels, ce paradigme réduit le fossé sim-to-real et laisse entrevoir des robots capables d'adopter de nouveaux comportements locomoteurs à partir d'une simple séquence de référence humaine, sans fine-tuning massif. MuGen s'inscrit dans un courant de recherche actif sur l'imitation motrice pour humanoïdes, dans la lignée de travaux comme AMP (Adversarial Motion Priors, UC Berkeley), ASE ou PhysDiff. Dans l'industrie, Figure AI, Agility Robotics (Digit), Unitree et Tesla (Optimus) investissent massivement dans des pipelines similaires de whole-body control combinant motion capture et RL. L'usage de VQ-VAEs reste relativement peu exploré pour la locomotion, contrairement à son application établie en génération audio et image. Le papier étant un preprint arXiv sans révision par les pairs à ce stade, la prochaine étape déterminante sera une validation sur plateforme physique réelle avec métriques comparatives, condition sine qua non pour évaluer la portée opérationnelle de l'approche.

RecherchePaper
1 source
Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM
2arXiv cs.RO 

Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM

Un article de recherche décrit une nouvelle architecture de contrôle hybride pour robots sociaux, combinant un système de gestion de ressources multi-agents avec une génération automatique de scénarios comportementaux basée sur des grands modèles de langage (LLM). L'objectif est de dépasser les approches traditionnelles, où des scripts manuels synchronisent tant bien que mal les actions du robot et le texte prononcé, et où les méthodes existantes se limitent à des réponses dialoguées courtes. Le système automatise à la fois la préparation des textes et des commandes de comportement non-verbal pour des récits longs, tout en résolvant les conflits de ressources entre les différents mécanismes d'exécution du robot. Il a été testé sur MENTOR-1, un robot guide de visite (tour guide robot), pour lequel il a généré automatiquement des scénarios complets et démontré un comportement jugé plus naturel et plus riche que les approches existantes. L'article, publié sur arXiv (version révisée), ne précise pas de chiffres de déploiement commercial, de prix ni de dates de mise en production sur site. Pour l'industrie robotique, ce travail illustre une tendance de fond : le passage de scripts comportementaux figés à une orchestration pilotée par LLM capable de générer, en amont, des scénarios longs cohérents entre parole et gestuelle, plutôt que de simplement générer des réponses conversationnelles ponctuelles. La gestion multi-agents des ressources d'exécution répond à un problème concret pour les intégrateurs de robots sociaux : éviter que plusieurs modules (voix, gestes, déplacement, expressions) ne se marchent dessus lors d'une interaction prolongée. Si les résultats sont confirmés à plus grande échelle, cela pourrait réduire le travail manuel de script pour les déploiements de robots d'accueil ou de guidage, un segment où la narration longue reste un point faible des architectures actuelles. Il s'agit toutefois d'une preuve de concept académique sur une plateforme unique, pas d'un produit commercial validé en conditions réelles. Ce travail s'inscrit dans la lignée des recherches sur les architectures VLA (vision-langage-action) et la génération de comportements par LLM pour la robotique sociale, un domaine où des acteurs comme Figure ou Google DeepMind (avec des modèles comme Pi-0 ou GR00T) explorent des approches similaires pour des tâches de manipulation, tandis que MENTOR-1 se positionne spécifiquement sur l'interaction sociale et la narration guidée. Aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes évoquées par les auteurs concernent l'extension du système à d'autres scénarios narratifs et plateformes robotiques, sans calendrier ni partenariat industriel annoncé à ce stade.

RecherchePaper
1 source
Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique
3arXiv cs.RO 

Modèle de fondation à base d'agents : combler la lacune d'orchestration des robots généralistes grâce à l'agentivité physique

Un article de recherche publié sur arXiv (2607.21725v1) présente Pigey, un orchestrateur d'agence physique conçu pour piloter des robots généralistes sans données supplémentaires ni post-entraînement. Plutôt que d'entasser perception, planification, détection de succès, récupération d'erreurs et contrôle bas niveau dans une seule politique apprise par pré-entraînement massif, comme le font les modèles vision-langage-action (VLA) actuels, les auteurs séparent le problème en deux couches : un agent de contrôle langage-conditionné classique, et un gestionnaire de haut niveau qui décompose les objectifs en sous-tâches, envoie des commandes moteur, vérifie les résultats à partir des observations bas niveau et déclenche des routines de récupération en cas d'échec. Pigey peut commander aussi bien des politiques VLA existantes que des compétences paramétrées préexistantes. Sur le benchmark de simulation LIBERO-PRO, le taux de réussite passe de 12,8% à 53,3%, soit plus du quadruple, sans aucun réglage spécifique à la tâche. Sur un robot réel, les tâches nécessitant du raisonnement voient leur taux de succès grimper de quasi zéro à plus de 90% une fois la politique figée intégrée dans la boucle agentique de Pigey. Ce résultat vient alimenter un débat déjà vif dans la robotique humanoïde et manipulatrice : les modèles VLA de bout en bout, aussi impressionnants soient-ils en démonstration, échouent souvent dès que la tâche exige un raisonnement séquentiel ou une récupération après erreur, un écart que les auteurs baptisent "orchestration gap". En montrant qu'une simple couche d'orchestration explicite, sans ré-entraînement, suffit à multiplier par quatre les performances, l'étude suggère que l'échelle des données de pré-entraînement n'est pas le seul levier disponible pour combler ce fossé entre démonstration et fiabilité réelle, un enjeu direct pour les intégrateurs qui doivent déployer ces systèmes en environnement industriel non contrôlé. Cette approche s'inscrit dans une tendance plus large de la recherche en robotique généraliste, où des laboratoires développent des modèles comme Pi-0, GR00T N2 ou Helix pour unifier perception et action. Pigey se positionne comme une alternative complémentaire plutôt qu'un concurrent direct : il ne remplace pas ces politiques mais les pilote depuis l'extérieur, ce qui laisse ouverte la question de son adoption par les fournisseurs de VLA propriétaires et de son passage à l'échelle sur des tâches de manipulation encore plus complexes.

RecherchePaper
1 source
Agent à base d'affordances : orchestration de compétences avec vérification intégrée
4arXiv cs.RO 

Agent à base d'affordances : orchestration de compétences avec vérification intégrée

Un préprint publié sur arXiv le 1er mai 2026 (identifiant 2605.00663) présente l'Affordance Agent Harness, un système d'orchestration de modules d'IA conçu pour résoudre l'un des problèmes les plus coriaces de la robotique de manipulation : l'affordance grounding, c'est-à-dire la capacité d'un agent à identifier précisément où et comment interagir avec un objet dans une scène réelle. Le défi est que les zones d'action pertinentes sont souvent petites, partiellement occultées, réfléchissantes ou visuellement ambiguës. L'architecture proposée est un système en boucle fermée qui chaîne plusieurs modules spécialisés, détection, segmentation, imagination d'interaction, via un composant baptisé Router, capable de sélectionner et de paramétrer dynamiquement les modules selon la difficulté de chaque instance. Un module Verifier évalue ensuite la fiabilité des preuves accumulées à partir de trois critères : cohérence interne du système, stabilité multi-échelle, et suffisance des évidences. Si ces seuils ne sont pas atteints, des tentatives ciblées sont relancées avant qu'un module final fusionne l'ensemble pour produire la prédiction. Les expériences sur plusieurs benchmarks d'affordance montrent une meilleure frontière de Pareto précision-coût que les pipelines fixes, avec moins d'appels de modules et une latence réduite, bien que l'article ne fournisse pas de chiffres absolus dans le résumé. L'intérêt de cette approche tient à son principe de vérification avant engagement : là où les pipelines fixes traitent toutes les images de la même façon et accumulent les erreurs en cascade, l'Affordance Agent Harness décide en temps réel si les preuves collectées sont suffisantes pour se commettre. C'est une réponse directe au problème dit du "demo-to-reality gap" en robotique : les systèmes qui fonctionnent bien en conditions contrôlées échouent face à l'ambiguïté réelle. La mémoire épisodique intégrée permet en outre de capitaliser sur les objets récurrents, ce qui est pertinent dans des environnements industriels répétitifs. Pour un intégrateur ou un COO industriel, cela signifie moins d'interventions humaines pour les cas limites et un coût d'inférence maîtrisé, deux contraintes centrales pour le passage à l'échelle. Ce travail s'inscrit dans une tendance forte depuis 2024 : combiner des modèles fondationnels de vision (VLMs, SAM-type pour la segmentation) dans des architectures d'agents modulaires pour la perception robotique. Des systèmes concurrents comme RoboPoint, SpatialVLM ou les approches VLA (Vision-Language-Action) de Physical Intelligence (Pi-0) cherchent également à résoudre l'ancrage spatial pour la manipulation. La différence revendiquée ici est le contrôle explicite du coût d'inférence et la capacité de récupération ciblée en cas d'erreur intermédiaire, plutôt qu'un modèle bout-en-bout. Aucun partenaire industriel ni calendrier de déploiement n'est mentionné dans ce préprint, il s'agit à ce stade d'une contribution de recherche, avec une page projet publique. Les prochaines étapes naturelles seraient une validation sur des robots physiques en conditions non structurées, ce que l'article ne documente pas encore.

RecherchePaper
1 source