Aller au contenu principal
Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM
RecherchearXiv cs.RO 

Guide robotique : contrôle multi-agents et génération automatique de scénarios par LLM

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche décrit une nouvelle architecture de contrôle hybride pour robots sociaux, combinant un système de gestion de ressources multi-agents avec une génération automatique de scénarios comportementaux basée sur des grands modèles de langage (LLM). L'objectif est de dépasser les approches traditionnelles, où des scripts manuels synchronisent tant bien que mal les actions du robot et le texte prononcé, et où les méthodes existantes se limitent à des réponses dialoguées courtes. Le système automatise à la fois la préparation des textes et des commandes de comportement non-verbal pour des récits longs, tout en résolvant les conflits de ressources entre les différents mécanismes d'exécution du robot. Il a été testé sur MENTOR-1, un robot guide de visite (tour guide robot), pour lequel il a généré automatiquement des scénarios complets et démontré un comportement jugé plus naturel et plus riche que les approches existantes. L'article, publié sur arXiv (version révisée), ne précise pas de chiffres de déploiement commercial, de prix ni de dates de mise en production sur site.

Pour l'industrie robotique, ce travail illustre une tendance de fond : le passage de scripts comportementaux figés à une orchestration pilotée par LLM capable de générer, en amont, des scénarios longs cohérents entre parole et gestuelle, plutôt que de simplement générer des réponses conversationnelles ponctuelles. La gestion multi-agents des ressources d'exécution répond à un problème concret pour les intégrateurs de robots sociaux : éviter que plusieurs modules (voix, gestes, déplacement, expressions) ne se marchent dessus lors d'une interaction prolongée. Si les résultats sont confirmés à plus grande échelle, cela pourrait réduire le travail manuel de script pour les déploiements de robots d'accueil ou de guidage, un segment où la narration longue reste un point faible des architectures actuelles. Il s'agit toutefois d'une preuve de concept académique sur une plateforme unique, pas d'un produit commercial validé en conditions réelles.

Ce travail s'inscrit dans la lignée des recherches sur les architectures VLA (vision-langage-action) et la génération de comportements par LLM pour la robotique sociale, un domaine où des acteurs comme Figure ou Google DeepMind (avec des modèles comme Pi-0 ou GR00T) explorent des approches similaires pour des tâches de manipulation, tandis que MENTOR-1 se positionne spécifiquement sur l'interaction sociale et la narration guidée. Aucun acteur français ou européen n'est mentionné dans cette publication. Les prochaines étapes évoquées par les auteurs concernent l'extension du système à d'autres scénarios narratifs et plateformes robotiques, sans calendrier ni partenariat industriel annoncé à ce stade.

À lire aussi

Auto-HSI : contrôle humain personnalisé d'un essaim de robots à la demande via génération automatique de code par LLM
1arXiv cs.RO 

Auto-HSI : contrôle humain personnalisé d'un essaim de robots à la demande via génération automatique de code par LLM

Une équipe de recherche présente Auto-HSI, une méthode qui génère à la demande des interfaces personnalisées de contrôle homme-essaim (human-swarm interaction), détaillée dans un article publié sur arXiv sous la référence 2609.16346v1. Le système permet à un opérateur non formé de décrire en langage naturel, combiné à des démonstrations gestuelles, comment il souhaite que des robots se comportent collectivement en réponse à ses gestes. À partir de ces entrées, un grand modèle de langage génère automatiquement, en ligne, le code d'une machine à états personnalisée qui pilote ensuite les robots. Le prototype reconnaît des gestes à une et deux mains pour un contrôle centralisé, permettant de téléopérer le déplacement de l'essaim, la forme de sa formation et sa déformation. Les auteurs évaluent d'abord séparément le suivi gestuel et la génération de code par rapport à des benchmarks de performance, avant de tester le prototype complet en conditions réelles d'opération: des opérateurs humains contrôlent en direct 50 robots simulés dans un simulateur basé sur la physique, en conditions nominales et bruitées, sur trois tâches, marquer un but, traverser un labyrinthe nécessitant une déformation de forme, et marquer deux buts simultanément en scindant l'essaim en deux sous-groupes. Les chercheurs montrent aussi qu'un opérateur peut modifier en direct son interface pendant l'opération en simulation, puis font une démonstration finale sur des robots réels. L'intérêt principal tient à l'automatisation de la couche logicielle qui relie geste et comportement collectif: jusqu'ici, les interfaces homme-essaim reposaient sur des ensembles de gestes et des machines à états codés à l'avance, réservant leur personnalisation à des développeurs. En confiant la génération de code à un LLM piloté par langage naturel et démonstration, Auto-HSI ouvre la personnalisation à des opérateurs non-experts, un enjeu direct pour les intégrateurs de flottes de robots en logistique, en défense ou en recherche, où chaque déploiement exige aujourd'hui un travail d'ingénierie sur mesure. Le passage réussi de la simulation (50 agents) à des robots physiques, même limité, appuie l'idée que la génération de code par LLM peut tenir en conditions bruitées et pas seulement en démonstration contrôlée, un point que le secteur teste encore avec prudence. Le travail s'inscrit dans la lignée des recherches sur le contrôle d'essaims par interfaces naturelles, un domaine jusque-là dominé par des solutions figées ou nécessitant un reprogrammation manuelle à chaque nouveau besoin d'usage. L'article ne mentionne ni partenaire industriel ni calendrier de déploiement commercial: il s'agit d'un travail de recherche académique, publié en préversion, dont les prochaines étapes annoncées portent sur l'extension des tests à des flottes réelles plus larges plutôt que sur une mise sur le marché.

RecherchePaper
1 source
Multi-agent : contrôle robotique par modèles vision-langage embarqués
2arXiv cs.RO 

Multi-agent : contrôle robotique par modèles vision-langage embarqués

Une équipe de recherche présente, dans un article publié sur arXiv (arXiv:2607.07403v1), une architecture multi-agents (MAS) pour le contrôle robotique conçue pour fonctionner entièrement en local, sans dépendre d'une infrastructure de calcul externe. Le système pilote un manipulateur mobile autonome polyvalent dans un entrepôt industriel simulé, où il exécute cinq catégories de tâches : inspection de sécurité, maintenance de l'entrepôt, recherche d'objets, vérification de la qualité des colis, et réponse aux demandes humaines. L'architecture s'appuie sur des modèles vision-langage (VLM) compacts, entre 3 et 20 milliards de paramètres, avec un fine-tuning appliqué spécifiquement pour améliorer la précision de l'inspection des colis. Un agent d'orchestration baptisé "Megamind" a été conçu pour limiter les pertes de contexte que subissent les petits modèles sur des tâches de planification à long horizon. Le système a été validé en configuration hardware-in-the-loop, sur un mini PC AMD Ryzen AI, combinant simulation et matériel embarqué réel. Ce travail s'attaque à trois limites récurrentes des VLM et des modèles vision-langage-action (VLA) appliqués à la robotique : l'explicabilité, la généralisation et les besoins en calcul. En s'appuyant sur des modèles compacts exécutés localement plutôt que sur des VLA massifs hébergés dans le cloud, l'approche promet une réduction des coûts d'infrastructure et une latence moindre, deux critères déterminants pour les intégrateurs industriels qui veulent déployer des robots autonomes sans dépendre d'une connectivité permanente. Les auteurs présentent leurs résultats comme une preuve qu'une architecture multi-agents entièrement embarquée constitue une alternative viable et économique aux déploiements dépendants du cloud, avec un potentiel de transfert vers le réel. Ces résultats restent toutefois obtenus en environnement simulé ; le passage à un robot physique en conditions réelles d'entrepôt demeure l'étape déterminante pour confirmer la promesse. L'essor de VLA comme Pi-0, GR00T N2 ou Helix a mis en évidence la dépendance de nombreux systèmes robotiques à des clusters de calcul distants, un frein pour les déploiements industriels à grande échelle. En misant sur des modèles plus petits orchestrés collectivement plutôt que sur un modèle monolithique unique, cette recherche se distingue des approches dominantes centrées sur des VLA de grande taille. Les chercheurs ont publié l'environnement de simulation en open source sous licence Apache 2.0, ouvrant la voie à des extensions et comparaisons par la communauté robotique. Les prochaines étapes attendues concernent la validation sur robot physique en entrepôt réel ainsi que l'élargissement des catégories de tâches couvertes par le système.

RecherchePaper
1 source
LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents
3arXiv cs.RO 

LTLDiff : génération de données et politiques de diffusion guidées par la LTL finie pour la manipulation multi-agents

LTLDiff, un cadre combinant logique temporelle linéaire finie (LTLf) et politiques de diffusion pour la manipulation robotique multi-agents, a été présenté dans un article déposé sur arXiv (arXiv:2609.11043v1). Pour chaque tâche, une formule LTLf est apprise à partir d'instructions en langage naturel via un grand modèle de langage, puis convertie en arbre syntaxique abstrait afin de produire un vecteur d'embedding de dimension fixe. Cet embedding conditionne à la fois la génération de démonstrations et l'entraînement de la politique de diffusion, dans le but de forcer des trajectoires respectant l'ordre et la coordination attendus entre agents. Les auteurs rapportent des taux de réussite supérieurs à une base de référence sur leurs tâches de test, sans préciser de chiffres exacts, de nombre de robots impliqués, ni s'il s'agit de simulation ou de matériel réel. L'intérêt tient au problème visé : les politiques de diffusion, efficaces pour imiter des démonstrations isolées, se désynchronisent souvent, inversent l'ordre des actions ou échouent à coordonner plusieurs agents dès qu'une tâche exige une interaction simultanée ou séquentielle stricte. En ajoutant une couche de spécification logique et symbolique à l'apprentissage génératif, LTLDiff s'attaque à une faiblesse connue des approches de bout en bout de type VLA, qui peinent à garantir un séquencement fiable. Pour les intégrateurs qui envisagent des cellules multi-bras ou de la manipulation collaborative en logistique, ce travail illustre un retour des méthodes formelles pour combler les lacunes de fiabilité des modèles purement appris, plutôt que de tout miser sur l'échelle des données. LTLDiff s'inscrit dans une recherche académique qui marie logique temporelle et apprentissage de politiques, à distance de la course commerciale des modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, tous fondés sur l'échelle des données plutôt que sur des contraintes symboliques explicites. Contrairement à ces annonces produits, LTLDiff reste une publication scientifique sans partenaire industriel ni déploiement annoncé, et ses résultats se limitent à des comparaisons internes avec une base de référence sur des tâches définies par les auteurs eux-mêmes. Aucun acteur français ou européen n'apparaît dans cette étude. Les suites attendues pour ce type de travaux incluent l'extension à un plus grand nombre d'agents et une validation sur du matériel réel.

RecherchePaper
1 source
MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM
4arXiv cs.RO 

MistyPilot : contrôler un robot social grâce à l'orchestration multi-agents de compétences LLM

Un preprint arXiv publié fin août 2026 (2608.15549v1) présente MistyPilot, un framework multi-agents à base de LLM pour piloter le robot social Misty à partir d'instructions en langage naturel. Un "Task Router" aiguille chaque instruction vers l'un de deux agents spécialisés : un agent d'interaction physique pour le contrôle déclenché par capteurs et l'invocation directe de compétences, et un agent d'interaction sociale pour la gestion d'état conversationnel et la génération de réponses multimodales contextuelles, qui réutilise les résultats déjà générés quand c'est possible plutôt que de relancer systématiquement une génération complète. Le système a été testé sur cinq suites de composants, avec liaisons capteurs-compétences et invocations de skills exécutées sur un robot Misty physique, ainsi que via une étude utilisateur préliminaire auprès de 12 participants, avec une extensibilité vérifiée jusqu'à 100 compétences et une variance inférieure à celle d'un système mono-agent autrement identique. Le code sera publié via la page du projet. Le problème ciblé est concret pour les intégrateurs de robotique sociale : composer manuellement des API en compétences, lier des événements capteurs à ces compétences et gérer l'état des tâches à l'exécution freine le passage de démonstrations scriptées à des interactions robustes et durables. En séparant le contrôle réactif physique de la gestion sociale à état persistant, MistyPilot répond à une limite fréquente des architectures mono-agent, à savoir une variance et une instabilité plus élevées des réponses, et illustre une voie de production fondée sur l'orchestration de compétences existantes plutôt que sur le réentraînement complet d'un modèle vision-langage-action. L'étude reste toutefois un prototype de recherche à petite échelle, sans mesure d'usage prolongé en conditions réelles. Misty, petit robot social de bureau développé par Misty Robotics, dispose d'un écosystème de compétences programmables via API jusqu'ici assemblées manuellement par les développeurs. MistyPilot s'inscrit dans la vague de travaux visant à faire piloter des robots par des LLM ou des modèles vision-langage-action, un champ largement dominé par des approches orientées manipulation physique comme Pi-0, GR00T N2 ou Helix, dont il se distingue en ciblant spécifiquement l'interaction sociale et conversationnelle plutôt que la locomotion ou la préhension. Aucun calendrier de commercialisation ni partenariat industriel n'est annoncé ; seule la publication du code source via la page du projet est confirmée, ce qui permettra une vérification indépendante des résultats revendiqués sur le routage et l'extensibilité à 100 compétences.

RecherchePaper
1 source