GhostShell : appels de fonctions LLM en streaming pour la programmation incarnée concurrente
Un groupe de chercheurs a présenté GhostShell, une architecture logicielle permettant à des grands modèles de langage (LLM) de piloter des robots en continu, en déclenchant des fonctions directement pendant la génération du texte plutôt qu'en attendant un plan complet avant d'agir. Le système repose sur des « function tokens », une représentation au format XML des appels de fonction que GhostShell extrait du flux de génération du LLM et convertit en commandes exécutables, orchestrées par un algorithme de planification multi-canal combinant synchronisation intra-canal et dispatch asynchrone inter-canal pour coordonner plusieurs composants robotiques en parallèle. L'équipe a testé l'approche sur son prototype robotique CoCo, à travers 33 tâches réelles et neuf fournisseurs de LLM différents. Sur 30 tâches d'interaction homme-robot, le score DSBC (Directed Structured Behavior Correctness) le plus élevé, 0,83, a été obtenu avec Claude Sonnet 4, tandis que sur trois tâches multimodales longues, GPT-4.1 a atteint 7,0/10 en évaluation humaine. Face au function calling natif proposé par les fournisseurs de LLM, le schéma de function tokens de GhostShell affiche un taux de complétion de 15 tâches sur 15, contre 6 sur 15 pour l'approche standard.
Ce résultat cible un point de friction concret pour l'IA embarquée en robotique : les mécanismes natifs d'appel de fonction des LLM, conçus pour des usages conversationnels ou logiciels, gèrent mal la coordination d'actions physiques et langagières simultanées, un besoin central pour tout robot devant parler et agir en même temps. En démontrant un gain net de complétion de tâches sur des scénarios concurrents plutôt que séquentiels, les auteurs apportent un argument technique en faveur d'architectures de contrôle repensées spécifiquement pour l'embodied AI, plutôt que d'un simple réemploi des API de function calling issues du monde du logiciel.
Il s'agit d'un article de recherche académique, publié sur arXiv (identifiant 2508.05298, troisième version), et non d'un produit commercialisé ou d'un déploiement industriel : les résultats reposent sur un unique prototype maison, CoCo, et 33 tâches définies par les auteurs eux-mêmes, ce qui appelle à la prudence avant toute généralisation. Le code, les vidéos et le matériel supplémentaire sont mis à disposition sur le site dédié du projet, coco-robot.github.io/GhostShell, ce qui permettra à la communauté robotique d'évaluer indépendamment la reproductibilité de ces résultats face aux nombreuses autres approches de contrôle vocal-langage-action (VLA) en développement.
Dans nos dossiers




