Structured LLM Reasoning for Zero-Shot Human-Robot Coordination Under Hidden Goals
Des chercheurs présentent une architecture structurée à base de grands modèles de langage (LLM) pour la coordination homme-robot en zero-shot, c'est-à-dire sans apprentissage préalable spécifique à la tâche, quand chaque partenaire ne dispose que d'une vue privée de l'objectif commun. Formalisée comme un Dec-POMDP (processus de décision markovien partiellement observable et décentralisé), l'architecture décompose la prise de décision en cinq étapes : inférence de théorie de l'esprit conditionnée à l'action, planification hiérarchique, interprétation de la conversation, vérification des actions, et replanification à partir des retours. Testée sur une tâche de construction coopérative où robot et humain ne voient chacun qu'une partie de l'objectif final, la méthode est comparée à deux références : une version sans le module de théorie de l'esprit, et une politique d'apprentissage par renforcement multi-agent entraînée hors ligne sur de nombreuses paires d'objectifs. Lors d'expériences avec des participants humains, la méthode complète a nécessité moins d'étapes d'interaction et obtenu de meilleures notes de confiance post-interaction que les deux références.
Ces résultats intéressent directement la recherche en interaction homme-robot : ils suggèrent qu'un LLM peut servir de substitut praticable à des calculs d'inférence et de planification autrement intraitables, tout en conservant une couche de vérification classique pour garantir la faisabilité physique des actions. Le gain ne vient pas d'un modèle bout-en-bout mais d'une décomposition explicite du problème de décision d'équipe, où le LLM traite seulement les sous-tâches de raisonnement social et de langage. Pour les équipes travaillant sur des robots collaboratifs ou des tâches à information partagée incomplète, cela plaide pour des architectures modulaires plutôt que des politiques entraînées de bout en bout, coûteuses à généraliser à de nouveaux objectifs.
Le travail s'inscrit dans la recherche sur la théorie de l'esprit computationnelle et la coordination multi-agents, un champ où les politiques de renforcement multi-agent peinent traditionnellement à généraliser en zero-shot à des objectifs ou partenaires inédits. En ancrant leur architecture dans le cadre théorique du Dec-POMDP, les auteurs la rattachent à des décennies de recherche en planification sous incertitude partagée. L'article ne mentionne aucun calendrier de déploiement industriel : il s'agit d'une preuve de concept en laboratoire, qui ouvre la voie à des tests sur des tâches physiques plus complexes et des équipes homme-robot élargies.




