Une étude systématique des grands modèles de langage pour la planification tâche-mouvement avec PDDLStream
Une équipe de recherche a mené une étude systématique sur l'usage des grands modèles de langage (LLM) pour la planification tâche-mouvement (TAMP) en robotique, en s'appuyant sur le framework PDDLStream. Les auteurs ont conçu 16 algorithmes différents substituant des composants clés de TAMP par des LLM, puis les ont évalués en zero-shot sur 13750 essais répartis sur trois domaines robotiques distincts. Le code et les résultats complets sont disponibles publiquement sur GitHub (jorge-a-mendez/llm-pddlstream). L'article, référencé arXiv:2510.00182, constitue une version révisée (replace) d'une publication antérieure.
Les résultats tempèrent nettement l'enthousiasme autour des LLM comme solution universelle de planification robotique. Les planificateurs basés sur des LLM affichent des taux de réussite inférieurs et des temps de calcul supérieurs comparés aux systèmes d'ingénierie classiques, spécialisés pour la tâche. Autre constat contre-intuitif: fournir des détails géométriques supplémentaires aux LLM augmente le nombre d'erreurs de planification par rapport à des descriptions PDDL pures, suggérant que l'ajout de contexte ne se traduit pas automatiquement par de meilleures décisions. Les variantes LLM "directes", plus rapides, surpassent dans la majorité des cas les variantes à raisonnement explicite, plus lentes, ce qui interroge la valeur ajoutée du chain-of-thought pour ce type de tâche. Pour les intégrateurs et chercheurs en robotique, ce travail rappelle que malgré les progrès des LLM sur le raisonnement sémantique, le couplage avec la planification formelle et géométrique reste un défi ouvert, loin d'être résolu par la simple taille des modèles.
TAMP combine depuis des années la planification symbolique de tâches et la planification continue de mouvements, un problème historiquement traité par des solveurs spécialisés comme PDDLStream. L'essor des LLM a multiplié les propositions visant à exploiter leurs connaissances sémantiques pour remplacer certains de ces composants formels, souvent via des démonstrations isolées et peu comparables entre elles. Cette étude se distingue en proposant une évaluation empirique large et contrôlée plutôt qu'un nouveau système ponctuel, offrant une base de comparaison utile pour orienter les futurs travaux hybrides associant raisonnement neuronal et garanties formelles.
Dans nos dossiers




