GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon
Des chercheurs présentent GAVEL (Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning), décrit dans un preprint arXiv publié en septembre 2026 (arXiv:2609.19315v1). Le système ajoute une couche de vérification aux plans générés par un LLM pour des robots : un graphe modélisant les relations entre objets, les préconditions et effets des actions, et des croyances probabilistes sur la position d'objets non observés, simule chaque action avant exécution et répare directement les violations, sans repasser par le LLM sauf en cas d'erreur sémantique. Sur le benchmark de simulation BEHAVIOR-1K, avec le modèle Qwen3-8B, GAVEL fait passer le taux de réussite de 41,2% à 91,8% sur 100 tâches longues isolées et de 19,9% à 92,6% sur 500 instructions multi-tâches, tout en réduisant d'environ 5,4% la distance de déplacement grâce au raisonnement probabiliste sur la localisation des objets.
Le résultat pointe un écart connu de la robotique embarquée : un LLM seul reste fragile dès qu'il doit exécuter un plan long dans un monde partiellement observable, ce qui nourrit le fossé entre démonstrations et déploiements fiables. En déportant la vérification vers un modèle symbolique explicite plutôt que vers des appels répétés au LLM, GAVEL réduit le coût et la latence du replanning, un enjeu concret pour les intégrateurs qui déploient des agents robotiques à grande échelle. L'approche suggère aussi que la seule montée en échelle des LLM ou des architectures vision-langage-action ne suffira pas à garantir la fiabilité du raisonnement long-horizon, et plaide pour des architectures hybrides combinant raisonnement symbolique vérifiable et modèles généralistes.
GAVEL s'inscrit dans la lignée des travaux utilisant les LLM comme planificateurs de haut niveau, une approche distincte des modèles vision-langage-action bout-en-bout comme Pi-0, GR00T N2 ou Helix, qui apprennent une politique directe sans couche symbolique séparée. Il reprend des principes de planification classique, préconditions et effets à la manière de PDDL, combinés à la flexibilité d'instruction en langage naturel des LLM modernes. Le travail reste, à ce stade, un résultat validé uniquement en simulation sur BEHAVIOR-1K, sans déploiement sur robot physique ni pilote industriel annoncé ; les auteurs indiquent que la méthode fonctionne aussi bien avec des modèles compacts qu'avec des LLM hébergés de pointe, ouvrant la voie à des tests sur des tâches et plateformes plus variées.
Dans nos dossiers




