
Adaptation à la nouveauté par planification hybride LLM-symbolique et apprentissage par renforcement guidé par LLM
Une équipe de recherche propose une architecture neuro-symbolique combinant planification symbolique, apprentissage par renforcement (RL) et un grand modèle de langage (LLM) pour permettre à des robots de s'adapter à des objets nouveaux rencontrés dans des environnements ouverts et dynamiques. Le travail, publié sur arXiv sous la référence 2603.11351 (version 2, remplaçant une publication antérieure), part d'un constat technique précis : les planificateurs symboliques classiques échouent purement et simplement lorsque leur domaine de planification ne contient pas les opérateurs nécessaires pour interagir avec un objet imprévu, bloquant toute génération de plan. La méthode proposée fait porter au LLM le raisonnement de sens commun pour identifier les opérateurs manquants, s'appuie sur un planificateur IA symbolique classique pour construire les plans, puis fait rédiger par le LLM des fonctions de récompense qui guident un agent RL dans l'apprentissage des politiques de contrôle associées aux nouveaux opérateurs. Selon les auteurs, la méthode dépasse l'état de l'art à la fois pour la découverte d'opérateurs manquants et pour leur apprentissage effectif, dans des domaines robotiques à espace d'action continu. Code et démonstrations sont publiés sur helenlu66.github.io/hybridLLMguided.
L'enjeu dépasse l'exercice académique : la plupart des robots déployés en environnement contrôlé (usine, entrepôt) n'ont jamais à gérer d'objets réellement inédits, mais toute extension vers des environnements ouverts (domicile, extérieur, terrain non structuré) expose la fragilité des planificateurs symboliques figés. Cette approche hybride s'oppose à la tendance dominante des modèles vision-langage-action génériques (à la Pi-0, GR00T N2 ou Helix) qui misent sur une généralisation de bout en bout sans structure symbolique explicite ; elle défend au contraire l'idée qu'associer raisonnement de sens commun du LLM et planification symbolique reste plus robuste et plus interprétable pour traiter des cas rares et imprévus.
Il s'agit toutefois d'une contribution de recherche évaluée par ses propres auteurs, sans validation indépendante ni déploiement industriel annoncé à ce stade, et s'inscrit dans un courant actif de travaux neuro-symboliques cherchant à combiner LLM et planification classique plutôt qu'à les opposer.
Dans nos dossiers




