OntoPlan : une représentation de scène fondée sur une ontologie et un cadre à base d'agents pour la planification de tâches robotiques à grande échelle
Des chercheurs publient OntoPlan, un cadre de planification de tâches robotiques fondé sur une représentation ontologique de la scène, accompagné d'un code ouvert sur GitHub (dépôt namhyeongwoo/OntoPlan). Le système cible un défaut connu de la planification par grands modèles de langage (LLM) : sur les tâches à long horizon dans de vastes environnements, la performance se dégrade. Quand la géométrie de la scène est transmise sous forme de texte, le modèle saisit mal le contexte spatial, et le coût en tokens croît avec la taille de l'environnement. OntoPlan aligne objets, espaces, relations et états dans un vocabulaire symbolique commun. Un cadre agentique interprète l'instruction, récupère de façon sélective les informations utiles, formalise buts et contraintes, puis produit un plan exécutable. Sur 150 tâches générales réparties dans cinq environnements intérieurs et trois échelles de scène, il atteint un taux de réussite moyen de 0,89, contre 0,27 pour la meilleure méthode de référence. Il consomme en moyenne 18,1 k tokens par tâche, soit environ 5,6 fois moins que la référence la plus économe.
L'enjeu est double pour les intégrateurs et les équipes qui déploient des robots pilotés par LLM. D'abord, l'écart de 0,89 contre 0,27 suggère que le goulot d'étranglement tient moins à la capacité de raisonnement du modèle qu'à la manière de lui présenter le monde : un LLM qui génère directement des séquences d'actions peine à respecter l'état courant et les préconditions, alors qu'une formalisation symbolique les rend vérifiables. Ensuite, le coût en tokens, rarement discuté dans les démonstrations, détermine la viabilité économique et la latence en exploitation. Les auteurs indiquent que l'avantage persiste quand l'échelle de la scène augmente, alors que les méthodes concurrentes perdent davantage en réussite et restent beaucoup plus coûteuses. Le système demande aussi des précisions face à une instruction ambiguë, ou signale un manque d'information face à une instruction infaisable, au lieu de s'engager dans un plan invalide. C'est un comportement de sécurité utile pour tout déploiement industriel.
Plusieurs réserves s'imposent. Il s'agit d'un préprint arXiv (v1), non évalué par les pairs. Les résultats viennent d'un banc d'essai de 150 tâches, sans précision dans le résumé sur la nature des environnements (simulés ou réels) ni sur les méthodes de référence. Les chiffres ne disent donc rien de la robustesse en conditions réelles, où perception bruitée et échecs d'exécution compliquent la construction de l'ontologie. Ce travail s'inscrit dans le courant de la planification neuro-symbolique, qui combine LLM et planificateurs formels (type PDDL) pour pallier les limites des approches où le modèle génère directement les actions. Il se distingue des modèles vision-langage-action de bout en bout, qui traitent le bas niveau. La publication du code permettra une reproduction indépendante, étape décisive pour juger si l'écart de performance tient hors du banc d'essai des auteurs.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




