Aller au contenu principal
EvoPlan : planification robotique neuro-symbolique évolutionnaire avec garanties spatio-temporelles
RecherchearXiv cs.RO 

EvoPlan : planification robotique neuro-symbolique évolutionnaire avec garanties spatio-temporelles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une nouvelle publication arXiv (2607.06724v1) présente EvoPlan, un framework neuro-symbolique pour la planification robotique combinant modèles de langage et méthodes formelles. Le système repose sur trois composants fonctionnant avec un LLM open-weight hébergé localement, permettant un déploiement embarqué sans dépendance au cloud. Le premier module extrait hors ligne une contrainte globale de logique temporelle signal (STL) portant sur la mobilité, à partir de données de démonstration : règles codifiées comme l'arrêt aux feux rouges, minées des journaux de conduite nuPlan, ou préférences comportementales comme le confort en navigation sociale, extraites des données de téléopération SCAND. Comme ces démonstrations ne fournissent que des exemples positifs, les chercheurs génèrent des contre-exemples par perturbations contrefactuelles et un générateur de violations basé sur LLM, puis ajustent la contrainte par recherche évolutionnaire. Cette contrainte sert ensuite à encadrer une politique de conduite vision-langage testée sur Bench2Drive et deux politiques de navigation discrète sur HA-VLN-CE. Le deuxième module est un planificateur PDDL évolutionnaire où un LLM propose et corrige des plans, validés par des vérificateurs programmatiques, testé sur le benchmark ALFWorld Text. Le troisième module est une boucle d'exécution contrainte qui compile les plans en trajectoires, vérifiées contre la contrainte STL, avec replanification en cas de violation.

L'enjeu pointé par les auteurs est concret pour l'industrie : les planificateurs purement LLM sont fluides mais n'offrent aucune garantie d'exécutabilité ou de sécurité, tandis que les planificateurs PDDL classiques garantissent ces propriétés mais exigent une spécification complète du problème et exploitent mal la capacité des LLM à lire le contexte et réparer un plan. EvoPlan tente de concilier les deux approches, un enjeu central pour tout déploiement robotique en environnement réel où sécurité et adaptabilité doivent coexister sans validation manuelle exhaustive.

Il s'agit à ce stade d'un travail de recherche académique, illustré uniquement par des démonstrations dans le simulateur Gazebo, sans déploiement sur robot physique ni annonce industrielle associée. Le planificateur reste robuste même quand le vocabulaire des objectifs ne correspond pas à celui du modèle d'actions, un point que les auteurs présentent comme un résultat significatif face aux baselines existantes.

Dans nos dossiers

À lire aussi

RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données
1arXiv cs.RO 

RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données

RoboEvolve est un framework de recherche publié en preprint arXiv (réf. 2605.13775, mai 2025) dont l'objectif est de résoudre la rareté des données d'interaction physique alignées sur les tâches de manipulation robotique. Le système couple un planificateur basé sur un modèle vision-langage (VLM) et un simulateur basé sur un modèle de génération vidéo (VGM) dans une boucle co-évolutive auto-renforçante, opérant à partir de seulement 500 images non annotées, soit une réduction de 50x par rapport aux baselines entièrement supervisées. Le mécanisme alterne une phase d'exploration diurne, qui génère des trajectoires ancrées physiquement via une récompense multi-granulaire à contrôle sémantique, et une phase de consolidation nocturne, qui exploite les échecs "near-miss" pour stabiliser l'optimisation de politique. Les résultats publiés indiquent une amélioration de 30 points absolus sur les planificateurs de base, une hausse de 48 % du taux de succès des simulateurs, et un apprentissage continu robuste sans oubli catastrophique. Ces chiffres adressent directement le principal verrou économique des pipelines de manipulation à grande échelle : la collecte de données téléopérées, qui freine aujourd'hui des systèmes commerciaux comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). La co-évolution VLM-VGM contourne deux limitations bien documentées : les VLM seuls souffrent d'un désalignement sémantique-spatial (compréhension correcte de la tâche mais imprécision dans le positionnement 3D), tandis que les VGM seuls produisent des hallucinations physiques (vidéos synthétiques qui violent les contraintes physiques réelles). Un curriculum progressif automatique fait évoluer le système d'actions atomiques simples vers des tâches composites complexes, approche concrète au problème de généralisation hiérarchique encore non résolu à l'échelle commerciale. Ce travail s'inscrit dans une tendance émergente visant à substituer la génération synthétique de données à la collecte terrain coûteuse, tendance accélérée depuis Diffusion Policy (2023) et l'essor des modèles VLA (vision-language-action). Le résumé disponible ne précise ni affiliation institutionnelle des auteurs ni plateforme matérielle de validation, une limite importante avant tout transfert industriel. Aucun déploiement physique ni partenariat constructeur n'est annoncé : RoboEvolve reste à ce stade une contribution académique dont la transposition sim-to-real sur hardware réel reste entièrement à démontrer.

RechercheOpinion
1 source
LLM-Flax : planification robotique généralisable par approches neuro-symboliques et grands modèles de langage
2arXiv cs.RO 

LLM-Flax : planification robotique généralisable par approches neuro-symboliques et grands modèles de langage

Des chercheurs ont publié LLM-Flax (arXiv 2604.26569v1), un framework en trois étapes conçu pour automatiser le déploiement de planificateurs de tâches neuro-symboliques sans expertise manuelle ni données d'entraînement. Le système prend en entrée uniquement un LLM hébergé localement et un fichier PDDL décrivant le domaine : l'étape 1 génère les règles de relaxation par prompting structuré avec auto-correction, l'étape 2 pilote la récupération sur échec via une politique de budget de latence, et l'étape 3 remplace entièrement le réseau GNN par un scoring d'objets zero-shot. Évalué sur le benchmark MazeNamo en grilles 10x10, 12x12 et 15x15 (8 benchmarks au total), LLM-Flax atteint un taux de succès moyen de 0,945 contre 0,828 pour la baseline manuelle, soit un gain de +0,117. Sur la configuration 12x12 Expert, où le planificateur manuel échoue complètement (SR 0,000), LLM-Flax atteint SR 0,733 ; sur 15x15 Hard, il obtient SR 1,000 contre 0,900 pour l'approche de référence. Le principal verrou adressé est le coût de transfert de domaine : adapter un planificateur symbolique à une nouvelle cellule robotique mobilise aujourd'hui des centaines de problèmes d'entraînement et l'intervention d'un expert métier, ce qui rend le déploiement à l'échelle industrielle prohibitif. La politique de budget de latence de l'étape 2, qui réserve explicitement une enveloppe d'appels LLM avant chaque séquence de récupération sur échec, adresse un problème pratique rarement traité dans la littérature : les boucles de fallback infinies qui paralysent les systèmes en production. L'étape 3 démontre la faisabilité du zero-shot avec SR 0,720 sur 12x12 Hard sans aucune donnée d'entraînement, mais bute sur la fenêtre de contexte à grande échelle, que les auteurs identifient eux-mêmes comme le principal défi ouvert. LLM-Flax s'inscrit dans la lignée des travaux combinant PDDL et LLMs pour la robotique, après SayCan (Google, 2022), Code as Policies (Google DeepMind) et ProgPrompt. Cette approche neuro-symbolique reste distinctement différente des architectures VLA end-to-end comme pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA) : elle préserve un module de raisonnement explicite et auditable, ce qui peut constituer un avantage dans les environnements industriels certifiables. Le benchmark MazeNamo demeure un environnement de navigation 2D simplifié, éloigné des scénarios de manipulation réels ; aucun déploiement terrain n'est annoncé à ce stade, et les auteurs indiquent l'extension à des environnements multi-objets complexes comme prochaine étape.

RecherchePaper
1 source
Planification neuro-symbolique à base d'agents et mise en service pour la robotique industrielle avec humain dans la boucle et jumeaux numériques
3arXiv cs.RO 

Planification neuro-symbolique à base d'agents et mise en service pour la robotique industrielle avec humain dans la boucle et jumeaux numériques

Une équipe de chercheurs publie sur arXiv (2606.08214) un cadre neuro-symbolique agentique pour la robotique industrielle avec supervision humaine en boucle. Le système hybride confie aux grands modèles de langage (LLM) uniquement les tâches de compréhension du langage naturel et de raisonnement contextuel, tandis que la vérification des contraintes physiques, le séquençage des actions et l'exécution restent entièrement déterministes. L'architecture, baptisée Specifier-Designer-Inspector (SDI), adapte le patron logiciel Planner-Generator-Evaluator (PGE) à la robotique industrielle et s'appuie sur LangGraph pour le routage dynamique en cas d'échec. Un mécanisme de récupération à deux niveaux distingue les échecs structurels (replanification contextuelle) des échecs géométriques à l'exécution (primitives déterministes de correction). Un jumeau numérique sous Unity3D permet à l'opérateur d'inspecter, modifier et valider le plan avant tout déploiement physique. Testé sur des commandes en langage naturel face à dix systèmes de référence, le framework SDI obtient le meilleur taux de réussite sur l'ensemble des niveaux de difficulté évalués. L'intérêt industriel de cette approche tient à son pragmatisme architectural : plutôt que de confier aux LLM la garantie de faisabilité physique d'une trajectoire, le système délègue cette responsabilité à des composants symboliques vérifiables et auditables. C'est une réponse directe au "demo-to-reality gap" qui fragilise de nombreux projets fondés sur des VLA (Vision-Language-Action models) ou des politiques neurales pures. Pour les intégrateurs et les COO industriels, la présence du jumeau numérique comme étape obligatoire de validation avant exécution réduit concrètement le risque opérationnel lors du commissionnement de nouvelles cellules robotiques, en donnant à l'opérateur un droit de regard explicite sur chaque plan généré. Ce travail prolonge une tradition de planification neuro-symbolique héritée de STRIPS et des HTN (Hierarchical Task Networks), en y intégrant les LLM pour l'interprétation des intentions opérateur. Il se positionne en contrepied des approches end-to-end actuellement dominantes, notamment pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, ou Helix de Figure AI, qui misent sur des politiques entraînées en imitation ou en renforcement sans couche symbolique intermédiaire. La publication reste un preprint non encore évalué par les pairs, ce qui invite à la prudence sur les benchmarks annoncés : aucune métrique de temps de cycle en conditions industrielles réelles n'est fournie, et les commandes testées restent dans un cadre expérimental contrôlé. Aucun déploiement commercial ni partenariat industriel n'est annoncé à ce stade.

RecherchePaper
1 source
Apprentissage des relations CAO et planification géométrico-symbolique pour l'assemblage robotique
4arXiv cs.RO 

Apprentissage des relations CAO et planification géométrico-symbolique pour l'assemblage robotique

Un article publié sur arXiv (2609.17263v1) présente un cadre hybride de planification de séquences d'assemblage robotique combinant apprentissage automatique et raisonnement géométrique-symbolique, pensé pour des modèles CAO imparfaits, souvent dépourvus d'informations de contact fiables. Un réseau de neurones prédit les relations géométriques entre pièces à partir de nuages de points, corrigées si besoin par une supervision humaine, puis converties en graphe d'assemblage symbolique exploité par un planificateur qui calcule des primitives de manipulation robotique, guidé par un ray-casting basé sur la visibilité pour trouver les directions de désassemblage sans recherche combinatoire exhaustive. Sur le benchmark ASAP, le système atteint 85,83% de réussite en réduisant le temps médian de planification d'un ordre de grandeur, et jusqu'à 50 fois pour les assemblages de plus de 30 composants. La planification d'assemblage est un problème combinatoire dont le coût explose avec le nombre de pièces, rendant les méthodes exhaustives inutilisables sur des assemblages industriels complexes. Le frein pratique majeur reste les données: la plupart des CAO industrielles manquent des métadonnées de contact nécessaires, imposant un étiquetage manuel coûteux avant tout déploiement. En combinant extraction de relations apprise et vérification humaine ciblée, le framework réduit cette dépendance, un point concret pour les intégrateurs travaillant sur des données réelles plutôt que des maquettes idéalisées. Le gain de vitesse, jusqu'à 50 fois sur les cas complexes, intéresse les lignes reconfigurables où chaque changement de produit exige une replanification rapide, même si 85,83% de réussite laisse une marge d'échec non négligeable sur un résultat encore expérimental. Le travail s'inscrit dans un champ de recherche actif sur la planification d'assemblage et de désassemblage robotique, où le jeu de données ASAP sert de référence pour comparer les méthodes; les auteurs y opposent leur approche à une méthode combinatoire classique, nettement plus lente. Publié comme nouvelle soumission arXiv sans affiliation industrielle ni calendrier commercial précisé, ce document reste une contribution académique, pensée comme fondation pour des systèmes de planification plus adaptables. Sa portée pratique dépendra de validations futures sur des cellules robotiques réelles et des catalogues de pièces plus larges, étape annoncée mais non détaillée.

RecherchePaper
1 source