Aller au contenu principal
NEXUS : apprentissage continu de contraintes symboliques pour une planification incarnée sûre et robuste
RecherchearXiv cs.RO 

NEXUS : apprentissage continu de contraintes symboliques pour une planification incarnée sûre et robuste

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

NEXUS est un cadre modulaire présenté en mai 2026 sous forme de preprint arXiv (2605.09387), conçu pour l'apprentissage continu de contraintes symboliques dans les agents incarnés. Son objectif central : combler l'écart fondamental entre l'incertitude probabiliste des grands modèles de langage (LLM) et les exigences de déterminisme strict requises dans le monde physique. Le framework dissocie explicitement deux dimensions : la faisabilité physique, améliorée par des retours d'exécution en boucle fermée, et les spécifications de sécurité, ancrées dans des contraintes dures déterministes formant une défense pré-action. Évalué sur le benchmark SafeAgentBench, NEXUS affiche des taux de succès supérieurs aux approches existantes, refuse efficacement les instructions non sûres, résiste aux attaques adversariales, et améliore progressivement son efficacité de planification par accumulation de connaissances symboliques.

La pertinence du cadre réside dans son traitement architectural d'un problème structurel : les LLM, malgré leurs performances en planification, restent des systèmes probabilistes susceptibles de produire des comportements dangereux en environnement physique contraint. NEXUS transforme les artefacts symboliques, jusqu'ici utilisés comme de simples interfaces statiques dans les travaux antérieurs, en vecteurs d'évolution de la connaissance. L'ancrage déterministe des risques est particulièrement utile pour les intégrateurs industriels : un agent peut apprendre à reconnaître et refuser des séquences d'actions dangereuses, y compris face à des instructions adversariales délibérément construites. Pour les décideurs envisageant le déploiement d'agents autonomes en entrepôts ou en production, la distinction entre défense réactive et défense pré-action constitue un avantage concret sur le plan de la certification et de la traçabilité.

Ce travail s'inscrit dans la continuité de cadres comme SayCan (Google DeepMind) ou Code as Policies, qui ont posé les bases de la planification incarnée par LLM mais traitaient la sécurité comme une contrainte externe figée. NEXUS la rend évolutive via l'apprentissage continu, ce qui le distingue architecturalement. SafeAgentBench, utilisé pour la validation, s'impose progressivement comme référence pour évaluer la robustesse sécuritaire des agents incarnés. Il convient de noter qu'il s'agit à ce stade d'un preprint sans déploiement industriel annoncé ni validation terrain confirmée. La séparation faisabilité/sécurité que propose NEXUS pourrait néanmoins influencer les prochaines générations de middleware robotique, notamment dans les contextes où la traçabilité réglementaire des décisions autonomes est requise.

Impact France/UE

Le cadre NEXUS, en rendant les décisions autonomes traçables et auditables via des contraintes symboliques déterministes, pourrait faciliter la mise en conformité avec l'AI Act pour les intégrateurs européens déployant des agents autonomes en environnement industriel.

Dans nos dossiers

À lire aussi

Apprentissage des relations CAO et planification géométrico-symbolique pour l'assemblage robotique
1arXiv cs.RO 

Apprentissage des relations CAO et planification géométrico-symbolique pour l'assemblage robotique

Un article publié sur arXiv (2609.17263v1) présente un cadre hybride de planification de séquences d'assemblage robotique combinant apprentissage automatique et raisonnement géométrique-symbolique, pensé pour des modèles CAO imparfaits, souvent dépourvus d'informations de contact fiables. Un réseau de neurones prédit les relations géométriques entre pièces à partir de nuages de points, corrigées si besoin par une supervision humaine, puis converties en graphe d'assemblage symbolique exploité par un planificateur qui calcule des primitives de manipulation robotique, guidé par un ray-casting basé sur la visibilité pour trouver les directions de désassemblage sans recherche combinatoire exhaustive. Sur le benchmark ASAP, le système atteint 85,83% de réussite en réduisant le temps médian de planification d'un ordre de grandeur, et jusqu'à 50 fois pour les assemblages de plus de 30 composants. La planification d'assemblage est un problème combinatoire dont le coût explose avec le nombre de pièces, rendant les méthodes exhaustives inutilisables sur des assemblages industriels complexes. Le frein pratique majeur reste les données: la plupart des CAO industrielles manquent des métadonnées de contact nécessaires, imposant un étiquetage manuel coûteux avant tout déploiement. En combinant extraction de relations apprise et vérification humaine ciblée, le framework réduit cette dépendance, un point concret pour les intégrateurs travaillant sur des données réelles plutôt que des maquettes idéalisées. Le gain de vitesse, jusqu'à 50 fois sur les cas complexes, intéresse les lignes reconfigurables où chaque changement de produit exige une replanification rapide, même si 85,83% de réussite laisse une marge d'échec non négligeable sur un résultat encore expérimental. Le travail s'inscrit dans un champ de recherche actif sur la planification d'assemblage et de désassemblage robotique, où le jeu de données ASAP sert de référence pour comparer les méthodes; les auteurs y opposent leur approche à une méthode combinatoire classique, nettement plus lente. Publié comme nouvelle soumission arXiv sans affiliation industrielle ni calendrier commercial précisé, ce document reste une contribution académique, pensée comme fondation pour des systèmes de planification plus adaptables. Sa portée pratique dépendra de validations futures sur des cellules robotiques réelles et des catalogues de pièces plus larges, étape annoncée mais non détaillée.

RecherchePaper
1 source
PO-PDDL : apprentissage de POMDP symboliques à partir de démonstrations visuelles pour la planification robotique sous incertitude
2arXiv cs.RO 

PO-PDDL : apprentissage de POMDP symboliques à partir de démonstrations visuelles pour la planification robotique sous incertitude

Des chercheurs ont proposé PO-PDDL (arXiv:2606.15654, juin 2026), une formulation symbolique des processus de décision markoviens partiellement observables (POMDP) pour la planification robotique en conditions réelles. Le système étend PDDL, standard de facto en planification symbolique depuis les années 1990, en y intégrant explicitement l'observabilité partielle, la stochasticité des actions et la gestion des croyances (beliefs). Un pipeline d'apprentissage reconstruit automatiquement les trajectoires d'état symbolique latentes à partir de vidéos d'exécution de robot réel, détecte les incohérences entre états inférés et observations visuelles pour localiser les zones d'incertitude perceptive, puis apprend les modèles de transition et d'observation stochastiques correspondants. Les domaines générés sont réutilisables entre tâches et permettent une planification en ligne dans l'espace des croyances. Testée sur des tâches de manipulation longue durée (long-horizon) en environnement physique réel, la méthode surpasse les approches existantes d'apprentissage de modèles PDDL et POMDP, avec un coût de planification significativement réduit. L'apport concret pour les intégrateurs robotiques est de supprimer l'effort d'ingénierie lié à la construction manuelle des modèles POMDP, traditionnellement l'un des verrous de la planification symbolique déployable. Apprendre depuis des vidéos de robots réels plutôt que depuis des simulateurs contourne partiellement le gap sim-to-real qui fragilise nombre d'approches d'apprentissage. La syntaxe PDDL préservée ouvre une voie d'intégration avec des LLM pour la spécification de tâches, un axe actif en recherche (voir LLM+P, ProgPrompt). Le fait que les domaines soient réutilisables et que la planification opère en temps réel sous incertitude perceptive et d'exécution représente un pas vers des architectures neuro-symboliques exploitables hors laboratoire. La planification symbolique butte depuis longtemps sur la difficulté de paramétrer les POMDP pour des environnements physiques réels. Des travaux antérieurs comme FAMA ou LOCM ont progressé sur l'apprentissage de modèles PDDL déterministes, sans traiter simultanément stochasticité et observabilité partielle depuis des observations visuelles brutes. PO-PDDL se positionne aussi face aux politiques de bout en bout (VLA, politiques de diffusion) qui absorbent l'incertitude dans le réseau sans la modéliser explicitement. La lisibilité et débuggabilité du formalisme symbolique restent un argument différenciant pour le déploiement industriel. Il s'agit pour l'instant d'un preprint non évalué par les pairs ; les prochaines étapes naturelles incluent l'évaluation sur des manipulations plus complexes et l'intégration dans des stacks open-source comme ROS 2.

RecherchePaper
1 source
Manipulation robotique incarnée à l'ère des modèles fondation : perspectives de planification et d'apprentissage
3arXiv cs.RO 

Manipulation robotique incarnée à l'ère des modèles fondation : perspectives de planification et d'apprentissage

Une équipe de chercheurs publie une revue de littérature (arXiv:2512.22983v2) sur la manipulation robotique a l'ère des modèles de fondation, sans annoncer de robot ni de produit. Le papier classe les approches récentes selon une grille unifiée : une planification de haut niveau, qui étend le raisonnement de taches classique au langage, au code, aux affordances (zones d'interaction possibles avec un objet), aux contraintes géométriques et aux représentations 3D, et une modélisation d'action de bas niveau, décomposée en trois briques d'apprentissage : entrées sensorielles, représentations latentes et politiques d'action. Les modèles de fondation y interviennent soit comme générateurs de contraintes de planification, soit comme modèles directs de trajectoires exécutables par le robot. Pour les intégrateurs et les laboratoires, l'apport n'est pas une percée technique mais une mise en ordre d'un champ devenu fragmente, ou chaque acteur publie son propre modèle vision-langage-action (VLA) avec ses propres benchmarks, rendant les comparaisons difficiles. En reliant planification symbolique et apprentissage de bout en bout dans un même cadre, la revue donne aux décideurs B2B des critères pour situer une architecture candidate plutôt que de juger chaque annonce sur des vidéos de démonstration. Elle souligne aussi, en creux, l'écart persistant entre résultats de laboratoire et fiabilité en conditions réelles : passage a l'échelle, généralisation, efficacité des données d'entrainement, interaction physique multimodale et sécurité restent, selon les auteurs, des verrous non résolus. Cette synthèse s'inscrit dans la vague de modèles vision-langage-action appliques depuis deux ans a la manipulation robotique et aux bras et humanoïdes industriels, un domaine ou laboratoires de recherche et entreprises publient a un rythme soutenu sans toujours partager un vocabulaire commun. En articulant planification symbolique classique et apprentissage neuronal de bout en bout, les auteurs visent un point de repère stable pour les travaux futurs, notamment sur la généralisation hors distribution et la sûreté des systèmes autonomes. Le papier ne fixe ni calendrier de déploiement ni pilote industriel : il s'agit d'un état de l'art oriente recherche, et non d'une feuille de route produit.

RecherchePaper
1 source
Diffusion hybride pour la planification symbolique et continue simultanée
4arXiv cs.RO 

Diffusion hybride pour la planification symbolique et continue simultanée

Des chercheurs ont publié sur arXiv (identifiant 2509.21983, version 2) une méthode baptisée "Hybrid Diffusion" qui combine génération de trajectoires continues et planification symbolique de haut niveau pour les robots accomplissant des tâches complexes et longues. Le constat de départ est empirique : les modèles de diffusion purement continus, pourtant plébiscités pour générer des trajectoires robotiques, échouent sur les tâches à long horizon. En pratique, ils confondent différents modes de comportement, enchaînant des séquences d'actions incompatibles qui provoquent des échecs en cascade. La solution proposée consiste à diffuser simultanément deux types de variables : des variables discrètes formant un plan symbolique de haut niveau, et des variables continues décrivant la trajectoire physique du robot. Ce double processus, mélange inédit de diffusion discrète et continue, surpasse significativement les baselines selon les auteurs, et permet également de conditionner la génération d'actions sur des conditions symboliques partielles ou complètes. Ce travail s'attaque au "long-horizon planning gap", un verrou fondamental de la robotique cognitive : l'incapacité des systèmes actuels à enchaîner de nombreuses étapes cohérentes. Les approches purement continues, notamment les Visual Language Action models (VLA), souffrent d'une absence de structure symbolique explicite, les rendant fragiles face aux tâches multi-étapes structurées. En générant conjointement un plan symbolique, le modèle maintient une représentation explicite de ce qu'il doit faire et dans quel ordre, réduisant les confusions de modes. Cela dit, le papier est un preprint arXiv non encore soumis à peer review ; les résultats sur robots physiques réels restent à valider de manière indépendante. Les modèles de diffusion pour la robotique ont émergé comme alternative à l'imitation learning classique, notamment via Diffusion Policy (Chi et al., 2023). Hybrid Diffusion s'inscrit dans une tendance combinant raisonnement symbolique (TAMP, planification PDDL) et apprentissage par données, un terrain également exploré par Google avec SayCan et RT-2, ainsi que par les architectures utilisant des LLM comme planificateurs de haut niveau couplés à des policies continues. La prochaine étape naturelle sera la validation sur plateformes physiques, manipulateurs industriels ou robots mobiles, dans des environnements non contrôlés, ce que ce travail, centré sur des expériences en simulation, ne démontre pas encore.

RecherchePaper
1 source