Aller au contenu principal
RecherchearXiv cs.RO 

Apprentissage neuro-symbolique de prédicats pour un contrôle robotique sûr et sémantique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (version 1, référence 2609.39594) NEUPRO, pour « Neuro-Symbolic Predicate Learning for Semantic Safe Robot Control ». Cette méthode apprend des représentations de sécurité réutilisables à partir de connaissances fournies par des humains. Les exigences de sécurité d'une tâche s'écrivent sous forme de règles symboliques lisibles. Un raisonneur différentiable les évalue, et les gradients remontent à travers ces règles jusqu'à un extracteur de caractéristiques. Celui-ci transforme les observations brutes (images, capteurs) en concepts pertinents pour la sécurité. L'extracteur reste donc « doucement » ancré dans une sémantique compréhensible par l'humain. Il permet une évaluation transparente des contraintes et se transfère d'une tâche à l'autre. Les auteurs publient aussi REASON, présenté comme le premier jeu de données de référence sur robot réel pour la spécification interprétable de la sécurité. Les expériences menées sur REASON indiquent que NEUPRO apprend des caractéristiques critiques généralisables d'une tâche à l'autre et fournit des explications explicites des violations de sécurité. Le résumé ne donne ni chiffres de performance, ni plateforme robotique, ni taille du jeu de données.

L'enjeu est la certification et l'acceptation de robots dans des environnements partagés. Aujourd'hui, la sécurité est le plus souvent codée par des formulations mathématiques ou logiques opaques, ou par des fonctions de coût denses réglées à la main pour chaque tâche. Ces approches fonctionnent sur des cas précis, mais elles expliquent mal pourquoi une action est jugée sûre ou dangereuse. Elles se réutilisent aussi difficilement d'une application à l'autre. Pour un intégrateur ou un responsable sécurité, une règle lisible et auditable vaut davantage qu'un score de coût inexplicable. Cela vaut en particulier face aux exigences de traçabilité des normes industrielles et du règlement européen sur l'IA. La transférabilité entre tâches pourrait aussi réduire le coût de ré-spécification de la sécurité à chaque nouveau déploiement. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par des pairs, sans comparaison chiffrée publique avec les méthodes de référence. Le caractère « doux » de l'ancrage sémantique signifie aussi que la fidélité des concepts appris n'est pas garantie.

Ces travaux s'inscrivent dans la montée des approches neuro-symboliques en robotique. Elles cherchent à combiner la perception apprise des réseaux de neurones et le raisonnement explicite de la logique. Elles répondent à la fragilité des politiques de bout en bout et des modèles vision-langage-action (VLA), dont le comportement reste difficile à borner. Les concurrents sont multiples : les fonctions de barrière de contrôle (control barrier functions), l'apprentissage par renforcement sous contraintes, la logique temporelle et les filtres de sécurité fondés sur des modèles de langage. La suite dépendra de la publication de REASON et du code, qui permettra de reproduire les résultats. Il faudra aussi voir s'ils tiennent sur d'autres robots, hors du laboratoire, et face à des contraintes de sécurité temps réel.

Impact France/UE

Une sécurité robotique lisible et auditable pourrait faciliter la conformité aux exigences de traçabilité du règlement européen sur l'IA et des normes industrielles.

À lire aussi

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde
1arXiv cs.RO 

IA incarnée et prédictive : le contrôle par apprentissage sûr pour les systèmes robotiques ego-monde

Des chercheurs proposent SOWL-MPC, une méthode de contrôle prédictif sûr conçue pour un nouveau scénario baptisé "ego-world robotic framework": un robot ego doit naviguer aux côtés d'un autre robot ("world robot") dont la politique de contrôle est totalement inconnue. Plutôt que de supposer un comportement prévisible chez l'autre agent, comme le font la plupart des méthodes existantes, l'approche combine un mécanisme d'apprentissage en ligne basé sur des processus gaussiens variationnels épars (SVGP) avec un schéma de contrôle à horizon glissant. À partir de simples mesures d'état bruitées, le système infère une distribution postérieure sur la politique latente du robot tiers, mise à jour en continu via un conditionnement variationnel en ligne (OVC), puis propagée dans la dynamique non linéaire du système via un schéma approché de propagation des moments, avant d'alimenter un contrôleur prédictif (MPC) sensible à l'incertitude. La méthode a été testée lors de campagnes Monte Carlo en simulation sous ROS 2, puis validée sur du matériel robotique réel dans une arène intérieure. Il s'agit d'un article de recherche déposé sur arXiv (2607.22225v1), pas d'un produit commercialisé. L'enjeu dépasse l'exercice académique: dans les entrepôts, les usines ou les espaces partagés où circulent plusieurs robots mobiles (AMR) ou humanoïdes issus de flottes ou de fabricants différents, un robot ne connaît généralement pas la politique de contrôle exacte des autres agents évoluant autour de lui. Les méthodes de navigation sûre reposent le plus souvent sur des hypothèses simplificatrices, modèles cinématiques fixes, comportements connus à l'avance, qui s'effondrent dès que l'environnement devient hétérogène. Une approche capable d'apprendre en ligne le comportement d'un agent inconnu tout en garantissant des marges de sécurité formelles répond directement à ce point de friction, potentiellement utile pour l'intégration de flottes multi-fournisseurs. Le travail s'inscrit dans la lignée des recherches combinant processus gaussiens et contrôle prédictif pour la navigation sûre, un axe actif depuis plusieurs années en robotique mobile et en interaction homme-robot. La validation reste toutefois limitée à une arène intérieure contrôlée: le passage à des environnements réels plus complexes, avec davantage d'agents ou des dynamiques plus rapides, constitue la prochaine étape logique avant tout usage industriel.

RecherchePaper
1 source
NEXUS : apprentissage continu de contraintes symboliques pour une planification incarnée sûre et robuste
2arXiv cs.RO 

NEXUS : apprentissage continu de contraintes symboliques pour une planification incarnée sûre et robuste

NEXUS est un cadre modulaire présenté en mai 2026 sous forme de preprint arXiv (2605.09387), conçu pour l'apprentissage continu de contraintes symboliques dans les agents incarnés. Son objectif central : combler l'écart fondamental entre l'incertitude probabiliste des grands modèles de langage (LLM) et les exigences de déterminisme strict requises dans le monde physique. Le framework dissocie explicitement deux dimensions : la faisabilité physique, améliorée par des retours d'exécution en boucle fermée, et les spécifications de sécurité, ancrées dans des contraintes dures déterministes formant une défense pré-action. Évalué sur le benchmark SafeAgentBench, NEXUS affiche des taux de succès supérieurs aux approches existantes, refuse efficacement les instructions non sûres, résiste aux attaques adversariales, et améliore progressivement son efficacité de planification par accumulation de connaissances symboliques. La pertinence du cadre réside dans son traitement architectural d'un problème structurel : les LLM, malgré leurs performances en planification, restent des systèmes probabilistes susceptibles de produire des comportements dangereux en environnement physique contraint. NEXUS transforme les artefacts symboliques, jusqu'ici utilisés comme de simples interfaces statiques dans les travaux antérieurs, en vecteurs d'évolution de la connaissance. L'ancrage déterministe des risques est particulièrement utile pour les intégrateurs industriels : un agent peut apprendre à reconnaître et refuser des séquences d'actions dangereuses, y compris face à des instructions adversariales délibérément construites. Pour les décideurs envisageant le déploiement d'agents autonomes en entrepôts ou en production, la distinction entre défense réactive et défense pré-action constitue un avantage concret sur le plan de la certification et de la traçabilité. Ce travail s'inscrit dans la continuité de cadres comme SayCan (Google DeepMind) ou Code as Policies, qui ont posé les bases de la planification incarnée par LLM mais traitaient la sécurité comme une contrainte externe figée. NEXUS la rend évolutive via l'apprentissage continu, ce qui le distingue architecturalement. SafeAgentBench, utilisé pour la validation, s'impose progressivement comme référence pour évaluer la robustesse sécuritaire des agents incarnés. Il convient de noter qu'il s'agit à ce stade d'un preprint sans déploiement industriel annoncé ni validation terrain confirmée. La séparation faisabilité/sécurité que propose NEXUS pourrait néanmoins influencer les prochaines générations de middleware robotique, notamment dans les contextes où la traçabilité réglementaire des décisions autonomes est requise.

UELe cadre NEXUS, en rendant les décisions autonomes traçables et auditables via des contraintes symboliques déterministes, pourrait faciliter la mise en conformité avec l'AI Act pour les intégrateurs européens déployant des agents autonomes en environnement industriel.

RecherchePaper
1 source
Contrôle prédictif de pression basé sur l'apprentissage pour une queue robotique souple vertébrée
3arXiv cs.RO 

Contrôle prédictif de pression basé sur l'apprentissage pour une queue robotique souple vertébrée

Une équipe de recherche présente, dans une publication mise en ligne sur arXiv le 30 septembre 2026, un système de contrôle par prédiction de pression (PPC, pressure prédictive control) pour une queue robotique molle segmentée de type vertébrale, destinée a etre montee sur un robot quadrupède. Le système s'appuie sur des réseaux de neurones récurrents LSTM et combine trois modules : un modèle de cinématique inverse (IK), un modèle de cinématique directe (FK) et un module de compensation de pression (P-comp), permettant de piloter la queue aussi bien en mouvement quasi statique qu'en mouvement dynamique non stationnaire. Compare a une approche fondée uniquement sur la cinématique inverse, le PPC réduit l'erreur quadratique moyenne (RMSE) des trajectoires simulées de 69,8 % lors de l'exécution de trajectoires cibles. Dans les mouvements coordonnes entre la queue et le torse du quadrupède, l'utilisation d'un jeu de données de prédiction pour entrainer le PPC permet d'anticiper l'action au pas de temps suivant et réduit le temps de calcul de 60,9 %, améliorant la réactivité de la queue face au rythme de déplacement du robot. Cette avancée s'attaque a un problème récurrent de la robotique molle : la modélisation cinématique des structures continues, dont le comportement matériel non linéaire complique fortement le contrôle, en particulier lors de mouvements non statiques ou l'inertie et les déformations dynamiques entrent en jeu. En montrant qu'un modèle appris remplace avantageusement une cinématique inverse purement analytique, a la fois sur la précision de trajectoire et sur le temps de calcul, les auteurs fournissent une preuve de concept utile aux équipes qui cherchent a doter des robots quadrupèdes d'un appendice mou capable d'apporter du contrôle d'équilibre dynamique ou une interaction physique avec l'environnement, sans recourir a des actionneurs rigides plus lourds et moins surs au contact. Le gain de 60,9 % sur le temps de calcul est particulièrement pertinent pour les applications temps réel, ou la latence de contrôle limite aujourd'hui l'adoption de structures molles complexes face a des actionneurs rigides plus prévisibles. Le travail s'inscrit dans le courant plus large de la robotique molle, ou la difficulté a modéliser précisément des structures déformables freine depuis des années le passage de prototypes de laboratoire a des systèmes déployés, contrairement aux bras et jambes rigides dont la cinématique est bien maîtrisée. L'ajout d'un appendice caudal a un robot quadrupède fait écho a des travaux antérieurs sur les queues robotiques utilisées pour la stabilisation dynamique et le contrôle d'équilibre, un axe également explore par des laboratoires travaillant sur des robots inspires du vivant. Publiee sous forme de preprint arXiv non encore revu par les pairs, l'étude ne précise ni calendrier de transfert vers un produit commercial ni partenaire industriel, mais constitue une brique méthodologique réutilisable par d'autres équipes pour entrainer des contrôleurs similaires sur d'autres structures molles articulées.

RecherchePaper
1 source
Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif
4arXiv cs.RO 

Apprentissage de dynamiques neuronales ODE adaptées au contexte pour le contrôle robotique adaptatif

Des chercheurs ont proposé un modèle de dynamique contextuel fondé sur les équations différentielles ordinaires neuronales (Neural ODE) pour améliorer le contrôle de robots opérant dans des environnements incertains et variables. Le travail, déposé en juin 2026 sur arXiv (référence 2606.15469), cible les perturbations que les contrôleurs classiques peinent à absorber: variations des conditions de contact, effets aérodynamiques et perturbations externes imprévues. La méthode repose sur une procédure d'entraînement en deux phases: le modèle inspecte l'historique des états et des actions du robot pour inférer les facteurs environnementaux courants, sans capteurs dédiés supplémentaires. La compatibilité avec le MPC (Model Predictive Control) est intégrée dès la conception. Les validations portent sur trois plateformes distinctes: un drone quadrirotor en simulation, un robot sphérique Sphero BOLT et un bras manipulateur industriel Fanuc, ces deux derniers testés en conditions réelles. L'enjeu central est la dérive de modèle lors du déploiement: un robot calibré en laboratoire voit ses performances se dégrader dès que l'environnement change, que ce soit un sol différent, une charge variable ou des turbulences. Par rapport aux approches récurrentes classiques (LSTM, GRU), les Neural ODE présentent un avantage structurel: elles modélisent la dynamique en temps continu, ce qui améliore la cohérence physique et simplifie l'interface avec les solveurs MPC. L'inférence du contexte depuis le seul historique actions-états, sans instrumentation additionnelle, réduit la barrière d'intégration pour les industriels. Le test sur un Fanuc, bras omniprésent en production manufacturière, ancre les résultats dans une réalité opérationnelle tangible. Point de réserve: l'article est un preprint et l'abstract ne publie aucune métrique chiffrée de performance, ce qui rend l'évaluation indépendante difficile à ce stade. Les Neural ODE ont été introduites en 2018 par Chen et al. (NeurIPS) comme alternative aux réseaux récurrents pour modéliser des systèmes dynamiques continus. Leur application au contrôle robotique adaptatif répond à un obstacle persistant du secteur: le sim-to-real gap, qui fragilise la fiabilité des systèmes autonomes hors conditions contrôlées. Les approches concurrentes comprennent les processus gaussiens (GP) pour l'adaptation en ligne, les algorithmes méta-apprenants (MAML, PEARL) et l'identification de systèmes en temps réel. Ce travail se distingue par l'inférence contextuelle implicite, couplée nativement au MPC plutôt qu'ajoutée en couche. Le code source est ouvert sur GitHub et des démonstrations vidéo sont accessibles. La prochaine étape logique serait une validation sur des tâches de manipulation à charge variable ou un déploiement en environnement industriel non contrôlé.

RecherchePaper
1 source