Apprentissage neuro-symbolique de prédicats pour un contrôle robotique sûr et sémantique
Des chercheurs ont publié sur arXiv (version 1, référence 2609.39594) NEUPRO, pour « Neuro-Symbolic Predicate Learning for Semantic Safe Robot Control ». Cette méthode apprend des représentations de sécurité réutilisables à partir de connaissances fournies par des humains. Les exigences de sécurité d'une tâche s'écrivent sous forme de règles symboliques lisibles. Un raisonneur différentiable les évalue, et les gradients remontent à travers ces règles jusqu'à un extracteur de caractéristiques. Celui-ci transforme les observations brutes (images, capteurs) en concepts pertinents pour la sécurité. L'extracteur reste donc « doucement » ancré dans une sémantique compréhensible par l'humain. Il permet une évaluation transparente des contraintes et se transfère d'une tâche à l'autre. Les auteurs publient aussi REASON, présenté comme le premier jeu de données de référence sur robot réel pour la spécification interprétable de la sécurité. Les expériences menées sur REASON indiquent que NEUPRO apprend des caractéristiques critiques généralisables d'une tâche à l'autre et fournit des explications explicites des violations de sécurité. Le résumé ne donne ni chiffres de performance, ni plateforme robotique, ni taille du jeu de données.
L'enjeu est la certification et l'acceptation de robots dans des environnements partagés. Aujourd'hui, la sécurité est le plus souvent codée par des formulations mathématiques ou logiques opaques, ou par des fonctions de coût denses réglées à la main pour chaque tâche. Ces approches fonctionnent sur des cas précis, mais elles expliquent mal pourquoi une action est jugée sûre ou dangereuse. Elles se réutilisent aussi difficilement d'une application à l'autre. Pour un intégrateur ou un responsable sécurité, une règle lisible et auditable vaut davantage qu'un score de coût inexplicable. Cela vaut en particulier face aux exigences de traçabilité des normes industrielles et du règlement européen sur l'IA. La transférabilité entre tâches pourrait aussi réduire le coût de ré-spécification de la sécurité à chaque nouveau déploiement. Il faut toutefois rester prudent. Il s'agit d'un préprint non évalué par des pairs, sans comparaison chiffrée publique avec les méthodes de référence. Le caractère « doux » de l'ancrage sémantique signifie aussi que la fidélité des concepts appris n'est pas garantie.
Ces travaux s'inscrivent dans la montée des approches neuro-symboliques en robotique. Elles cherchent à combiner la perception apprise des réseaux de neurones et le raisonnement explicite de la logique. Elles répondent à la fragilité des politiques de bout en bout et des modèles vision-langage-action (VLA), dont le comportement reste difficile à borner. Les concurrents sont multiples : les fonctions de barrière de contrôle (control barrier functions), l'apprentissage par renforcement sous contraintes, la logique temporelle et les filtres de sécurité fondés sur des modèles de langage. La suite dépendra de la publication de REASON et du code, qui permettra de reproduire les résultats. Il faudra aussi voir s'ils tiennent sur d'autres robots, hors du laboratoire, et face à des contraintes de sécurité temps réel.
Une sécurité robotique lisible et auditable pourrait faciliter la conformité aux exigences de traçabilité du règlement européen sur l'IA et des normes industrielles.
Dans nos dossiers




