DODGER : apprentissage par renforcement guidé par la sécurité pour la navigation de robots parmi des obstacles dynamiques
Des chercheurs publient sur arXiv (2609.38873) DODGER, un cadre d'apprentissage par renforcement (RL) « guidé par la sécurité » pour la navigation de robots au milieu d'obstacles dynamiques, comme des piétons. La méthode s'appuie sur les fonctions barrières de contrôle (CBF), un outil mathématique qui définit un ensemble d'états sûrs et sert à corriger une commande dangereuse avant son exécution. Elle a été évaluée de trois façons : une analyse de sécurité sur une voiture de Dubins (modèle cinématique simplifié), une simulation d'humanoïde en modèle complet (full-order), puis des essais réels sur un humanoïde équipé d'une perception par LiDAR. Le robot atteint des cibles en évitant plusieurs obstacles mobiles, sans filtre de sécurité à l'exécution. Le résumé ne donne ni taux de collision, ni vitesse d'obstacle, ni nombre d'essais, ni modèle d'humanoïde. Il s'agit d'un travail de recherche, sans produit ni déploiement.
L'intérêt tient à une limite des approches CBF-RL actuelles. Elles n'exécutent en entraînement que des actions déjà filtrées. L'agent explore donc moins, ce qui pèse surtout en environnement dynamique, où la sécurité dépend du mouvement relatif entre robot et obstacle. DODGER inverse la logique : les actions produites par la politique pilotent directement les rollouts d'entraînement. Les références filtrées par CBF et les violations de contraintes ne servent qu'à orienter l'apprentissage vers l'évitement. Si cela tient à plus grande échelle, la politique embarquée n'aurait plus besoin d'un solveur de sécurité en ligne. Cela réduirait la charge de calcul et les risques de conflit entre filtre et politique. Pour un intégrateur, la question est de savoir si l'on peut se passer d'un filtre redondant dans des sites partagés avec des opérateurs humains. Les garanties restent empiriques : une politique sans filtre en ligne ne offre plus de certificat formel à l'exécution. Aucune comparaison chiffrée avec les méthodes concurrentes n'apparaît dans le résumé.
Le travail prolonge les méthodes qui intègrent les CBF dans le RL, déjà utilisées pour la locomotion et la navigation de robots à pattes, et rejoint l'effort actuel pour transférer des politiques apprises en simulation vers des humanoïdes réels. Il reste au stade de préprint (v1), sans relecture par les pairs. Les prochaines étapes à surveiller sont la publication des taux de succès et de collision face aux baselines à filtre, les tests avec des obstacles plus nombreux et plus rapides, des piétons réels en environnement non contrôlé, et d'autres plateformes humanoïdes. Aucune annonce de pilote industriel ni d'échéance n'accompagne ce préprint.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




