
Curiosity-Diffuser : un modèle de diffusion guidé par la curiosité pour plus de fiabilité
Des chercheurs ont publié une version révisée (arXiv:2503.14833v2) de l'article "Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability", qui propose une méthode pour réduire les hallucinations comportementales des politiques d'imitation basées sur des modèles de diffusion conditionnels, un cadre courant en commande robotique par apprentissage. Le mécanisme repose sur un module de curiosité de type Random Network Distillation (RND), qui évalue si le comportement généré s'écarte des données d'entraînement, puis guide la diffusion via un classifieur pour minimiser cette curiosité et limiter la surgénéralisation lors de l'inférence. Les auteurs introduisent aussi une métrique de fiabilité peu coûteuse en calcul, mesurant la similarité entre trajectoires générées et jeu de données d'origine. La méthode a été testée en simulation et lors d'expériences physiques sur plusieurs scénarios, avec un gain de performance et des comportements plus proches des démonstrations d'entraînement. Le code est disponible sur GitHub (CarlDegio/Curiosity-Diffuser).
L'enjeu ici n'est pas la performance brute d'une tâche mais la fiabilité des politiques neuronales, point sensible pour tout déploiement robotique réel. Les modèles de diffusion et, plus largement, les architectures VLA séduisent par leur capacité à générer des trajectoires complexes, mais leur instabilité face à des situations hors distribution freine leur adoption industrielle: une hallucination comportementale sur un bras ou un robot mobile ne signifie pas seulement un échec de tâche, mais potentiellement un mouvement dangereux. En combinant un mécanisme de réduction du risque et une métrique standardisée pour le quantifier, ce travail s'attaque à l'écart entre démonstrations en laboratoire et robustesse en conditions réelles, un sujet que surveillent de près intégrateurs et responsables sécurité avant de valider des politiques d'apprentissage pour des applications critiques.
Ce papier s'inscrit dans la lignée des diffusion policies, devenues une alternative populaire aux politiques d'imitation classiques en manipulation robotique, et dans le débat plus large sur la généralisation des modèles VLA à grande échelle. Il s'agit d'une contribution académique republiée en version révisée, sans association à un fabricant identifié dans l'article. Le code ouvert laisse la porte à une reprise par d'autres équipes de recherche, mais aucun calendrier de déploiement industriel n'est mentionné: à ce stade, un jalon méthodologique plutôt qu'une brique prête pour la production.
Dans nos dossiers




