
Mamba Policy : vers une politique de diffusion 3D efficace avec des modèles à états sélectifs hybrides
Une équipe de recherche présente Mamba Policy, une nouvelle architecture pour piloter des robots manipulateurs en 3D, décrite dans une version mise à jour de l'article arXiv:2409.07163. Les modèles de diffusion sont devenus une méthode de référence pour apprendre à prédire des trajectoires d'action en manipulation robotique, mais ils s'appuient généralement sur de lourds réseaux UNet comme backbone, difficiles à faire tourner sur du matériel contraint en ressources, comme l'électronique embarquée d'un bras robotique. Les auteurs remplacent une partie de cette architecture par des blocs Mamba, un type de modèle à état sélectif réputé pour sa faible complexité de calcul en modélisation de séquences. Le résultat, baptisé Mamba Policy, réduit le nombre de paramètres de plus de 80 % par rapport au réseau de politique original, tout en obtenant de meilleures performances. La brique technique centrale, le XMamba Block, combine les informations d'entrée avec des caractéristiques conditionnelles en mélangeant mécanismes Mamba et attention pour une extraction de features plus fine.
Pour l'industrie robotique et les équipes de recherche en manipulation, ce travail répond à une contrainte très concrète: les politiques de diffusion actuelles, aussi précises soient-elles, restent souvent trop volumineuses pour un déploiement embarqué en temps réel. Diviser le coût de calcul par cinq tout en gagnant en performance ouvre la voie à des politiques d'action utilisables sur des contrôleurs moins puissants, un enjeu clé pour les intégrateurs qui veulent sortir la manipulation robotique du laboratoire. Les auteurs mettent aussi en avant une meilleure robustesse sur les tâches à long horizon, un point faible connu des méthodes de diffusion classiques.
Ce travail s'inscrit dans la vague plus large de modèles Mamba, apparus récemment comme alternative crédible aux architectures Transformer pour le traitement de séquences longues avec moins de calcul. Les expériences ont été menées sur les bancs d'essai académiques Adroit, Dexart et MetaWorld, avec plusieurs variantes de Mamba testées au sein du framework, et complétées par des essais en conditions réelles pour valider les résultats hors simulation. Le code et les détails du projet sont publiés en open source.
Dans nos dossiers




