Geler, partager, réduire : repenser le squelette d'action dans les politiques de diffusion
Un article révisé sur arXiv (2511.12101, version 3) remet en cause la taille des réseaux d'action des politiques de manipulation robotique par diffusion. Son constat : une politique de manipulation ne génère que de courtes séquences d'actions de faible dimension et fortement corrélées. Les auteurs proposent un entraînement découplé : un "action head" générique préentraîné sur des données de cinématique directe sans image, puis figé, seul le module de conditionnement propre à chaque tâche restant entraînable. Testé avec Diffusion Policy sur les benchmarks MimicGen et LIBERO, ce backbone figé unique égale les modèles entraînés classiquement, à condition d'utiliser un conditionnement par modulation plutôt que par attention, qui s'effondre une fois le réseau figé. Plus frappant : un MLP de 5 millions de paramètres égale ou dépasse un U-Net de 244 millions et un transformer. Un backbone initialisé au hasard échoue totalement.
Le résultat questionne une hypothèse répandue dans la robotique : que les modèles Vision-Language-Action récents, dotés de backbones de diffusion ou de flow-matching de centaines de millions de paramètres, ont besoin de cette capacité pour produire des actions fiables. Si un réseau dix à cinquante fois plus petit suffit, l'inférence embarquée devient plus rapide et moins coûteuse, un enjeu direct pour les intégrateurs qui doivent boucler le contrôle moteur à haute fréquence sur du matériel contraint. Cela suggère aussi que les architectures héritées de la génération d'images et de texte sont un mauvais choix d'a priori structurel pour un signal d'action de faible dimension, et pourrait déplacer l'effort de recherche vers des backbones plus compacts plutôt que toujours plus gros.
Le travail s'appuie sur Diffusion Policy, l'architecture de référence, et sur deux suites d'évaluation standard de la communauté robotique, MimicGen et LIBERO, sans essais sur matériel physique réel. Il s'inscrit dans la vague plus large des VLA à backbone de diffusion ou de flow-matching qui s'est généralisée depuis 2024-2025 chez plusieurs laboratoires et startups de robotique humanoïde. Cataloguée comme version révisée ("replace") sur arXiv, cette étude reste une contribution de recherche validée en simulation ; sa portée pour des VLA de production dépendra de sa reproduction sur des tâches et du matériel réels.
Dans nos dossiers




