Distillation pour des politiques de manipulation multitâche efficaces via appariement de flux conditionnel
Publié le 24 septembre 2026 sur arXiv sous la référence 2609.28107, cet article de recherche propose une méthode de distillation pour des politiques de manipulation robotique multi-tâches basées sur le Conditional Flow Matching (CFM), technique générative d'apprentissage par imitation jusqu'ici validée surtout tâche par tâche. Entraîner un modèle CFM par tâche fonctionne bien mais devient coûteux en calcul quand le nombre de tâches augmente, alors qu'un entraînement naïf sur des données fusionnées oblige à agrandir le modèle ou dégrade les performances. La méthode proposée distille les champs de vitesse de plusieurs experts CFM mono-tâche vers une politique unique partagée, en combinant ce signal avec l'objectif CFM d'origine pour garder la fidélité aux démonstrations. Testée sur le benchmark de simulation RLBench, elle améliore les performances multi-tâches par rapport à un entraînement naïf, à taille de modèle fixe.
L'enjeu dépasse la prouesse académique : il touche au coût réel des politiques génératives multi-tâches, de plus en plus centrales dans la robotique dite généraliste, où le flow matching sert déjà de brique à des modèles de production comme Pi-0 de Physical Intelligence. Pour un intégrateur, l'obstacle n'est pas seulement la donnée mais l'infrastructure : maintenir un modèle par tâche multiplie les coûts, tandis que mutualiser dans un seul réseau dégrade souvent la performance individuelle. En rapprochant un modèle multi-tâches unique des performances d'experts spécialisés sans augmenter sa taille, ce travail apporte un argument concret dans le débat sur la viabilité économique des politiques partagées, plutôt qu'une nouvelle démonstration isolée.
Ce travail s'inscrit dans la vague d'adoption des modèles génératifs, diffusion et flow matching, en apprentissage de politiques robotiques, portée depuis 2023-2024 par Diffusion Policy puis par des VLA comme Pi-0 ou GR00T N2 de NVIDIA. Il ne s'agit pas d'un produit livré ni d'un déploiement réel : c'est une contribution académique testée uniquement en simulation sur RLBench, sans robot physique ni acteur français ou européen mentionné. La suite logique reste la validation sur des ensembles de tâches plus larges puis, à terme, le transfert vers du matériel réel, étape où se joue habituellement l'écart entre simulation et performance industrielle.




