Prototypes de tâches pour guider le flow matching : généralisation en few-shot pour la manipulation robotique vision-langage
Un preprint arXiv publié fin septembre 2026 (arXiv:2609.27780), actuellement en relecture anonyme et sans code publié, présente Task-Prototype Guided Flow Matching (TP-Flow), une méthode few-shot pour les politiques de manipulation robotique vision-langage. Le système convertit quelques démonstrations de support en prototypes de tâche extraits par attention croisée symétrique, puis les utilise pour paramétrer la distribution initiale et le champ de vitesse du flow matching via une normalisation adaptative à portes, avec un entraînement épisodique support-requête et une régularisation contrastive. Sur la plateforme LEROBOT-ARM-SO101, TP-Flow atteint 66,8%, 79,6% et 82,1% de réussite en configuration 1, 4 et 6-shot (AUC few-shot de 75,5%), dépassant en 1-shot les références CFM, Pooled-Demo CFM et In-Context Flow de 29,8, 14,5 et 9,9 points de pourcentage. Il tourne en temps réel à 54,3 ms de latence, 3,9 Go de pic mémoire et 10 Hz de cadence de contrôle, tout en limitant à 6,2% la chute de performance avec des démonstrations bruitées.
Le problème visé est concret: le langage naturel ne précise ni le timing des contacts, ni les phases de mouvement, ni le style d'exécution, ce qui limite l'adaptation rapide des politiques vision-langage-action à de nouvelles procédures à partir de très peu d'exemples. Si ces résultats se confirment hors laboratoire, une adaptation efficace à partir d'une à six démonstrations réduirait la dépendance aux vastes jeux de téléopération qui freinent aujourd'hui le déploiement industriel des bras robotiques. Les gains rapportés sur la généralisation à des objets inédits, la recombinaison d'objectifs, les tâches longues et les scénarios de correction de contact vont dans le sens d'un VLA plus robuste à l'échelle, même si les chiffres restent obtenus sur un banc de test académique restreint et n'ont pas été validés en conditions industrielles.
Le travail s'inscrit dans la lignée des recherches sur le flow matching conditionnel appliqué à la robotique, en améliorant des références établies comme CFM et ses variantes few-shot. Les auteurs restent anonymes du fait de la relecture en double aveugle et le code n'est pas publié, ce qui empêche toute vérification indépendante immédiate des chiffres avancés. La plateforme utilisée, LEROBOT-ARM-SO101, s'appuie sur l'écosystème open-source LeRobot et un bras robotique bas coût, un choix favorable à la reproductibilité académique mais éloigné des bras industriels à fort payload utilisés en usine. Aucun partenariat industriel ni date de publication du code n'est annoncé à ce stade; la suite logique serait la levée de l'anonymat après décision d'acceptation et, potentiellement, la diffusion du code source.
Dans nos dossiers




