
KAN We Flow ? Faire progresser la manipulation robotique grâce à l'appariement de flux 3D via KAN et RWKV
Une équipe de recherche présente KAN-We-Flow, une politique de manipulation robotique fondée sur le flow matching, décrite dans un article révisé sur arXiv (identifiant 2602.01115, version 3). Le système combine deux architectures récentes: RWKV (Receptance Weighted Key Value), pour le mélange temporel et par canal du contexte de tache, et les réseaux de Kolmogorov-Arnold (KAN), via une couche GroupKAN qui applique des fonctions splines apprenables groupe par groupe pour calibrer les actions prédites. Les auteurs ajoutent une régularisation de cohérence d'action (ACR), une perte auxiliaire qui aligne les trajectoires prédites sur les démonstrations expertes par extrapolation d'Euler, afin de stabiliser l'entrainement. Resultat annonce: une réduction de 86,8% du nombre de paramètres par rapport aux architectures UNet habituelles, avec un temps d'inférence plus rapide et des scores de réussite qualifies d'état de l'art sur trois bancs d'essai de simulation en manipulation dexterale, Adroit, Meta-World et DexArt.
Les politiques visuomotrices par diffusion, devenues standard pour l'apprentissage de comportements robotiques a partir de démonstrations, souffrent d'un défaut connu: leur debruitage itératif et leurs backbones UNet lourds les rendent lentes a exécuter, un frein direct au déploiement sur du matériel embarque a ressources limitées. Le flow matching promettait déjà de réduire ce cout en apprenant un champ vectoriel résolu en une seule étape, mais les implémentations existantes conservaient des architectures encombrantes. En remplaçant le UNet par un bloc RWKV-KAN nettement plus compact, ce travail ouvre une piste concrète pour rapprocher les politiques d'apprentissage par imitation des contraintes réelles des robots, calcul embarque et latence de cycle, un enjeu suivi de près par les intégrateurs qui cherchent a faire tourner des politiques de type VLA ou diffusion sur des contrôleurs de bord plutôt que sur des serveurs déportés.
Ce travail s'inscrit dans la lignée des politiques par diffusion type Diffusion Policy et des approches de flow matching plus récentes derrière des modèles vision-langage-action tels que Pi-0, qui cherchent toutes a réduire le nombre d'étapes de génération nécessaires pour produire une action. Il ne s'agit pas d'une annonce produit ni d'un déploiement sur robot physique: les résultats publies restent circonscrits a des bancs d'essai de simulation standards en manipulation dexterale, sans précision sur un transfert sim-to-real ni sur un calendrier de mise en oeuvre industrielle. La page projet associée met a disposition code et détails supplémentaires pour la communauté de recherche, mais aucune entreprise ni intégrateur n'est cite comme partie prenante a ce stade.
Dans nos dossiers




