
HybridFlow : une politique générative à 2 NFE pour la manipulation robotique en temps réel
Des chercheurs restés anonymes, dont l'identité est masquée le temps d'une évaluation en double aveugle, publient sur arXiv (2602.13718v2, version révisée) HybridFlow, une politique générative pour le contrôle robotique en temps réel. Le système ne nécessite que deux évaluations du réseau de neurones, contre les 16 étapes habituelles d'une politique par diffusion, grâce à un pipeline en trois temps : un "Global Jump" qui utilise la vitesse moyenne du cadre MeanFlow pour générer une trajectoire d'action grossière, une interpolation "ReNoise" sans paramètre qui construit un état intermédiaire à un instant de raffinement non nul, puis un "Local Refine" qui interroge la limite de vitesse instantanée du même réseau à cet instant, sans distillation ni modèle séparé. Sur des ablations contrôlées avec le benchmark RoboMimic, la méthode atteint 95% de réussite moyenne avec bruit réutilisé et 95,5% avec bruit frais, contre 78% pour une version MeanFlow à une seule étape. Sur cinq configurations de robots réels, toutes les politiques comparées tournant sur le même module embarqué Jetson AGX Thor de Nvidia, HybridFlow améliore la performance normalisée des tâches de 13 à 68 points par rapport à une Diffusion Policy à 16 étapes, avec une latence de génération d'action environ huit fois plus faible.
Ce résultat s'attaque directement au compromis central des politiques génératives en robotique : la précision des gestes exige généralement de nombreuses étapes de débruitage, incompatibles avec les boucles de contrôle temps réel exigées par la manipulation fine. En conservant un modèle unique et en évitant la distillation, qui dégrade souvent la précision ou la généralisation, HybridFlow promet une exécution quasi aussi fiable qu'une diffusion complète mais à une fraction du coût de calcul, sur du matériel embarqué contraint. Les auteurs démontrent aussi sa compatibilité comme module d'action au sein d'une architecture vision-langage-action, ce qui en fait un candidat pour accélérer l'inférence dans les grands modèles généralistes de contrôle robotique déployés sur des plateformes comme le Jetson.
Le travail s'inscrit dans la lignée des politiques par diffusion et par flow-matching devenues dominantes pour l'apprentissage de la manipulation robotique, où le nombre d'étapes de sampling reste le principal frein au déploiement temps réel. Aucun acteur industriel ni produit commercial n'est associé à cette publication, qui reste une contribution de recherche académique publiée en préprint, sans date de déploiement ni partenaire annoncé.
Dans nos dossiers




