Apprentissage accéléré de politiques visuomotrices sur variétés d'action via Riemannian MeanFlow
Une équipe de recherche publie sur arXiv (2609.30127v1) une méthode baptisée Riemannian MeanFlow Policy (RMFP), destinée a accélérer l'apprentissage des politiques visuomotrices en robotique de manipulation. Ces politiques associent des observations sensorielles brutes a des séquences d'actions robotiques ; les approches actuelles par diffusion ou flow matching capturent bien la diversité des trajectoires possibles, mais exigent une intégration numérique en plusieurs étapes, couteuse en temps et incompatible avec les cadences de contrôle rapides. RMFP apprend directement la carte de flot de la trajectoire de probabilité sur la variété géométrique de l'espace d'actions, ancrée par une méthode de Riemannian Conditional Flow Matching, ce qui ramené la génération a une seule évaluation du réseau. La méthode est testée sur LASA sphérique, Push-T, les taches Tool Hang et Transport de Robomimic, Franka Kitchen, puis sur une manipulation réelle avec capteurs imparfaits.
Cette capacité a générer une action valide en une seule passe réseau, plutôt qu'en dizaines d'étapes d'intégration, s'attaque directement au goulot d'étranglement qui empêche les politiques de type diffusion ou flow matching de tourner aux fréquences de contrôle exigées par la manipulation fine en temps réel. Pour les intégrateurs et les équipes de recherche en robotique, ce résultat suggère qu'il est possible de conserver l'expressivité des modèles génératifs multimodaux, utiles pour représenter plusieurs stratégies de saisie ou de manipulation possibles, sans sacrifier la latence d'inférence. Le test en conditions réelles avec des mesures sensorielles bruitées répond en partie a la critique fréquente adressée a ce type de travaux, a savoir un écart entre résultats en simulation et robustesse effective sur robot physique, même si la portée de ce test unique reste limitée.
RMFP s'inscrit dans la lignée des politiques de diffusion popularisées en robotique depuis 2023 et de leurs variantes en flow matching, dont s'inspirent aussi certains modèles vision-langage-action commerciaux qui génèrent des séquences d'actions continues, a l'image de Pi-0 de Physical Intelligence ou des architectures d'action de la famille GR00T de NVIDIA. La technique MeanFlow, empruntée a la génération d'images en une étape, est ici adaptée pour la première fois aux variétés géométriques propres aux espaces d'actions robotiques. Il s'agit d'une contribution académique publiée en preprint, sans acteur industriel associe ni déploiement annonce ; les auteurs évoquent comme suite logique l'extension a des architectures VLA de plus grande échelle et a davantage de plateformes robotiques réelles.
Dans nos dossiers




