Modèle vision-langage-action Flex-π : un modèle du monde à multi-flux avec flexibilité de calcul
Une équipe de recherche présente Flex-π, un modèle monde-action (WAM) de 6 milliards de paramètres, détaillé dans un article déposé sur arXiv (2608.10860v1). Sa base est une découverte inattendue : l'encodeur VAE gelé, utilisé pour la génération vidéo et l'encodage RGB, retranscrit aussi presque sans perte les cartes de points 3D, sans entraînement dédié. Cela permet de superviser Flex-π sur la géométrie 3D et la sémantique objet-centrée DINO en plus du RGB, sans capteur, pré-entraînement supplémentaire ni surcoût de latence, dans une architecture Mixture-of-Transformers qui débruite conjointement ces signaux et les actions. Un dropout par flux avec renforcement inter-modalités permet à un même checkpoint de tourner du mode action seule jusqu'à la génération jointe complète ; sur des tâches de manipulation bimanuelle dextre et précise en conditions réelles, Flex-π bat les meilleures références de 2 à 7 fois tout en restant plus rapide que π0.5.
Ce résultat comble une limite connue des modèles monde, qui prédisent surtout des pixels sans ancrage 3D ni compréhension sémantique des objets, ce qui freinait leur utilité pour la manipulation fine. Flex-π montre qu'un signal géométrique riche peut être extrait gratuitement d'un VAE vidéo déjà entraîné, sans caméra de profondeur ni pipeline 3D dédié, ce qui abaisse la barrière d'entrée pour les équipes de robotique. Sa flexibilité de calcul et son efficacité en démonstrations, avec des gains de 2 à 7x avec moins de données, répondent à deux freins des VLA (vision-language-action) : le coût d'intégration et le coût de collecte de données par tâche.
Flex-π reste à ce stade une publication de recherche accompagnée d'un site de démonstration (flex-pi.github.io), sans annonce de produit commercial ni de déploiement industriel. La comparaison directe avec π0.5, le modèle de référence de Physical Intelligence, le positionne dans la course aux modèles vision-langage-action généralistes, aux côtés d'efforts comme GR00T N2 de NVIDIA ou Helix de Figure AI. L'article ne précise ni l'institution porteuse ni de calendrier, et ses résultats reposent sur des benchmarks internes plutôt que sur un déploiement chez un intégrateur tiers.
Dans nos dossiers




