τ0-VLA : un modèle fondation hiérarchique guidé par un modèle du monde en temps d'inférence
Publié le 18 août 2026 sur arXiv sous la référence 2608.16885, τ0-VLA est un modèle de fondation robotique hiérarchique vision-langage-action (VLA) conçu pour la manipulation à long horizon, où un robot enchaîne plusieurs compétences de façon cohérente. Sa spécificité : une politique de haut niveau, guidée par un modèle du monde, génère la sous-tâche suivante à partir de la mémoire d'exécution et, si la décision est jugée difficile, explore plusieurs alternatives avant de trancher, plutôt que de décider en un seul passage avant comme la plupart des VLA hiérarchiques actuels. Une politique de bas niveau exécute ensuite cette sous-tâche, sur plusieurs types de robots. Le modèle a été entraîné sur 40 115 heures de données réelles hétérogènes avec co-entraînement multimodal. En conditions connues comme en décalage de distribution, allouer plus de calcul au moment du test améliore la prédiction de la sous-tâche suivante et le taux de réussite en boucle fermée sur des tâches longues.
La plupart des VLA hiérarchiques décident chaque sous-tâche en un seul passage, sans pouvoir consacrer plus de calcul aux choix difficiles ou lourds de conséquences. τ0-VLA transpose à la planification robotique un principe déjà exploité par les modèles de raisonnement en langage : allouer davantage de calcul au moment du test face à l'incertitude. Pour les intégrateurs qui déploient des VLA en usine ou en entrepôt, la fiabilité des tâches longues reste le principal écart entre démonstrations et déploiement robuste ; réduire les échecs en cascade sur ces séquences serait un progrès concret. Ce résultat reste toutefois un préprint évalué en interne, pas un produit déployé chez un client.
τ0-VLA s'inscrit dans la lignée des VLA généralistes récents, comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, qui génèrent une action en un seul passage avant, sans délibération explicite ; son nom fait écho à Pi-0 tout en ajoutant une étape de recherche à l'inférence. Le résumé ne précise ni laboratoire porteur ni date de publication du code ou des poids. Il illustre une tendance émergente du secteur : après la course aux volumes de données, plusieurs équipes explorent désormais l'allocation dynamique de calcul comme nouveau levier d'amélioration des modèles de fondation robotique.
Dans nos dossiers



