
ForeTime-VLA : distillation causale de jetons futurs à partir d'un modèle d'action du monde pour la manipulation sur convoyeur
Un article publié le 24 août 2026 sur arXiv (2608.20735) décrit ForeTime-VLA, une politique de manipulation robotique bâtie sur pi0.5 et conçue pour la saisie d'objets sur tapis roulant. Hors ligne, le système distille d'un modèle enseignant figé issu d'un world action model nommé Fast-WAM une cible compressée en 64 dimensions représentant les trames vidéo futures ; à l'inférence, un encodeur de huit trames d'historique prédit seul cette cible, la phase de manipulation et le temps avant transition, sans faire tourner le modèle enseignant. Sur 768 fenêtres de test issues d'un jeu de données de tapis roulant dédupliqué, l'erreur absolue moyenne recule de 0,134119 à 0,130593 (2,63%, IC95% 0,82-4,48%) et l'erreur L2 de 3,02%, pour un surcoût de latence de 2,46 à 2,93%. En essais réels sur robot, le système obtient 81,1% de réussite de saisie sur objets immobiles et 58,9% sur objets lents (+12,2 et +22,2 points face à la meilleure référence), et réussit 44 saisies sur 90 contre 23 pour pi0.5 de base, dont 11 sur 30 contre 2 sur 30 à vitesse rapide.
L'enjeu dépasse le simple gain de précision : les politiques VLA classiques, entraînées sur la seule observation courante, peinent à anticiper le contact avec un objet en mouvement, un frein direct pour le tri et la logistique automatisés où les convoyeurs restent la norme. Les modèles de monde apprennent cette dynamique prédictive mais restent trop coûteux à exécuter en temps réel ; ce travail montre qu'une distillation causale de tokens futurs, réalisée hors ligne puis intégrée à un encodeur léger, peut en capter le bénéfice sans en payer le coût d'inférence. La corrélation entre les gains hors ligne sur l'orientation et la baisse réelle des échecs de pose de contact reste l'argument le plus solide avancé par les auteurs, dans un champ où l'écart entre métriques d'entraînement et performance réelle est une critique récurrente adressée aux VLA.
Le travail prend pi0.5, la politique de Physical Intelligence largement utilisée comme référence en recherche robotique, comme base directe de comparaison. L'abstract ne précise ni l'affiliation des auteurs ni de calendrier commercial : il s'agit d'une contribution de recherche postée en cross-listing sur arXiv et testée sur un banc propriétaire de tapis roulant, pas d'un produit annoncé par une entreprise, et aucun acteur français ou européen n'y figure. Elle s'inscrit néanmoins dans la compétition plus large autour des world models appliqués à la robotique, aux côtés d'approches comme GR00T N2 de NVIDIA ou Helix de Figure AI, qui visent la même anticipation temporelle des politiques VLA. Les auteurs ne mentionnent aucune suite prévue au-delà de ces résultats, laissant ouverte une validation sur des tâches de manipulation plus variées que la seule saisie sur convoyeur.
Dans nos dossiers




