
RIFT : garder l'avenir, laisser tomber le déploiement pour les modèles vision-langage-action
Une équipe de recherche présente RIFT (Rollout-free Imagination via Future Tokens), une méthode qui accélère l'inférence des modèles d'action du monde (world action models, WAM) utilisés en robotique pour prédire l'action d'un robot à partir d'un futur visuel anticipé. L'étude (arXiv:2608.11521) teste quatre WAM sur les 40 tâches du benchmark LIBERO. Pour les modèles Joint et Cosmos-2, rejouer un seul cache clé/valeur (K/V) figé correspondant à l'état final préserve quasiment l'exécution d'origine, avec 1,7 à 1,9 cm d'erreur de déplacement de l'effecteur et 97,9% à 98,2% de réussite. RIFT construit ce cache complet en une seule passe grâce à des tokens d'anticipation appris, sans génération vidéo itérative : 98,8% de réussite sur LIBERO, contre 98,4% à 98,6% pour les méthodes à rollout Joint, IDM et LingBot-VA, avec une latence par segment d'action réduite de 68,2% à 89,1%. Sur RoboTwin 2.0, RIFT atteint 92,9% et 92,6% de réussite en scènes propres et randomisées, le meilleur score des méthodes testées.
L'enjeu dépasse le simple gain de vitesse : un robot n'a pas besoin de régénérer vidéo après vidéo pour agir, seule la représentation finale du futur comptant pour la politique d'action. Pour les intégrateurs et décideurs robotique B2B, cela cible directement le goulot d'étranglement des architectures VLA et WAM en conditions réelles, le rollout vidéo itératif, coûteux en calcul, qui limite la fréquence de commande et les temps de cycle exploitables en production. Une réduction de latence de 68% à 89% sans perte de précision notable, si elle se confirme au-delà des benchmarks de simulation, rapprocherait ces modèles prédictifs des contraintes temps réel de la manipulation industrielle. Ces résultats restent toutefois obtenus en simulation (LIBERO, RoboTwin), sans déploiement documenté sur robot physique.
Cette recherche s'inscrit dans la lignée des modèles vision-langage-action (VLA) et des world models qui conditionnent la génération d'actions robotiques sur des futurs visuels imaginés, une approche portée notamment par Cosmos, le modèle de monde de Nvidia, et comparable en esprit aux travaux autour de GR00T N2 ou Pi-0. Le résumé ne précise ni affiliation institutionnelle ni laboratoire, et l'article reste à ce stade une preprint arXiv non revue par les pairs ; aucun acteur européen n'y est mentionné. Les prochaines étapes attendues concernent la validation sur des tâches de manipulation plus complexes que LIBERO et RoboTwin, ainsi qu'un éventuel transfert vers des plateformes robotiques physiques, condition nécessaire avant toute intégration industrielle.
Dans nos dossiers




