
FutureRTC : exécution robotique en temps réel par regroupement d'actions conditionné par anticipation
Des chercheurs présentent FutureRTC, un framework destiné à corriger un problème concret du déploiement temps réel des politiques Vision-Language-Action (VLA) sur robots : lorsque l'exécution est asynchrone, c'est-à-dire que le prochain bloc d'actions (« chunk ») est calculé pendant que le bloc courant s'exécute encore, un décalage apparaît entre ce qui a été prédit et ce qui se passe réellement, provoquant des discontinuités visibles aux frontières entre chunks. Contrairement aux approches existantes qui lissent superficiellement ces transitions, réentraînent coûteusement la politique, ou ne prédisent que les états proprioceptifs sans tenir compte des observations visuelles, FutureRTC s'installe en complément d'une politique VLA existante sans la modifier. Le système combine un module de correction d'état, qui compense l'écart entre les états proprioceptifs projetés en avance et ceux réellement observés à l'exécution, et un module de prédiction d'observation, qui anticipe les représentations visuelles au moment de l'exécution en utilisant le mouvement du robot comme a priori physique via un transport et une reconstruction de caractéristiques conditionnés par ce mouvement. Une fonction de perte de cohérence aligne enfin les chunks d'actions générés à partir de ces contextes prédits avec ceux que produirait la politique si elle recevait directement les entrées réelles.
Ce travail cible un angle mort fréquent des démonstrations de VLA : la plupart des résultats publiés minimisent la latence d'inférence, un scénario éloigné des contraintes réelles d'un robot où le calcul d'un nouveau chunk prend un temps non négligeable pendant lequel le bras ou l'humanoïde continue de bouger. En corrigeant ce décalage sans réentraîner la politique, FutureRTC s'attaque directement à l'écart entre démonstration en laboratoire et déploiement industriel, un enjeu central pour les intégrateurs qui font tourner des politiques VLA génériques sur du matériel aux contraintes de latence variables. Les auteurs rapportent des trajectoires plus lisses, une exécution plus rapide et de meilleurs taux de succès face aux délais d'inférence, en simulation comme sur robot réel, sans toutefois publier de chiffres détaillés dans le résumé.
Le papier s'inscrit dans la recherche actuelle sur les politiques VLA généralistes, dans la lignée de modèles comme Pi-0 ou GR00T N2, où la latence d'inférence devient critique à mesure que ces modèles grossissent. Publié sur arXiv comme nouvelle soumission, sans partenariat industriel ni calendrier de déploiement mentionné, il reste pour l'instant un résultat académique dont la portée pratique dépendra de sa reproduction sur des plateformes robotiques tierces.
Dans nos dossiers




