Video2STL : ancrer des spécifications temporelles générées par un VLM pour l'apprentissage des robots
Video2STL est un cadre logiciel qui convertit des vidéos sans annotation d'actions en spécifications paramétriques de logique temporelle de signaux (Signal Temporal Logic, STL), puis s'en sert pour entraîner des robots. Un modèle vision-langage (VLM) en extrait une trace d'événements sémantiques indépendante de l'embodiment et construit une banque de spécifications symboliques. Le modèle fixe la structure de la tâche, tandis que les seuils numériques des prédicats et les bornes temporelles sont calibrés à partir de trajectoires robotiques réussies. Pour l'apprentissage, les auteurs séparent deux échelles de temps. Des spécifications à court horizon fournissent des récompenses denses via la robustesse quantitative sur fenêtre glissante. Un moniteur causal appliqué à une spécification à long horizon verse une récompense de progression unique pour chaque préfixe temporel valide. Sur quatre tâches de manipulation, Video2STL atteint 85,8 % de succès « au moins une fois » et 67,0 % de succès en fin d'épisode. Le PPO dense natif obtient 81,5 % et 59,5 %, et Text2Reward 65,0 % et 42,3 %. En locomotion quadrupède, les politiques générées avec Qwen-3.8 et GPT-5.6 atteignent 100 % de succès de 0,3 à 2,1 m/s, avec une efficacité énergétique restée compétitive à haute vitesse.
Le point notable tient à la lisibilité de la récompense. Les méthodes actuelles transforment les images en scores de similarité ou de valeur scalaires, ou demandent à un modèle de fondation d'écrire directement du code de récompense. Dans les deux cas, la structure temporelle de la tâche reste difficile à inspecter, à ancrer dans le monde physique et à réutiliser. Une spécification STL se lit, se vérifie et se modifie, ce qui compte pour un intégrateur qui doit justifier le comportement d'une politique auprès d'un client. Le transfert entre morphologies, de vidéos humaines ou animales vers un robot, est aussi un argument pour réduire le coût de collecte de démonstrations dédiées. Les résultats appellent toutefois des réserves : l'écart avec le PPO natif est modeste (environ 4 points en succès unique), l'avantage sur Text2Reward est plus net, et l'évaluation porte seulement sur quatre tâches et un banc de locomotion, sans déploiement réel annoncé. Le seuil de succès en fin d'épisode, à 67 %, reste loin d'un niveau industriel.
Ce travail s'inscrit dans la lignée des méthodes de récompense générées par LLM (Text2Reward, Eureka) et de l'apprentissage à partir de vidéos, qui butent sur la définition de ce qu'il faut transférer. La logique temporelle est déjà employée en robotique pour la vérification et la planification, mais rarement comme pont entre perception par VLM et apprentissage par renforcement. Il s'agit d'un preprint arXiv, accompagné d'une page projet, sans produit ni calendrier de commercialisation. Les prochaines étapes probables sont la validation sur robot physique, l'extension à des tâches plus longues et à des VLA (vision-language-action models) pour comparaison, et l'évaluation de la robustesse face à des spécifications erronées produites par le VLM.
Dans nos dossiers




