
Vision-TL-Action : génération neuro-symbolique de trajectoires à partir d'observations visuelles et de logique temporelle
Des chercheurs présentent Vision-TL-Action, une architecture neuro-symbolique qui génère des trajectoires robotiques directement à partir d'images multi-vues, d'un graphe de logique temporelle (TL) sans coordonnées explicites, et de l'état initial du robot, sans avoir besoin de la géométrie exacte des objets au moment de l'inférence. Les tokens représentant les nœuds de logique temporelle et les tokens visuels spatiaux sont fusionnés par attention croisée bidirectionnelle, et cette représentation conditionne un générateur de trajectoires par flow matching. Les tokens visuels ne sont enrichis que de coordonnées normalisées dans le plan image et d'identifiants de caméra, tandis qu'un objectif d'ancrage prédicat-région, utilisé seulement à l'entraînement, aide le modèle à relier les prédicats logiques aux objets référencés. Évalué avec la métrique Success@K (proportion de tâches réussies par au moins une trajectoire parmi K échantillonnées), le modèle atteint 67,45% de Success@1024 sur une tâche de manipulation avec bras Panda, contre 59,11% pour une référence "oracle" disposant de l'état géométrique exact. Sur une tâche de navigation AntMaze, il obtient 96,35% de Success@256, proche des 96,88% de l'oracle. Le code est publié sur GitHub (AricLau07/vision-tl-action).
L'intérêt tient au problème que ce travail contourne: les générateurs de trajectoires conditionnés par logique temporelle encodent généralement la géométrie exacte des objets dans le graphe de tâche, ce qui suppose une reconstruction 3D précise en amont, coûteuse et fragile en conditions réelles. Ici, un ancrage purement 2D dans le plan image suffit à égaler, voire dépasser, une référence disposant d'un accès privilégié à l'état du monde. Pour les intégrateurs qui conçoivent des systèmes de manipulation à partir de spécifications de tâches formelles, cela suggère qu'un pipeline vision-langage-action peut se passer d'une chaîne de perception 3D complète. À noter: ces résultats restent obtenus en simulation, sur des bancs d'essai standards (Panda, AntMaze), sans validation sur robot physique où le bruit de perception, les occlusions et les erreurs de calibration compliquent généralement ce type d'approche.
Ce travail s'inscrit dans le rapprochement croissant entre logique temporelle, utilisée de longue date en planification et vérification formelle, et les générateurs de trajectoires par flow matching ou diffusion qui sous-tendent des modèles vision-langage-action comme Pi-0, GR00T ou Helix. Les auteurs situent explicitement leur contribution par rapport aux méthodes existantes qui esquivent le problème de liaison perception-symbole en s'appuyant sur une géométrie exacte. Leurs études de résolution et d'intervention montrent que la finesse de l'ancrage spatial dépend du contenu sémantique et que l'identité du prédicat influence à la fois l'attention et la performance, ouvrant la voie à des travaux futurs sur des scènes multi-objets plus complexes et une validation sur robot réel.
Dans nos dossiers




