
Distiller un traqueur 3D centré sur le monde en politiques vision-langage-action
Des chercheurs publient Track4Action, une méthode d'entraînement pour les politiques vision-langage-action (VLA) qui pilotent des robots, mise en ligne sur arXiv le 5 août 2026. Le problème visé : les labels d'action indiquent quelles commandes imiter, mais pas comment elles transforment la scène en 3D. Un module nommé Track4World distille cette information manquante depuis un tracker 3D figé, en encodant géométrie, mouvement et visibilité captés durant la démonstration ; des "track queries" apprenables retrouvent cette signature dans les états cachés du modèle VLA courant et conditionnent une tête d'action par flow-matching, sans utiliser le clip ni le tracker au moment du déploiement. Résultat : 82,3% de réussite en zero-shot sur LIBERO-Plus (+7,6 points face à une variante sans alignement, +3,0 face à LaMP), 80,44% et 81,48% sur RoboTwin 2.0 selon la configuration, et 67,5% de réussite moyenne sur quatre tâches physiques bimanuelles réelles, soit 25 points de mieux que la variante sans alignement.
Ce travail touche un point sensible de la robotique IA actuelle : transférer la richesse d'une démonstration vidéo (mouvement, occlusions, changements de caméra) vers une politique qui, en conditions réelles, ne verra jamais cette vidéo. La plupart des VLA s'entraînent seulement sur des paires observation-action, en ignorant la dynamique 3D implicite des trajectoires démontrées. Le gain de 25 points sur les tâches bimanuelles physiques, bien supérieur à ceux mesurés en simulation, suggère que cette supervision privilégiée devient d'autant plus utile que la manipulation se complexifie, notamment pour les tâches à deux bras qui exigent une meilleure compréhension géométrique de la scène.
Track4Action se compare à deux références directes : une variante "alignment-free" du même pipeline, privée de la distillation du tracker, et LaMP, une méthode antérieure de conditionnement par représentations de mouvement. Le travail s'inscrit dans la lignée des architectures VLA à flow-matching, popularisées par des modèles comme Pi-0 ou GR00T N2, en y ajoutant une brique de supervision par tracker 3D. Les auteurs valident leur approche en simulation, sur LIBERO-Plus et RoboTwin 2.0, et sur banc physique avec des manipulations bimanuelles réelles, une combinaison encore rare dans la littérature VLA. Une page projet est en ligne, mais aucun code ni poids de modèle n'est mentionné comme publié à ce stade, ce qui limite pour l'instant la reproductibilité par des tiers.
Dans nos dossiers




