
YUBI-STAG : alignement riche en contact et en sémantique pour les VLA par ancrage vidéo-langage automatisé
Des chercheurs ont publié sur arXiv (octobre 2026) YUBI-STAG, un cadre d'annotation spatio-temporelle qui enrichit automatiquement les démonstrations de manipulation avec une sémantique détaillée des interactions. Les jeux de données robotiques actuels ne fournissent le plus souvent que des descriptions grossières de tâche. Ils omettent quel préhenseur agit, quel objet est touché, et comment il est saisi puis déplacé. YUBI-STAG combine une segmentation des objets en contact avec des modèles vision-langage (VLM). Il annote l'identité, les attributs et l'état des objets, les actions par préhenseur, la coordination bimanuelle et les interactions spatialement ancrées. Comme ce pipeline exige des séquences déjà localisées et plusieurs étapes d'inférence VLM, les auteurs l'ont distillé en YUBI-VLM. Ce second modèle reconstruit la structure des actions et les annotations directement à partir de vidéos brutes non segmentées, en peu d'appels d'inférence, et n'utilise que les vues poignet. Les deux systèmes sont évalués sur YUBI-STAG-Bench, qui couvre des tâches d'ancrage temporel, sémantique et spatial.
Selon les auteurs, YUBI-VLM conserve l'essentiel de la précision d'annotation de YUBI-STAG, avec moins d'appels et un temps d'exécution plus court, et généralise à des manipulations jamais vues. Le résumé ne donne aucun chiffre sur la précision, le gain de temps ou la taille du benchmark. Ces ordres de grandeur seront à vérifier dans l'article complet. Ce travail reste une prépublication, sans produit commercialisé ni déploiement industriel.
L'enjeu touche un point faible des modèles vision-langage-action (VLA). Leur pré-entraînement à grande échelle leur donne des compétences de manipulation étendues, mais les piloter par le langage suppose un alignement fin entre instruction et geste physique. Or les annotations disponibles sont trop pauvres pour cela. Les auteurs affirment qu'un post-entraînement de politiques VLA sur ces annotations automatiques améliore l'exécution et le suivi d'instructions dans des expériences bimanuelles. Le contrôle porte sur l'identité de l'objet, le préhenseur actif, le lieu cible et les relations spatiales, des éléments absents des étiquettes d'origine. Si ces résultats se confirment, ils indiquent que le goulot d'étranglement tient autant à la qualité des annotations qu'à l'architecture des modèles. Un VLM léger fonctionnant sur les seules caméras poignet pourrait aussi enrichir à bas coût des corpus existants, sans réannotation humaine. Les expériences restent toutefois de laboratoire, sur plateformes bimanuelles, et l'on ignore sur quels VLA elles ont été menées.
Ce travail s'inscrit dans la tendance du « ré-labelling » automatique des données robotiques par VLM, face à des démonstrations dont le langage est jugé trop pauvre pour les politiques généralistes de type Pi-0, GR00T ou Helix. La distillation vers un modèle opérant sur vidéo brute vise à rendre cette approche praticable sur de gros volumes. Aucun calendrier de publication du code, des données ou du benchmark n'est mentionné dans le résumé. La suite logique serait une validation sur des VLA de référence et des tâches industrielles plus variées.
Dans nos dossiers




