Aller au contenu principal
YUBI-STAG : alignement riche en contact et en sémantique pour les VLA par ancrage vidéo-langage automatisé
RecherchearXiv cs.RO 

YUBI-STAG : alignement riche en contact et en sémantique pour les VLA par ancrage vidéo-langage automatisé

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié sur arXiv (octobre 2026) YUBI-STAG, un cadre d'annotation spatio-temporelle qui enrichit automatiquement les démonstrations de manipulation avec une sémantique détaillée des interactions. Les jeux de données robotiques actuels ne fournissent le plus souvent que des descriptions grossières de tâche. Ils omettent quel préhenseur agit, quel objet est touché, et comment il est saisi puis déplacé. YUBI-STAG combine une segmentation des objets en contact avec des modèles vision-langage (VLM). Il annote l'identité, les attributs et l'état des objets, les actions par préhenseur, la coordination bimanuelle et les interactions spatialement ancrées. Comme ce pipeline exige des séquences déjà localisées et plusieurs étapes d'inférence VLM, les auteurs l'ont distillé en YUBI-VLM. Ce second modèle reconstruit la structure des actions et les annotations directement à partir de vidéos brutes non segmentées, en peu d'appels d'inférence, et n'utilise que les vues poignet. Les deux systèmes sont évalués sur YUBI-STAG-Bench, qui couvre des tâches d'ancrage temporel, sémantique et spatial.

Selon les auteurs, YUBI-VLM conserve l'essentiel de la précision d'annotation de YUBI-STAG, avec moins d'appels et un temps d'exécution plus court, et généralise à des manipulations jamais vues. Le résumé ne donne aucun chiffre sur la précision, le gain de temps ou la taille du benchmark. Ces ordres de grandeur seront à vérifier dans l'article complet. Ce travail reste une prépublication, sans produit commercialisé ni déploiement industriel.

L'enjeu touche un point faible des modèles vision-langage-action (VLA). Leur pré-entraînement à grande échelle leur donne des compétences de manipulation étendues, mais les piloter par le langage suppose un alignement fin entre instruction et geste physique. Or les annotations disponibles sont trop pauvres pour cela. Les auteurs affirment qu'un post-entraînement de politiques VLA sur ces annotations automatiques améliore l'exécution et le suivi d'instructions dans des expériences bimanuelles. Le contrôle porte sur l'identité de l'objet, le préhenseur actif, le lieu cible et les relations spatiales, des éléments absents des étiquettes d'origine. Si ces résultats se confirment, ils indiquent que le goulot d'étranglement tient autant à la qualité des annotations qu'à l'architecture des modèles. Un VLM léger fonctionnant sur les seules caméras poignet pourrait aussi enrichir à bas coût des corpus existants, sans réannotation humaine. Les expériences restent toutefois de laboratoire, sur plateformes bimanuelles, et l'on ignore sur quels VLA elles ont été menées.

Ce travail s'inscrit dans la tendance du « ré-labelling » automatique des données robotiques par VLM, face à des démonstrations dont le langage est jugé trop pauvre pour les politiques généralistes de type Pi-0, GR00T ou Helix. La distillation vers un modèle opérant sur vidéo brute vise à rendre cette approche praticable sur de gros volumes. Aucun calendrier de publication du code, des données ou du benchmark n'est mentionné dans le résumé. La suite logique serait une validation sur des VLA de référence et des tâches industrielles plus variées.

À lire aussi

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche
1arXiv cs.RO 

Représentation Alignée pour l'Ancrage Tactile en Manipulation Robotique à Contact Riche

Le capteur tactile reste le parent pauvre des politiques vision-langage-action (VLA) pour la manipulation robotique, alors que les phases de contact critiques (préhension, insertion, glissement) échappent souvent à la caméra. Une équipe de recherche propose dans un article publié sur arXiv (2607.14609) une méthode pour mieux exploiter le toucher: au lieu de prédire directement le signal tactile brut, souvent bruité, le système apprend à anticiper de futurs états tactiles à partir des représentations internes du modèle. Par une analyse en sonde linéaire (linear probe), les chercheurs montrent que ce sont les caractéristiques intermédiaires de l'expert en action, la partie du réseau qui traduit une décision en mouvement, qui prédisent le mieux l'état tactile futur, bien mieux que les couches de perception vision-langage ou que l'état d'action final. Sur cette base, ils introduisent le Latent Tactile Predictor (LTP), un module léger qui prédit des embeddings tactiles compacts à partir de cette couche intermédiaire plutôt que le signal tactile brut. Des expériences sur des tâches de manipulation réelles à fort contact confirment que cet alignement représentationnel surpasse les approches de prédiction tactile moins ciblées ou multi-interfaces. Cette contribution touche à un point sensible du secteur robotique: la plupart des politiques VLA actuelles (Pi-0, GR00T N2, Helix) reposent presque exclusivement sur la vision et le langage, avec un toucher traité comme un canal secondaire greffé après coup. Montrer qu'il existe un endroit précis, dans l'architecture, où la supervision tactile est réellement utile change la manière de concevoir ces modèles multimodaux: cela suggère que brancher un capteur tactile n'importe où dans le réseau, sans réflexion sur l'alignement des représentations, gaspille l'information. Pour les intégrateurs travaillant sur des tâches à contact fin, assemblage, insertion de connecteurs, manipulation d'objets déformables, c'est un signal que la robustesse ne viendra pas seulement de plus de données mais d'une meilleure architecture de fusion des modalités. Le travail s'inscrit dans la lignée des VLA tactiles apparus ces deux dernières années pour combler l'angle mort de la seule vision. L'article ne détaille pas de déploiement industriel ni de partenariat avec un fabricant de robots, il s'agit d'une contribution de recherche fondamentale destinée à orienter la conception des futures générations de politiques VLA plutôt qu'un produit prêt à l'emploi.

RechercheActu
1 source
« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »
2arXiv cs.RO 

« Cartes sémantiques enrichies par instance pour la navigation en langage visuel »

Une équipe de recherche (RCI Lab) publie un nouveau framework baptisé Instance-Enriched Semantic Maps pour la navigation par instructions en langage naturel (Visual Language Navigation, VLN), avec trois apports techniques. D'abord, une cartographie 2.5D au niveau instance construite à partir d'images couleur et de profondeur via segmentation panoptique en vocabulaire ouvert, qui préserve les distinctions verticales et capture les petits objets, tout en associant à chaque élément des attributs sémantiques et des descriptions en langage naturel enrichies du contexte de la pièce. Ensuite, un module de traitement des requêtes s'appuyant sur un LLM pour sélectionner la cible, en routant dynamiquement les requêtes vers des experts spécialisés par type et en fusionnant leurs scores pour une sélection d'objectif cohérente quel que soit le formulation de la requête. Enfin, une représentation sémantique nettement plus compacte, avec une réduction de stockage d'environ 96 % par rapport aux approches à scene-graph 3D, tout en conservant l'information spatiale nécessaire à la navigation. Sur le plan des résultats, la représentation 2.5D dépasse la référence 3D de plus de 27 % en AUC normalisée, et le système complet améliore la récupération d'objets de plus de 17 % et le taux de réussite de navigation de plus de 23 % par rapport à la baseline, sur des types de requêtes variés. Pour les robots mobiles autonomes (AMR) et les agents embarqués évoluant en intérieur, ces travaux ciblent un goulot d'étranglement connu des systèmes VLN actuels : la cartographie sémantique existante manque de granularité au niveau des instances individuelles et se montre fragile face à la diversité réelle des formulations utilisateur. En réduisant drastiquement le coût de stockage des cartes tout en gardant leur précision spatiale, l'approche répond à une contrainte concrète de déploiement embarqué, où la mémoire et le calcul restent limités. C'est un signal que la navigation par langage naturel progresse vers une robustesse compatible avec des usages industriels au-delà des démonstrations de laboratoire. Le travail s'inscrit dans la lignée des systèmes VLN combinant cartes spatiales sémantiques et raisonnement par LLM, une direction de recherche active depuis l'essor des modèles de segmentation en vocabulaire ouvert. Les auteurs comparent explicitement leur méthode à des approches de référence en scene-graph 3D, positionnant leur contribution comme une alternative plus légère et plus précise. Le code et les démonstrations sont disponibles sur la page du projet, mais aucun calendrier de déploiement sur robot physique n'est mentionné à ce stade.

RecherchePaper
1 source
Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action
3arXiv cs.RO 

Co-VLA : entraînement fédéré par consensus pour les modèles vision-langage-action

Un article publié sur arXiv (référence 2609.19923v1) présente Co-VLA, une méthode d'entraînement fédéré pour les modèles vision-langage-action (VLA), cette classe de modèles qui traduit perception visuelle et instructions en langage naturel en commandes motrices pour robots. La technique s'appuie sur l'optimisation par consensus via l'algorithme ADMM (Alternating Direction Method of Multipliers) pour coordonner l'entraînement entre plusieurs clients détenant chacun des données robotiques locales différentes, sans jamais faire transiter ces données brutes vers un serveur central. Les auteurs montrent que le même algorithme fonctionne à la fois pour l'entraînement complet d'un modèle et pour le fine-tuning paramétrique-efficient, avec des adaptateurs à rang fixe comme à rang adaptatif. Selon les expériences rapportées, Co-VLA atteint des performances comparables à celles d'un entraînement centralisé classique, aussi bien en entraînement complet qu'en fine-tuning léger. L'abstract ne détaille toutefois ni le nombre de robots ou de sites impliqués dans les tests, ni les tâches précises évaluées, ni de métriques chiffrées de réussite. L'enjeu pratique est celui du goulot d'étranglement identifié par tout le secteur des VLA : les performances de ces modèles s'améliorent avec l'échelle des données, mais ces données de démonstration robotique sont dispersées entre flottes, sites industriels et types de tâches, et leur centralisation pose des problèmes de coût, de bande passante et souvent de confidentialité pour les intégrateurs qui déploient des robots chez des clients tiers. En rendant possible un entraînement collaboratif sans partage de données, Co-VLA ouvre une voie pour mutualiser l'apprentissage entre opérateurs de flottes concurrents ou entre sites d'un même groupe industriel, tout en gérant l'hétérogénéité des distributions de données propre à des robots différents opérant dans des environnements différents, un obstacle documenté du federated learning appliqué à la robotique. Ce travail s'inscrit dans la course actuelle aux modèles VLA généralistes, où des acteurs comme Physical Intelligence (Pi-0), NVIDIA (GR00T N2) ou Figure (Helix) cherchent à industrialiser l'apprentissage à grande échelle sur données robotiques réelles. Co-VLA ne propose pas un nouveau modèle concurrent mais une brique méthodologique complémentaire, exploitable en principe par n'importe quel VLA existant. Il s'agit à ce stade d'une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel, de partenariat ou de calendrier de suite.

RecherchePaper
1 source
TEMPO : post-entraînement par apprentissage par renforcement à découplage sémantique-action pour modèles vision-langage-action
4arXiv cs.RO 

TEMPO : post-entraînement par apprentissage par renforcement à découplage sémantique-action pour modèles vision-langage-action

Une équipe de recherche publie sur arXiv (référence 2608.07314v1, mise en ligne le 10 août 2026) un article intitulé TEMPO, décrivant une méthode de post-entraînement par apprentissage par renforcement pour les modèles vision-langage-action (VLA), ces architectures qui traduisent une instruction en langage naturel et une image caméra en commandes motrices pour un bras ou un robot manipulateur. Le principe : geler le backbone vision-langage pré-entraîné pour préserver ses représentations sémantiques générales, puis n'adapter que deux sous-modules via des boucles de RL distinctes, une couche de projection sémantique mise à jour peu fréquemment pour stabiliser l'action latente, et un expert d'action bas niveau mis à jour à haute fréquence pour intégrer rapidement le retour de l'interaction en ligne. Les auteurs testent cette approche à deux échelles temporelles sur le benchmark de simulation CALVIN, une référence académique pour la manipulation conditionnée par le langage, ainsi que sur des tâches de manipulation réelles, où TEMPO dépasserait à la fois les modèles VLA pré-entraînés de référence et une base RL classique à mise à jour uniforme. L'abstract ne fournit toutefois aucun chiffre précis, ni gain en pourcentage, ni degrés de liberté, ni temps de cycle, ce qui limite l'évaluation indépendante des résultats annoncés. L'enjeu dépasse la seule performance brute : les approches actuelles de fine-tuning des VLA butent soit sur le désalignement de distribution du SFT classique, soit sur l'instabilité provoquée par des mises à jour RL uniformes qui perturbent les représentations sémantiques apprises en pré-entraînement. En découplant les échelles temporelles d'apprentissage, TEMPO répond directement à un point de friction connu dans le déploiement de politiques génératives sur robots réels, où l'apprentissage en ligne doit rester stable tout en s'adaptant vite au feedback de contrôle. Pour les intégrateurs et laboratoires travaillant avec des VLA de type Pi-0, GR00T N2 ou Helix, ce type de méthode de post-entraînement plus fine pourrait réduire le fossé entre démonstration en simulation et robustesse en conditions réelles, sans nécessiter un réentraînement complet du modèle. Ce travail s'inscrit dans la lignée des recherches sur l'adaptation des modèles VLA pré-entraînés à grande échelle, où le SFT reste la méthode dominante malgré ses limites, et où le RL post-entraînement commence à s'imposer comme alternative pour affiner le comportement en environnement réel. Il s'agit ici d'un article de recherche déposé en preprint, sans lien avec un produit commercialisé ni un déploiement industriel annoncé, et sans mention d'affiliation d'entreprise dans le résumé disponible.

RechercheActu
1 source