Aller au contenu principal
RecherchearXiv cs.RO 

Toutes les couches ne nécessitent pas d'ajustement : diagnostiquer et orienter l'adaptation des modèles vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (référence 2609.18084) teste cinq modèles Vision-Language-Action de tailles très différentes, de 93 millions à 7 milliards de paramètres : OpenVLA-OFT, Pi-0, SmolVLA, DTP et Octo. Les auteurs montrent qu'un changement d'apparence visuelle pèse surtout sur l'encodeur visuel, qu'un changement de formulation des instructions pèse sur le module langage, et qu'un objet inédit sollicite l'encodeur visuel et la tête d'action, un schéma constant sur les cinq architectures. Leur pipeline diagnostique ces besoins à partir de dix images non annotées du nouvel environnement, sans fine-tuning préalable, en combinant gradient, Monte Carlo Dropout et un score de Centered Kernel Alignment, avec une corrélation de Spearman médiane de 0,91, avant de répartir un budget de paramètres en adaptateurs LoRA à rang variable, gelant les régions déjà calibrées.

Sur les benchmarks LIBERO et CALVIN, cette allocation ciblée égale ou dépasse un LoRA uniforme à chaque budget testé, et sur un bras robotique xArm-7, elle atteint les performances d'un fine-tuning complet avec seulement 0,04% des paramètres entraînables lors d'un changement de formulation des instructions. Sur cinq scènes inédites évaluées sans réentraînement, elle devance toutes les méthodes comparées avec 11 à 23 réussites sur 30 essais, contre 8 à 18 pour la meilleure alternative à budget équivalent et seulement 2 à 11 pour le fine-tuning complet. Pour les intégrateurs qui redéploient un VLA sur un nouveau site, l'intérêt est direct : cibler les couches qui comptent selon le type de changement, décor, consigne ou objet, évite de réentraîner un modèle entier ou d'appliquer des adaptateurs uniformes coûteux en calcul.

Ce travail prolonge les méthodes d'adaptation à budget réduit comme LoRA, déjà utilisées pour spécialiser des modèles de langage, en les appliquant ici région par région à des VLA issus de laboratoires distincts, OpenVLA, Pi-0 (Physical Intelligence) ou Octo. Les résultats, obtenus en simulation sur LIBERO et CALVIN et validés sur un seul bras physique, restent à confirmer sur des humanoïdes ou des flottes en usine. Les auteurs présentent leur diagnostic comme exploitable avant même de lancer un entraînement, sans toutefois annoncer de calendrier ni de partenaire industriel pour une mise en production.

À lire aussi

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action
1arXiv cs.RO 

Récupération hiérarchique de compétences pour l'adaptation efficiente des modèles vision-langage-action

Des chercheurs présentent Hierarchical Skill Retrieval (HSR), un framework de récupération de démonstrations pour adapter plus efficacement les modèles Vision-Language-Action (VLA) à de nouvelles tâches de manipulation robotique avec peu de données spécifiques. Plutôt que de chercher des correspondances de tâches complètes, rares dans les jeux de données existants, HSR décompose une tâche cible en séquences de compétences candidates, évalue chaque plan selon sa plausibilité sémantique et la fiabilité des compétences estimée à partir du jeu de données préalable, puis combine récupération de langage au niveau sous-tâche et reclassement par caractéristiques comportementales pour sélectionner des démonstrations pertinentes et compatibles. La politique est ensuite adaptée via un pipeline en deux étapes séparant acquisition générale de compétences et finetuning spécifique à la tâche. Sur le benchmark LIBERO et sur plusieurs tâches de manipulation en conditions réelles, HSR améliore le taux de succès moyen de 10,3% et 21,3% respectivement par rapport à la meilleure méthode de référence. Vidéos et code sont disponibles sur le site du projet. Ce travail s'attaque à un problème très concret pour l'industrie robotique : les modèles VLA préentraînés sur de vastes jeux de données de démonstrations perdent en performance dès qu'on les confronte à des tâches nouvelles avec peu d'exemples, un frein majeur au déploiement rapide chez les intégrateurs. En structurant la récupération autour de compétences réutilisables plutôt que de tâches entières, HSR propose une piste pour réduire le coût de collecte de données lors du transfert vers de nouveaux environnements ou de nouvelles chaînes de production, un enjeu central pour quiconque cherche à industrialiser des bras robotiques ou des humanoïdes au-delà des démonstrations en laboratoire. Le gain plus marqué en conditions réelles (21,3%) qu'en simulation (10,3%) suggère que l'approche hiérarchique compense particulièrement bien le bruit et la variabilité du monde physique, un point souvent négligé par les méthodes de récupération fondées sur la seule similarité visuelle ou l'appariement de langage au niveau tâche. HSR s'inscrit dans la lignée des travaux récents sur l'adaptation efficace des modèles VLA de type Pi-0 ou GR00T, où la question centrale reste de savoir comment tirer parti de grands jeux de données hétérogènes sans réentraînement coûteux pour chaque nouvelle tâche. Les auteurs positionnent leur méthode par rapport aux approches de récupération existantes basées sur la similarité visuelle, les représentations état-action ou l'appariement de langage au niveau tâche, qu'ils jugent insuffisantes face à la structure hiérarchique des tâches de manipulation à long horizon. Le code et les vidéos de démonstration étant publiés en accès libre, la validation par la communauté sur d'autres benchmarks et plateformes robotiques déterminera si ces gains se généralisent au-delà de LIBERO et des tâches réelles testées par les auteurs.

RechercheOpinion
1 source
RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire
2arXiv cs.RO 

RoboHarness : robustesse des modèles vision-langage-action via une adaptation en contexte augmentée par mémoire

Des chercheurs présentent RoboHarness, un dispositif logiciel qui se greffe sur des modèles vision-langage-action (VLA) déjà entraines pour améliorer leur robustesse face au bruit perceptif et aux variations d'environnement, sans reentrainer les poids du réseau. L'architecture combine trois briques opérant en ligne, une récupération contrastive a double mémoire (RAG), un orchestrateur vision-langage pilote par un grand modèle de langage multimodal capable d'attribuer causalement les échecs d'exécution, et des interventions extensibles via le Model Context Protocol (MCP), auxquelles s'ajoute un module hors ligne de consolidation mémoire qui distille les traces d'exécution en connaissances a priori réutilisables. Les auteurs ont teste ce système sur trois modèles VLA de base, Pi-0, Pi-0.5 et SmolVLA, sur les benchmarks LIBERO-PRO et sur LIBERO-RoboHarness, un nouveau benchmark qu'ils ont eux-mêmes conçu. Resultat annonce: un gain moyen de taux de réussite absolu de 56,6%, avec une amélioration de 89,1% sur les taches longues enchaînées (long-horizon task chaining). Le code source et la page projet sont publies sur GitHub, sous le compte LZY-1021. Le papier, publie sur arXiv, en est a sa troisième version révisée. Cette approche cible une faiblesse connue des modèles VLA généralistes: leur fragilité des qu'ils sortent de la distribution de données d'entrainement, un écart souvent masque dans les démonstrations mais critique pour un déploiement industriel réel. En proposant une couche additive et sans fine-tuning, applicable a plusieurs backbones existants, RoboHarness s'inscrit dans une tendance émergente consistant a traiter la robustesse comme un problème d'orchestration et de mémoire en contexte plutôt que de seul entrainement. Pour les intégrateurs, cela laisse entrevoir la possibilité de renforcer des politiques VLA déjà déployées sans refaire les couteux cycles de collecte de données et de reentrainement, un argument potentiellement déterminant pour l'adoption en environnement industriel variable. Les modèles VLA généralistes, tels Pi-0 développe par Physical Intelligence, occupent une place croissante dans la robotique manipulatrice, aux cotes d'autres approches généralistes du secteur. RoboHarness ne constitue pas un nouveau modèle mais un harnais complémentaire, positionne comme correctif a la faiblesse structurelle de mémoire et d'attribution causale des VLA figes. Les benchmarks utilises restant majoritairement simules (suite LIBERO), la validation sur robot physique et en conditions industrielles reste l'étape a surveiller pour juger de la portée réelle de ces gains annonces.

RechercheActu
1 source
LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action
3arXiv cs.RO 

LIRA : routage local d'informations inter-couches pour le décodage des modèles vision-langage-action

Des chercheurs présentent LIRA (Local cross-layer Information Routing for Action decoding), un nouveau mécanisme de connexion entre les modèles vision-langage (VLM) preentraines et les décodeurs d'action robotique au sein des architectures Vision-Language-Action (VLA), décrit dans un article publie sur arXiv en aout 2026 (arXiv:2608.07596v1). Le problème cible: les interfaces existantes n'exploitent qu'une partie restreinte de la hiérarchie de représentations du VLM, ou associent rigidement chaque bloc du décodeur a une seule couche du VLM, limitant l'accès a des indices de tache complémentaires selon la profondeur du réseau. LIRA travaille sur des features de task-tokens et des "LIRA Query features" extraites d'états intermédiaires du VLM, puis attribue a chaque Parallel Fusion Block une fenêtre locale centrée sur la couche VLM correspondante, sans modifier le backbone, le décodeur ni la recette d'entrainement. Teste sur les benchmarks LIBERO, LIBERO-Plus, CALVIN ABC vers D et sur des taches de manipulation réelle, LIRA surpasse la baseline VLA-Adapter a configuration identique de 0,5 milliard de paramètres, avec un gain de 18,9 points en transfert zero-shot sur LIBERO-Plus, ou le taux de succès moyen passe de 59,1% a 78,0%. Ce résultat cible un maillon jusque-la peu étudie des architectures VLA, l'interface de routage entre VLM et décodeur d'action, souvent traitée comme un détail d'implémentation face aux choix de backbone ou de données d'entrainement. En montrant qu'un routage plus fin de l'information, sans toucher au reste du pipeline, améliore nettement la robustesse aux changements de distribution, l'étude suggère que la généralisation des modèles VLA ne dépend pas seulement de leur taille ou du volume de données, mais aussi de la circulation de l'information entre couches. Pour les équipes qui construisent des politiques robotiques sur des VLM preentraines, ce travail pointe une optimisation peu couteuse, sans collecte de données supplémentaire ni refonte d'architecture, un argument utile pour fiabiliser des politiques VLA sur du matériel a calcul embarque limite. L'article s'inscrit dans la lignée des travaux récents sur les modèles VLA, popularises par des systèmes comme Pi-0 ou OpenVLA, qui transforment des représentations de VLM preentraines en commandes motrices pour bras manipulateurs ou robots mobiles. LIRA est positionne comme une amélioration directe de VLA-Adapter, pris comme référence de comparaison plutôt que concurrent indépendant. L'évaluation combine bancs d'essai en simulation, LIBERO, LIBERO-Plus et CALVIN en transfert ABC vers D, et manipulation réelle, une combinaison classique pour distinguer performance en distribution et robustesse hors distribution. L'article ne mentionne ni calendrier de publication de code ni partenariat industriel: il s'agit pour l'instant d'une contribution académique.

RechercheActu
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
4arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source