Aller au contenu principal
RecherchearXiv cs.RO 

Reformule avant d'agir : caractérisation et atténuation de la sensibilité au langage des modèles vision-langage-action (VLA)

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les modèles vision-langage-action (VLA) ne tiennent pas la promesse de robustesse linguistique de leurs modèles vision-langage d'origine, selon une étude (arXiv 2610.10526) qui chiffre cette fragilité sur LIBERO, un banc d'essai de manipulation en simulation. Sur ce benchmark, π0.5 allume la cuisinière dans 100 % des essais avec « switch on the stove », mais seulement 2 % avec « switch on the hot plate ». Un checkpoint π0 finetuné avec de l'augmentation par reformulation affiche encore des écarts allant jusqu'à 61 points pour une simple variation de phrasé. Les auteurs mesurent ces variations par des tests statistiques d'écarts à une seule édition, puis par une recherche « oracle » de la meilleure formulation. Celle-ci montre que le phrasé seul comble presque entièrement l'écart de 21 points entre tâches in-distribution et hors distribution.

Leur correctif ne touche pas à la politique. Ils évaluent de nombreuses formulations sur quelques tâches d'entraînement, puis un grand modèle de langage distille ces résultats en dix à vingt règles de reformulation. Au déploiement, chaque consigne entrante est réécrite une seule fois selon ces règles, sans réentraînement ni vérification à chaque pas de temps. Sur un π0 gelé, le gain relatif est de 16 à 27 % sur douze tâches tenues à l'écart, avec des phrasés adversariaux, générés par VLM et rédigés par des humains. Les progrès se concentrent sur les tâches hors distribution. Sur π0.5 et LIBERO, le taux de succès « in-finetune » passe de 93,6 % à 97,8 %. Il s'agit de résultats de simulation et de benchmark. Rien n'est annoncé en déploiement physique ni sur un produit livré.

Pour les intégrateurs et les équipes qui évaluent des VLA, le résultat remet en cause l'idée que la compréhension du langage hérite telle quelle du préentraînement du VLM. Un opérateur qui dit « plaque chauffante » plutôt que « cuisinière » peut faire échouer la tâche presque à coup sûr. Les scores moyens des benchmarks, mesurés avec les formulations canoniques, risquent donc de surestimer la fiabilité en atelier ou en entrepôt, où les consignes varient selon les personnes. Le travail propose aussi une réponse peu coûteuse, puisqu'une couche de réécriture en amont s'ajoute à une politique figée sans nouvelle collecte de données. Reste à voir si cela tient sur robot réel, avec des consignes plus longues et du bruit de reconnaissance vocale. Le coût d'un appel LLM supplémentaire par consigne est faible, mais il ajoute une dépendance et de la latence au démarrage de la tâche.

Ce travail s'inscrit dans la série des politiques généralistes de Physical Intelligence (π0, puis π0.5), devenues des références open source. Celles-ci côtoient des approches concurrentes comme GR00T chez NVIDIA ou Helix chez Figure, dont la robustesse linguistique n'est pas documentée publiquement dans des termes comparables. LIBERO est un benchmark commode mais limité, et la plupart des publications sur les VLA le saturent déjà avec des consignes fixes. Les prochaines étapes naturelles sont des tests sur matériel physique et sur d'autres familles de VLA. Les auteurs publient une page de projet, sttawm.github.io/rephrase-before-you-act.

À lire aussi

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation
1arXiv cs.RO 

LIBERO-PRO : vers une évaluation robuste et équitable des modèles vision-langage-action (VLA) au-delà de la mémorisation

Des chercheurs ont publié LIBERO-PRO, une extension critique du benchmark LIBERO largement utilisé pour évaluer les modèles Vision-Language-Action (VLA). Disponible sur GitHub (Zxy-MLlab/LIBERO-PRO), le travail, présenté sous forme d'arXiv preprint (arXiv:2510.03827v2), soumet les VLA à des perturbations systématiques selon quatre axes : substitution des objets manipulés, variation des états initiaux, modification des instructions de tâche, et changement d'environnement. Résultat sans appel : les modèles actuels qui atteignent plus de 90 % de succès sur l'évaluation LIBERO standard s'effondrent à 0,0 % dans le cadre généralisé de LIBERO-PRO. Concrètement, un modèle continue d'exécuter une séquence de saisie même lorsque l'objet cible est remplacé par un objet sans rapport, et ses sorties restent inchangées face à des instructions corrompues ou composées de tokens aléatoires. Ce résultat est un signal d'alarme direct pour les équipes qui fondent leurs décisions de recherche ou de déploiement sur les classements LIBERO. Il démontre que les modèles VLA n'ont pas acquis de compréhension générale des tâches ni de perception réelle de l'environnement : ils mémorisent des séquences d'actions et des configurations spatiales vues à l'entraînement. Autrement dit, le gap sim-to-real et le problème de généralisation restent entiers, quelle que soit la performance affichée sur le benchmark. Pour les intégrateurs industriels ou les équipes robotique qui envisagent de déployer des politiques basées sur des VLA, cela signifie que les scores publiés ne sont pas des indicateurs fiables de robustesse opérationnelle. LIBERO, introduit pour standardiser l'évaluation des politiques manipulatrices en langage naturel, est devenu une référence de facto dans la communauté. Mais comme tout benchmark sur-exploité, il a progressivement favorisé l'overfitting plutôt que la généralisation. LIBERO-PRO s'inscrit dans une tendance plus large de remise en question des protocoles d'évaluation VLA, aux côtés d'initiatives comparables sur les benchmarks de navigation et de saisie. La prochaine étape logique serait l'adoption de LIBERO-PRO comme standard par les principaux groupes travaillant sur des modèles comme OpenVLA, Octo ou pi0 (Physical Intelligence), afin de permettre des comparaisons réellement équitables et de pousser le secteur vers des politiques robustes en conditions réelles.

RechercheOpinion
1 source
SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)
2arXiv cs.RO 

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.06926) SWAP, pour StepWise Action Policy Routing, un cadre qui compose dynamiquement plusieurs politiques Vision-Language-Action (VLA) pendant l'exécution d'une tâche de manipulation. Aujourd'hui, la plupart des systèmes reposent sur un seul modèle VLA du début à la fin d'un épisode. SWAP formule le routage comme un problème d'apprentissage par renforcement hors ligne : un « critique de routage » est entraîné à choisir, à chaque pas de décision et selon l'observation courante, la politique la plus adaptée. Le robot peut ainsi changer de politique en cours d'épisode. L'évaluation porte sur des tâches réelles de manipulation sur la plateforme DROID et sur des simulations LIBERO. Face à l'exécution d'une politique fixe et à des méthodes de routage de référence, les auteurs annoncent jusqu'à 33 points de succès supplémentaires en conditions réelles, et une réduction de 28,3 % du nombre de pas d'action des trajectoires réussies. L'enjeu dépasse la performance brute. Le travail s'attaque à une limite que les intégrateurs constatent déjà : aucun VLA n'est le meilleur partout, et les performances varient selon la phase de la tâche et l'environnement. Au lieu d'attendre un modèle généraliste unique, SWAP traite les VLA existants comme une boîte à outils orchestrable, sans réentraîner chacun d'eux. Pour un industriel, cela suggère une voie pragmatique : combiner des politiques spécialisées ou de fournisseurs différents, et ne payer que pour la politique utile à chaque étape. La baisse de la longueur des trajectoires laisse aussi entrevoir un gain de temps de cycle, mais il s'agit d'un nombre de pas d'action, pas d'une durée mesurée en atelier. Il faut aussi rester prudent sur les chiffres : le « jusqu'à 33 % » correspond au meilleur cas, et l'abstract ne précise ni le nombre de tâches ni la taille des échantillons, ni les politiques combinées. Ce résultat s'inscrit dans la course aux modèles fondation pour la manipulation, où des VLA comme Pi-0, GR00T ou Helix sont généralement présentés comme des systèmes autonomes. Le routage entre politiques prolonge les approches de mélange d'experts, mais à l'échelle de politiques complètes et de manière apprise hors ligne. DROID, jeu de données et plateforme de manipulation très utilisé, et LIBERO, banc d'essai en simulation, servent de référence commune, ce qui facilite la comparaison. Il s'agit d'une prépublication v1 non évaluée par les pairs, sans déploiement industriel annoncé. Les prochaines étapes à surveiller : la publication du code, la robustesse du critique face à des environnements inédits, et la latence ajoutée par le routage à chaque pas de décision.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
StairVLA : génération d'actions hiérarchique et sensible aux étapes pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

StairVLA : génération d'actions hiérarchique et sensible aux étapes pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.07756v1) StairVLA, un cadre de génération d'actions hiérarchique pour les modèles vision-langage-action (VLA). Ces modèles utilisent de plus en plus des têtes d'action à diffusion ou à flow matching pour produire des actions robotiques continues. Les auteurs constatent que ces têtes traitent la trajectoire de débruitage de façon quasi uniforme, alors que le conditionnement évolue selon les étapes. Au début, instructions en langage et observations visuelles servent à fixer une trajectoire grossière. Ensuite, le débruitage s'appuie davantage sur l'observation visuelle courante pour aligner l'action. StairVLA exploite cette observation. Un VLA de haut niveau exécute seulement les premières étapes de débruitage et produit une trajectoire longue, partiellement débruitée et réutilisable. Un raffineur léger, tournant à plus haute fréquence, termine le débruitage de segments d'actions locaux (« chunks ») avec les dernières observations. Sur le benchmark simulé LIBERO, une version de style GR00T fait passer le taux de succès moyen de 96,5 % à 97,8 %. La latence d'inférence amortie passe de 115,0 ms à 44,2 ms par chunk, soit environ 2,6 fois moins. Les auteurs affirment des résultats comparables sur deux architectures VLA, plusieurs benchmarks simulés et des tâches sur robot réel, sans en détailler les chiffres dans le résumé. L'enjeu est le coût de calcul, un des freins au déploiement des VLA. Le backbone, très gourmand, est appelé à chaque chunk, ce qui limite la fréquence de boucle fermée et impose du matériel embarqué coûteux. StairVLA propose de n'invoquer ce backbone que rarement et de laisser un module léger corriger à haute fréquence. Le gain de latence ne se fait pas au prix de la précision, ce qui compte pour les intégrateurs qui visent des tâches de manipulation réactives sur des plateformes à budget énergétique limité. Les résultats restent à nuancer. LIBERO est un benchmark saturé, où un écart de 1,3 point est modeste. Les gains en conditions réelles, face à des perturbations et à des objets inédits, ne sont pas quantifiés dans le résumé. Il s'agit d'une publication de recherche, pas d'un produit ni d'un déploiement. Ce travail s'inscrit dans l'effort pour accélérer les VLA, après les têtes d'action par diffusion de Pi-0 et de GR00T, les approches à deux systèmes comme Helix de Figure, qui sépare un modèle lent de raisonnement d'une politique rapide, et les méthodes de distillation ou de réduction du nombre d'étapes de débruitage. La spécificité de StairVLA est d'utiliser l'action partiellement débruitée comme interface entre les deux niveaux, sans module de planification séparé. Les prochaines étapes à surveiller sont la publication du code, des validations sur davantage de robots réels et une comparaison directe avec les approches de type Helix ou Pi-0.5 en conditions industrielles.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
RedVLA : l'attaque physique des modèles vision-langage-action (VLA)
4arXiv cs.RO 

RedVLA : l'attaque physique des modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié RedVLA (arXiv:2604.22591), présenté comme le premier framework de red teaming physique dédié aux modèles VLA (Vision-Language-Action), ces architectures multimodales qui pilotent des robots physiques en interprétant simultanément des instructions visuelles et textuelles. Le framework opère en deux étapes : une phase de "Risk Scenario Synthesis" qui identifie automatiquement les régions d'interaction critiques dans des trajectoires normales pour y insérer des facteurs de risque entremêlés au flux d'exécution du modèle, suivie d'un "Risk Amplification" qui raffine itérativement la position et l'état du facteur de risque via une optimisation sans gradient guidée par des caractéristiques de trajectoire. Testé sur six modèles VLA représentatifs, RedVLA atteint un taux de succès d'attaque (Attack Success Rate) de 95,5 % en seulement 10 itérations d'optimisation. Les chercheurs proposent en parallèle SimpleVLA-Guard, un module de sécurité léger entraîné sur les données générées par RedVLA, dont le code et les assets sont disponibles publiquement. Un ASR de 95,5 % signifie que dans quasiment tous les scénarios testés, le framework a réussi à provoquer des comportements dangereux dans des modèles VLA avant déploiement. C'est un résultat préoccupant pour les intégrateurs industriels : contrairement aux attaques sur systèmes purement logiciels, les comportements physiques incorrects (collisions, chutes d'objets, dommages environnementaux) sont souvent irréversibles. RedVLA démontre qu'il est possible de cartographier ces risques de façon systématique avant mise en production, ce qui comble un vide méthodologique réel. Pour les équipes chargées de qualifier des robots manipulateurs ou des humanoïdes, ce type d'outil d'évaluation adversariale pourrait devenir une exigence de certification, à l'image des standards de sécurité fonctionnelle (IEC 61508) dans l'automatisation industrielle. Les modèles VLA ont connu une accélération marquée depuis 2023 avec RT-2 (Google DeepMind), OpenVLA (Stanford), Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA), chacun visant à généraliser les capacités de manipulation via de grandes architectures multimodales pré-entraînées. La sécurité physique de ces systèmes est restée largement sous-étudiée, la recherche en robustesse IA se concentrant surtout sur les attaques adversariales textuelles ou visuelles en contexte numérique. RedVLA adapte les méthodologies de red teaming issues des LLMs au domaine physique, un glissement de paradigme qui devrait intéresser aussi bien les acteurs américains (Figure AI, Agility Robotics, Boston Dynamics) que les startups européennes déployant des robots en environnement humain, comme Enchanted Tools (Mirokaï, France) ou Wandercraft. Les prochaines étapes naturelles seraient des validations sur hardware réel et l'intégration de SimpleVLA-Guard dans des pipelines de déploiement industriels.

UELes startups françaises déployant des robots en environnement humain (Enchanted Tools, Wandercraft) sont directement concernées par ces vulnérabilités VLA, et SimpleVLA-Guard pourrait s'imposer comme exigence dans les pipelines de qualification sous réglementation européenne (AI Act, certification IEC 61508).

RechercheOpinion
1 source