Aller au contenu principal
VLAGuard : un cadre pour évaluer et atténuer le détournement d'attention physique dans les robots vision-langage-action au sein des réseaux de capteurs sans fil
RecherchearXiv cs.RO 

VLAGuard : un cadre pour évaluer et atténuer le détournement d'attention physique dans les robots vision-langage-action au sein des réseaux de capteurs sans fil

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont présenté VLAGuard, un cadre destiné à évaluer et corriger une faille critique des robots Vision-Language-Action (VLA) déployés comme nœuds mobiles au sein de réseaux de capteurs sans fil (WSN) : le détournement de l'attention croisée action-vision par des patchs adversariaux physiques. Le papier introduit d'abord un module de stress-test, VASA (Visuomotor Attention-guided Semantic Attack), qui utilise de simples patchs imprimables pour perturber gravement le mécanisme d'attention croisée conditionné par l'action, c'est-à-dire la fonction qui relie ce que le robot voit à ce qu'il doit faire. Face à cette vulnérabilité, les auteurs proposent une défense baptisée APFT (Attention-Protective Fine-Tuning), qui stabilise l'attention spatiotemporelle et impose une cohérence géométrique, sans coût de calcul supplémentaire à l'inférence. Testée sur le modèle OpenVLA, cette méthode fait chuter le taux d'échec de 100,0 % à 25,9 % dans les simulations LIBERO. Sur 2 000 essais réels menés dans des environnements intelligents assistés par WSN, APFT fait grimper le taux de réussite moyen de 23,0 % à 67,4 % face à des attaques par patch sévères.

Ce résultat expose une faiblesse peu documentée des architectures VLA à grande échelle : leur dépendance à des mécanismes d'attention visuelle facilement manipulables par un simple autocollant imprimé, sans accès numérique au système. Pour les intégrateurs et décideurs qui envisagent de déployer des robots pilotés par VLA en usine, en entrepôt ou dans des environnements connectés en tant que nœuds de capteurs, le taux d'échec de 100 % sous attaque non protégée rappelle que la robustesse des politiques génératives reste loin d'être acquise, même quand les démonstrations en conditions contrôlées paraissent convaincantes. Le fait qu'une contre-mesure sans surcoût d'inférence ramène le taux de réussite à environ deux tiers en conditions réelles, sans l'approcher des 100 %, illustre autant le potentiel que les limites actuelles des défenses par fine-tuning face à des attaques physiques bien conçues.

Ce travail s'inscrit dans un courant de recherche croissant sur la sécurité adversariale des modèles VLA, une famille d'architectures (à l'image de Pi-0, GR00T N2 ou Helix) qui gagne du terrain dans la robotique commerciale grâce à sa capacité à traduire des instructions en langage naturel en actions motrices. Jusqu'ici, la plupart des travaux sur la robustesse de ces modèles ciblaient les perturbations numériques ou les échecs de généralisation, laissant de côté les attaques physiques visant spécifiquement les mécanismes d'attention. VLAGuard ouvre la voie à des protocoles d'évaluation standardisés pour ce type de menace, avec des extensions probables à d'autres architectures VLA et à des scénarios d'attaque plus variés que le simple patch imprimé.

À lire aussi

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur
1arXiv cs.RO 

VLAFlow : un cadre d'entraînement unifié pour les modèles vision-langage-action via co-entraînement et alignement latent futur

Des chercheurs présentent VLAFlow (Vision-Language-Action Flow), un framework unifié de flow-matching destiné à comparer objectivement les différents paradigmes d'entraînement des modèles vision-langage-action (VLA) en manipulation robotique. L'étude s'appuie sur OXEMix, un corpus hétérogène d'environ 5 000 heures de données combinant DROID, OpenX-Embodiment, OpenX-Augmented et RoboCOIN. Sous une architecture commune de type pi-0, avec le même backbone VLM, le même action expert et un espace d'action à 14 dimensions, les auteurs évaluent quatre approches strictement comparables : l'entraînement sur les seules actions (MindPI), le co-entraînement supervisé par le langage (MindLPI), l'alignement des représentations latentes futures (MindWPI), et leur combinaison (MindLWPI). Les tests sont menés sur trois bancs d'essai de référence : LIBERO, LIBERO-Plus et SimplerEnv. Pour les équipes qui entraînent des modèles VLA sur des données robotiques hétérogènes, l'apport principal n'est pas un nouveau produit mais une comparaison contrôlée rare dans un champ où architecture, données et protocole d'évaluation varient habituellement d'un papier à l'autre, rendant les résultats difficiles à départager. Les résultats montrent que l'entraînement action seule se dégrade quand les données proviennent de sources trop diverses, un signal utile pour qui envisage de simplement agréger des jeux de données multi-robots sans garde-fou. La supervision par le langage préserve la généralisation vision-langage, et l'alignement latent futur améliore la modélisation des transitions d'état et des relations action-résultat. La combinaison des deux signaux (MindLWPI) offre le transfert le plus stable sur l'ensemble des bancs d'essai, suggérant qu'un espace de méta-action combinant contraintes linguistiques et prédictives rend l'apprentissage par imitation plus robuste au passage à l'échelle. Ce travail s'inscrit dans la lignée des architectures pi-0 popularisées par Physical Intelligence, dans un paysage où Nvidia (GR00T N2), Figure (Helix) ou d'autres laboratoires développent également des modèles généralistes pour la manipulation robotique. Contrairement à des annonces produit, il s'agit ici d'une publication de recherche (preprint arXiv) centrée sur la méthodologie d'entraînement plutôt que sur un déploiement matériel. Les auteurs positionnent VLAFlow comme un socle reproductible pour de futures comparaisons de paradigmes, sans annoncer pour l'instant de calendrier de mise à disposition du code ou des poids du modèle.

RechercheActu
1 source
VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)
2arXiv cs.RO 

VLA-Arena : un cadre open source pour évaluer les modèles vision-langage-action (VLA)

Une équipe de chercheurs a publié VLA-Arena, un framework open-source de benchmark conçu pour évaluer les modèles Vision-Language-Action (VLA), ces politiques robotiques généralisées capables d'interpréter commandes en langage naturel et observations visuelles pour générer des actions motrices. La version 2 du preprint (arXiv 2512.22539v2) présente un protocole structuré autour de 170 tâches, organisées selon quatre dimensions orthogonales : sécurité (Safety), gestion des distracteurs (Distractor), extrapolation hors-distribution (Extrapolation) et planification longue portée (Long Horizon). Chaque tâche existe en trois niveaux de difficulté (L0 à L2), le fine-tuning étant exclusivement réalisé sur L0 afin de tester la capacité de généralisation. En parallèle, des perturbations linguistiques (W0-W4) et visuelles (V0-V4) s'appliquent indépendamment à chaque tâche, permettant une analyse découplée de la robustesse. Les auteurs publient également les datasets VLA-Arena-S/M/L ainsi qu'un leaderboard public. Les résultats de l'évaluation des VLA de l'état de l'art sont sévères et contre-intuitifs pour ceux qui suivent les démonstrations marketing du secteur. Les modèles testés exhibent une forte tendance à la mémorisation plutôt qu'à la généralisation réelle : leurs performances s'effondrent dès que la tâche sort légèrement de la distribution d'entraînement. La robustesse est asymétrique selon l'axe perturbé (visuel vs. linguistique), les contraintes de sécurité sont quasi-ignorées, et la composition de compétences pour les tâches longue portée reste hors de portée de tous les modèles testés. Pour les intégrateurs industriels et les équipes R&D qui envisagent de déployer des VLA en production, ces résultats constituent un signal d'alerte : le "sim-to-real gap" n'est pas résolu, et les capacités affichées en démo ne tiennent pas face à des conditions réelles variables. VLA-Arena arrive dans un contexte de prolifération rapide des VLA généralistes : Physical Intelligence (Pi-0), NVIDIA (GR00T N2), Google DeepMind (RT-2, Gemini Robotics) et OpenVLA font tous état de progrès importants, mais sur des benchmarks hétérogènes et souvent propriétaires, rendant toute comparaison directe impossible. L'absence d'un protocole d'évaluation standardisé est depuis longtemps identifiée comme le principal obstacle à la progression scientifique rigoureuse du domaine. VLA-Arena n'est pas encore un standard industriel adopté, mais sa publication en open-source avec toolchain complet (définition de tâche, évaluation automatisée, datasets) le positionne comme candidat sérieux. Les prochaines étapes dépendront de l'adoption par les équipes qui développent ces modèles, et d'une éventuelle intégration dans les pipelines de validation avant déploiement réel en atelier.

RechercheOpinion
1 source
FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage
3arXiv cs.RO 

FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage

Des chercheurs proposent FLARE (Failure-Aware framework for Autonomous Correction and Recovery), publié sur arXiv sous la référence 2608.26645v1, une méthode destinée aux modèles vision-langage-action (VLA) utilisés pour la manipulation robotique. Le système repose sur deux mécanismes complémentaires baptisés « Retry » et « Reset ». Le mécanisme Retry injecte des perturbations et des segments de transition dans les démonstrations d'entraînement, en dissociant la pose du robot de l'état de l'environnement, afin que la politique apprenne à gérer seule les écarts d'exécution mineurs comme une prise ratée ou un objet qui glisse. Le pipeline Reset s'attaque aux échecs plus graves, dits hors distribution (OOD), qui rompent l'état de la tâche : un grand modèle multimodal (MLLM) analyse hors ligne des vidéos d'exécution pour repérer automatiquement ces états OOD, ce qui permet de constituer une petite bibliothèque ciblée de compétences de récupération centrées sur les objets. En inférence, un moniteur MLLM en ligne arbitre en temps réel entre poursuite de la tâche et déclenchement d'une compétence Reset. Les auteurs annoncent des gains de taux de réussite et de robustesse sur des tâches de manipulation complexes et riches en contacts, sans toutefois détailler dans le résumé les chiffres précis ni la plateforme robotique testée. L'enjeu touche un point faible connu des VLA : entraînés sur des démonstrations « parfaites », sans échec, ils peinent souvent à se rattraper en conditions réelles, un écart classique entre démonstration et déploiement. Pour les intégrateurs et les équipes robotique industrielles, la capacité à détecter et corriger automatiquement une erreur d'exécution, sans intervention humaine ni réinitialisation manuelle du poste de travail, conditionne directement la viabilité de cellules de manipulation autonomes en production. FLARE s'inscrit dans une tendance de recherche qui cherche à combler l'écart entre les démonstrations vidéo souvent présentées par les laboratoires et la réalité d'une ligne de production où objets glissent, collisions surviennent et préhenseurs ratent leur prise. Le travail s'inscrit dans la lignée des modèles VLA génériques récemment mis en avant dans le secteur, comme Pi-0, GR00T N2 ou Helix, qui visent à généraliser la manipulation à partir d'un apprentissage à grande échelle mais partagent la même limite de données d'entraînement sans échec. FLARE reste à ce stade une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel ni de partenariat commercial associé ; sa validation repose sur des expériences en laboratoire, et son adoption dépendra de tests indépendants et d'une éventuelle intégration dans des piles logicielles de manipulation existantes.

RechercheActu
1 source
Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes
4arXiv cs.RO 

Modèles vision-langage-action (VLA) conditionnés par l'état de santé pour un contrôle robotique sensible aux pannes

Une équipe de recherche publie sur arXiv (référence 2605.16056) un modèle VLA (Vision-Language-Action) capable d'adapter son comportement à la dégradation physique d'un robot, une problématique distincte des pannes de tâches habituellement ciblées par la littérature. L'approche repose sur l'injection d'un module "Health Projector" dans l'architecture VLA-Adapter : le modèle reçoit en entrée un vecteur de santé encodant l'amplitude articulaire et le couple disponible pour chaque joint. Entraîné sur 128 épisodes téléopérés collectés dans l'environnement de simulation LIBERO (benchmark Libero-Spatial), il parvient à compléter des tâches de manipulation spatiale avec des configurations de joints dégradés où le modèle de référence VLA-Adapter Libero-Spatial-Pro échoue systématiquement. Le code et le jeu de données seront prochainement disponibles sur GitHub (h-arslan/health-aware-vla). L'intérêt industriel est réel : dans les déploiements terrain, les robots accumulent des dégradations mécaniques progressives (usure articulaire, perte de couple, grippage de préhenseur) sans nécessairement déclencher d'alarme critique. Un contrôleur aveugle à cet état physique maintient ses consignes nominales et accumule les erreurs ; un modèle conditionné à la santé peut recalculer ses trajectoires à la volée. La modification proposée est présentée comme légère, ce qui suggère une intégration possible dans des pipelines VLA existants sans refonte complète. Cependant, les résultats restent limités à la simulation LIBERO avec 128 épisodes seulement, un jeu de données particulièrement restreint, et aucune validation sur robot physique n'est présentée, laissant le gap sim-to-real entièrement ouvert. Ce travail s'inscrit dans l'expansion rapide des VLA depuis 2023, portée par des modèles comme pi0 (Physical Intelligence), OpenVLA ou la famille RoboVLMs. VLA-Adapter, utilisé comme base ici, est une variante qui réduit les coûts de fine-tuning en gelant le backbone visio-langagier pour n'entraîner qu'un adaptateur léger. La résilience robotique est jusqu'ici majoritairement traitée côté contrôle bas niveau (détection de fautes, compensation par redondance articulaire) plutôt qu'au niveau de la politique visuo-langagière, ce qui rend l'angle de cette recherche original. Aucun acteur européen n'est impliqué dans cette publication. La prochaine étape logique serait une validation sur hardware réel avec des dégradations induites mécaniquement et un dataset substantiellement élargi pour crédibiliser le passage à l'échelle.

RechercheOpinion
1 source