Aller au contenu principal
Suppression Sticks, la localité est fragile : audit en boucle fermée de la négation de vecteur de tâche dans les politiques VLA
IA physiquearXiv cs.RO 

Suppression Sticks, la localité est fragile : audit en boucle fermée de la négation de vecteur de tâche dans les politiques VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (2608.04692v1) un audit approfondi d'une technique d'édition de modèles appelée « soustraction de vecteur de tâche », appliquée cette fois à des politiques de contrôle robotique multitâches de type VLA (vision-langage-action), en boucle fermée plutôt qu'en évaluation statique. Sur les dix compétences du benchmark LIBERO-Goal, la méthode produit trois régimes distincts : une séparation nette entre la compétence ciblée et les autres pour cinq d'entre elles, une résistance à la suppression pour trois autres, et un effondrement global des performances pour les deux dernières. Même dans les cas « réussis », où le taux de succès de la compétence visée tombe à 0% sur des états de départ inédits, la rétention moyenne des compétences non ciblées ne dépasse pas 52% par rapport à la ligne de base, et chaque édition dégrade au moins une capacité pourtant censée être indépendante. Les chercheurs testent aussi trois architectures de tête d'action (régression continue, tokens discrets, flow-matching) : la séparation propre apparaît sur le panel « Goal » pour ces trois architectures, mais pas sur le panel « Spatial », et un effondrement est observé sur les panels « Object » et « Long-horizon ». La similarité cosinus entre vecteurs de tâche ne permet pas de prédire ces écarts.

Ce résultat intéresse directement quiconque envisage l'édition de modèle par arithmétique de vecteurs comme raccourci pour retirer une compétence indésirable ou dangereuse d'une politique robotique sans réentraînement complet, une approche séduisante car rapide et, au moment de l'édition, sans besoin de données ni de calcul de gradient. L'étude montre que l'hypothèse de « localité », selon laquelle soustraire une compétence n'affecte que celle-ci, est fragile en boucle fermée : même dans le meilleur des cas, environ la moitié seulement des capacités non ciblées survit, et deux cas sur dix se soldent par une politique globalement cassée. Pour des intégrateurs ou décideurs qui évalueraient cette technique comme alternative légère à un réentraînement pour patcher une politique embarquée, le message est clair : l'édition n'est pas un remplacement sûr par défaut. Plus préoccupant, une sonde de réapprentissage montre que la compétence supposément supprimée peut resurgir facilement, ce qui indique un simple masquage comportemental plutôt qu'un effacement certifié, un point important pour toute revendication de sécurité ou de conformité fondée sur ce type d'édition.

L'arithmétique de vecteurs de tâche, qui consiste à ajouter ou soustraire dans l'espace des poids la différence entre un modèle finetuné et son modèle de base, avait déjà été étudiée sur des modèles de texte ou de vision. Ce travail est l'un des premiers à la tester spécifiquement sur des politiques VLA en contrôle robotique en boucle fermée, à l'aide de LIBERO-Goal, une suite de benchmarks structurée en panels Goal, Spatial, Object et Long-horizon, et sur plusieurs familles de têtes d'action. Les auteurs comparent aussi la méthode à des bases de référence « retain-aware » fondées sur le gradient, plus coûteuses en données et en calcul mais potentiellement plus fiables. Ils appellent la communauté à adopter des protocoles d'évaluation combinant systématiquement cible et contrôle en boucle fermée, plutôt qu'un simple taux de succès sur la compétence visée, pour juger correctement la localité des futures méthodes d'édition de modèles embarqués.

À lire aussi

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique
1arXiv cs.RO 

VLCP : réplanification de code en boucle fermée par politique de contrôle vision-langage pour la manipulation robotique

Des chercheurs publient sur arXiv (2608.16978, mis en ligne le 19 août 2026) VLCP, pour Vision Language Control Policy, une méthode qui transforme un modèle vision-langage (VLM) figé en politique de contrôle robotique sans fine-tuning ni démonstrations. Au lieu de réentraîner le modèle pour qu'il produise une représentation d'action inédite, VLCP le fait écrire directement une courte fonction de contrôle en Python, puis referme la boucle au niveau du code lui-même : toutes les K étapes, le VLM réobserve la scène via des flux RGB multi-vues, l'état proprioceptif et un delta d'état, et réécrit la fonction de contrôle si nécessaire, avant qu'un échec ne se propage jusqu'à la fin de l'épisode. Testée sur un ensemble de 57 tâches en simulation MuJoCo/RoboVerse, cette politique sans entraînement atteint un taux de succès combiné de 35,1 %, contre seulement 3,5 % pour le même système interrogé une seule fois par épisode en boucle ouverte, soit un écart d'un facteur dix confirmé par des intervalles de confiance non chevauchants sur toutes les familles de scènes. Le système affiche aussi un taux de récupération intra-épisode de 27,3 % sur les préhensions ratées, un coût de calcul limité (environ 10 requêtes compactes par épisode, 84 % des tokens en cache) et une bibliothèque de compétences réutilisée d'un épisode à l'autre. Le résultat cible directement l'écart entre démonstration et réalité qui pèse sur les politiques VLA (vision-language-action) actuelles : plutôt que de retenter une politique figée ou de basculer vers une autre sous-tâche en cas d'échec, comme le font les méthodes en boucle fermée existantes, VLCP corrige la cause réelle de l'échec, le code de contrôle lui-même. Pour les intégrateurs et équipes de recherche en robotique manipulatrice, cela suggère qu'un VLM générique, sans adaptation coûteuse à un robot ou une tâche spécifique, peut produire des politiques nettement plus robustes simplement en fermant la boucle au bon niveau d'abstraction, celui du code plutôt que de l'action bas niveau. Le gain de robustesse provient moins de la puissance brute du modèle que de la fréquence et du niveau auquel il est autorisé à se corriger, un point qui interroge les architectures de contrôle en boucle ouverte encore courantes dans les démonstrations commerciales du secteur. Cette approche s'inscrit dans la lignée des travaux qui exploitent les VLM frontières comme cerveaux de raisonnement plutôt que comme modèles à réentraîner pour produire des trajectoires, une piste alternative aux politiques VLA de bout en bout comme Pi-0 ou GR00T N2. Les auteurs ne précisent pas de déploiement sur robot physique ni de partenariat industriel : il s'agit à ce stade d'une preuve de concept en simulation, publiée en prépublication, sans date de mise en œuvre réelle annoncée. Les prochaines étapes attendues porteraient sur la validation sur du matériel physique et sur des tâches de manipulation plus complexes que celles du benchmark RoboVerse utilisé ici.

IA physiquePaper
1 source
Apprentissage en boucle fermée d'un modèle du monde vidéo et d'une politique VLA
2arXiv cs.RO 

Apprentissage en boucle fermée d'un modèle du monde vidéo et d'une politique VLA

Une équipe de chercheurs a publié en février 2026 sur arXiv (identifiant 2602.06508v2) World-VLA-Loop, un cadre d'entraînement qui couple un modèle de monde vidéo et une politique VLA (Vision-Language-Action) dans une boucle d'amélioration mutuelle. Le problème de départ est concret : raffiner une politique VLA par apprentissage par renforcement (RL) dans le monde physique coûte cher, entre les rollouts répétés, les remises à l'état initial, la supervision humaine et les risques de sécurité. Les approches existantes utilisent des modèles de monde vidéo conditionnés sur les actions comme simulateurs virtuels, mais ces simulateurs peinent à reproduire les échecs proches du succès ("near-success failures") et ne produisent pas nativement de signal de récompense. World-VLA-Loop propose deux innovations fondamentales : SANS, un protocole de curation qui mélange délibérément trajectoires réussies et trajectoires quasi-réussies pour améliorer l'alignement action-résultat ; et un modèle de monde vidéo "state-aware" qui prédit simultanément frames futures et récompenses binaires à partir des latents de diffusion, intégrant l'estimation de récompense directement dans le générateur plutôt que dans un module séparé. L'apport principal est d'adresser le problème du décalage de distribution dynamique. Lorsqu'une politique VLA évolue pendant le RL, un simulateur figé se désaligne progressivement avec la politique mise à jour. World-VLA-Loop ferme cette boucle en réinjectant les rollouts de chaque politique améliorée pour affiner le modèle de monde, lequel alimente à son tour le post-entraînement VLA suivant. Cette co-évolution itérative réduit la dépendance aux interactions physiques coûteuses. Les expériences couvrent des environnements de simulation et des robots réels, avec des améliorations de performance significatives annoncées, bien que les métriques précises et les benchmarks ne soient pas détaillés dans le résumé disponible, ce qui limite l'évaluation indépendante à ce stade. Ce travail s'inscrit dans l'essor rapide des politiques VLA depuis 2024 : Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, OpenVLA ou Helix de Figure AI constituent l'écosystème de référence. L'enjeu commun est de dépasser le behavior cloning pur pour intégrer du RL sans exploser les coûts de collecte de données réelles. World-VLA-Loop reste un preprint académique en attente de révision par les pairs, sans déploiement industriel annoncé. Les concurrents directs sur la thématique des world models appliqués à la robotique incluent DreamerV3 et les approches de Google DeepMind. Les prochaines étapes naturelles seraient une validation sur des tâches de manipulation plus complexes et une comparaison quantitative publiée contre ces baselines.

IA physiqueOpinion
1 source
Discrete Diffusion VLA : la diffusion discrète appliquée au décodage d'actions dans les politiques VLA
3arXiv cs.RO 

Discrete Diffusion VLA : la diffusion discrète appliquée au décodage d'actions dans les politiques VLA

Des chercheurs ont publié sur arXiv (réf. 2508.20072, quatrième révision) Discrete Diffusion VLA, une architecture de politique robot qui intègre la diffusion discrète directement au sein du backbone transformeur unifié d'un modèle Vision-Language-Action (VLA). Sur le benchmark LIBERO, le système atteint 96,4 % de taux de réussite moyen, 71,2 % de correspondance visuelle sur SimplerEnv-Fractal et 54,2 % sur SimplerEnv-Bridge. Des évaluations en conditions réelles ont été conduites sur la plateforme AgileX Cobot Magic, un bras collaboratif de l'équipementier chinois du même nom. Le mécanisme central est un décodage adaptatif par ordre de confiance : le modèle résout d'abord les éléments d'action à haute certitude, puis revisite les prédictions incertaines via un re-masquage secondaire, permettant une correction d'erreur itérative sans générer une séquence de gauche à droite. L'enjeu architectural est concret. Les VLA actuels souffrent de deux compromis : la génération autorégressive classique (ordre fixe gauche-à-droite) affiche des performances limitées, tandis que les architectures à tête de diffusion continue externe, comme celle de Pi-0 de Physical Intelligence, fragmentent les flux d'information entre backbone et module d'action. En maintenant la diffusion à l'intérieur du backbone, cette approche préserve les représentations visuelles et linguistiques pré-entraînées. Le résultat chiffré est parlant : seulement 0,8 % de dégradation sur les tâches hors-distribution en langage, contre 8,0 % pour le décodage parallèle conventionnel, et 20,4 % en vision contre 29,0 % pour la diffusion continue. Pour un intégrateur ou un responsable technique évaluant une stack de manipulation généraliste, c'est un signal que la robustesse hors-distribution peut être préservée sans compromis sur la scalabilité. Les VLA se sont imposés comme paradigme dominant pour la manipulation généraliste, portés par OpenVLA, Octo, puis Pi-0 qui a popularisé la diffusion continue comme tête de décodage séparée, précisément l'architecture remise en question ici. La diffusion discrète, mieux connue dans le domaine du texte (MDLM, DMDM), est ici appliquée aux séquences d'actions robotiques, un transfert non trivial. La quatrième révision du preprint signale un travail en maturation active. Les prochaines étapes probables incluent le scaling sur des datasets larges de type Open X-Embodiment et l'évaluation sur des plateformes humanoïdes, où la gestion de l'incertitude en temps réel sera le vrai critère discriminant.

IA physiqueOpinion
1 source
Auto-encodeurs épars ancrés dans les événements pour les politiques VLA
4arXiv cs.RO 

Auto-encodeurs épars ancrés dans les événements pour les politiques VLA

Une équipe de chercheurs a publié le 22 mai 2025 sur arXiv (référence 2605.17204) un pipeline d'interprétabilité pour les politiques Vision-Language-Action (VLA), ces modèles qui traduisent des instructions en langage naturel et des entrées visuelles directement en commandes motrices pour robots. Leur approche, baptisée Event-Grounded SAE (Sparse Autoencoder), ancre l'analyse des représentations internes du modèle à des événements comportementaux concrets plutôt qu'à des contextes textuels. Concrètement, des images-clés (keyframes) de l'effecteur terminal sont extraites et regroupées en clusters selon des critères visuels, d'état et temporels, puis associées optionnellement à des annotations sémantiques via un VLM. La méthode a été validée sur deux architectures en simulation et dans une étude sur robot réel, en ciblant notamment les modèles OpenVLA et pi-0.5 (Physical Intelligence). L'enjeu est considérable pour quiconque déploie des VLA en conditions industrielles : ces politiques restent des boîtes noires dont les représentations internes sont difficiles à auditer. Les outils d'interprétabilité mécaniste développés pour les LLMs ne se transfèrent pas directement aux VLA, car les sorties sont des vecteurs d'action continus, non des tokens lisibles, et chaque intervention ne peut être évaluée que via des rollouts en boucle fermée, coûteux à opérer. Le pipeline présenté est, selon les auteurs, parmi les premiers à ancrer l'analyse SAE dans des événements comportementaux fermés, ce qui produit les effets causaux les plus forts mesurés sur OpenVLA et se transfère aux chunks d'action continus de pi-0.5. Les auteurs notent toutefois des limites : le SAE est une base d'intervention sparse mais imparfaite, dont l'utilisabilité varie selon l'architecture et le point d'injection, et des interventions agressives révèlent des défaillances de sécurité non triviales. Ce travail s'inscrit dans une dynamique d'accélération autour des VLA, où des modèles comme OpenVLA (Berkeley), pi-0 et pi-0.5 (Physical Intelligence), ou encore GR00T N2 (NVIDIA) cherchent à généraliser la commande de robots via des fondations pré-entraînées à grande échelle. L'interprétabilité de ces modèles est devenue un prérequis non négociable pour les déploiements à risque élevé, un angle encore peu adressé face à la course aux benchmarks de performance. Les chercheurs identifient plusieurs directions prioritaires : aller au-delà des coordonnées alignées sur l'action, développer des évaluations en boucle fermée plus granulaires, et concevoir des mécanismes d'intervention sûrs. Le code est disponible publiquement sur GitHub (xc-j/Event-SAE).

UELes outils d'interprétabilité VLA présentés pourraient faciliter la conformité aux exigences d'explicabilité de l'AI Act européen pour les systèmes robotiques à haut risque, un angle encore peu adressé par les acteurs européens.

💬 Tout le monde court après les benchmarks VLA, et je vois peu de monde s'inquiéter de la boîte noire. Ce papier prend l'angle inverse et ancre l'interprétabilité dans des événements comportementaux concrets, validé sur robot réel (pas juste en sim), c'est exactement le genre de boulot qu'on attendait. Mauvaise surprise : les interventions agressives révèlent des failles de sécurité sérieuses, et si tu déploies des VLA en prod, ce papier mérite ton attention.

IA physiqueOpinion
1 source