Aller au contenu principal
RecherchearXiv cs.RO 

TMT : détection de portes dérobées à l'exécution pour les politiques vision-langage-action (VLA) sur des tâches inédites

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent sur arXiv (2610.09462) TMT, un détecteur de backdoors fonctionnant à l'exécution pour les politiques vision-langage-action (VLA). Une politique VLA compromise conserve des performances normales sur ses tâches habituelles, mais produit des actions malveillantes dès qu'un déclencheur apparaît dans l'observation. TMT (Token Manifold and latent Transition modeling) est entraîné uniquement sur des rollouts bénins. Une première branche évalue la structure des tokens d'entrée. Une seconde mesure les erreurs de prédiction dans la dynamique latente entre couches adjacentes. Un rollout jugé suspect par la première branche est confirmé par des déviations latentes, ce qui guide le choix des transitions à surveiller ensuite. Les auteurs testent aussi une purification par auto-distillation: une copie gelée de la politique infectée fournit les actions de référence sur entrées bénignes pour superviser un modèle étudiant, sur des paires d'observations bénignes et déclenchées, sans politique saine séparée. Face à dix baselines (détecteurs de backdoors classiques adaptés, méthodes de détection d'anomalies et d'échecs réutilisées), TMT revendique le meilleur résultat sur des tâches inédites, pour trois attaques. Le résumé ne donne aucun chiffre, et la comparaison est menée a posteriori par les auteurs eux-mêmes.

Le point difficile est que chaque action malveillante peut être plausible isolément, et qu'une tâche nouvelle modifie légitimement observations et comportements. Un détecteur calibré sur les tâches d'entraînement risque donc de multiplier les fausses alertes en production. Viser la généralisation à des tâches inédites correspond au besoin réel des intégrateurs, qui déploient des VLA génériques sur des cellules changeantes. L'absence de politique de référence saine pour la purification est aussi un atout pratique, puisque ces modèles sont rarement disponibles en double. Il s'agit toutefois d'un résultat académique, sans validation sur robot réel annoncée, et le gain reste à confirmer hors des benchmarks choisis.

Les VLA se diffusent via des poids ouverts et du fine-tuning tiers, ce qui expose la chaîne d'approvisionnement logicielle: un modèle téléchargé ou ajusté par un prestataire peut embarquer un déclencheur dormant. La sécurité des politiques robotiques reste bien moins outillée que celle des modèles de langage. TMT s'inscrit dans cette lacune, au moment où les VLA entrent dans des pilotes industriels. Les prochaines étapes à surveiller sont la publication du code via la page projet des auteurs, des tests sur matériel physique et une évaluation face à des attaques adaptatives conçues pour contourner la détection.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

SWAP : routage pas à pas de politiques d'action pour les modèles vision-langage-action (VLA)

Des chercheurs publient sur arXiv (2610.06926) SWAP, pour StepWise Action Policy Routing, un cadre qui compose dynamiquement plusieurs politiques Vision-Language-Action (VLA) pendant l'exécution d'une tâche de manipulation. Aujourd'hui, la plupart des systèmes reposent sur un seul modèle VLA du début à la fin d'un épisode. SWAP formule le routage comme un problème d'apprentissage par renforcement hors ligne : un « critique de routage » est entraîné à choisir, à chaque pas de décision et selon l'observation courante, la politique la plus adaptée. Le robot peut ainsi changer de politique en cours d'épisode. L'évaluation porte sur des tâches réelles de manipulation sur la plateforme DROID et sur des simulations LIBERO. Face à l'exécution d'une politique fixe et à des méthodes de routage de référence, les auteurs annoncent jusqu'à 33 points de succès supplémentaires en conditions réelles, et une réduction de 28,3 % du nombre de pas d'action des trajectoires réussies. L'enjeu dépasse la performance brute. Le travail s'attaque à une limite que les intégrateurs constatent déjà : aucun VLA n'est le meilleur partout, et les performances varient selon la phase de la tâche et l'environnement. Au lieu d'attendre un modèle généraliste unique, SWAP traite les VLA existants comme une boîte à outils orchestrable, sans réentraîner chacun d'eux. Pour un industriel, cela suggère une voie pragmatique : combiner des politiques spécialisées ou de fournisseurs différents, et ne payer que pour la politique utile à chaque étape. La baisse de la longueur des trajectoires laisse aussi entrevoir un gain de temps de cycle, mais il s'agit d'un nombre de pas d'action, pas d'une durée mesurée en atelier. Il faut aussi rester prudent sur les chiffres : le « jusqu'à 33 % » correspond au meilleur cas, et l'abstract ne précise ni le nombre de tâches ni la taille des échantillons, ni les politiques combinées. Ce résultat s'inscrit dans la course aux modèles fondation pour la manipulation, où des VLA comme Pi-0, GR00T ou Helix sont généralement présentés comme des systèmes autonomes. Le routage entre politiques prolonge les approches de mélange d'experts, mais à l'échelle de politiques complètes et de manière apprise hors ligne. DROID, jeu de données et plateforme de manipulation très utilisé, et LIBERO, banc d'essai en simulation, servent de référence commune, ce qui facilite la comparaison. Il s'agit d'une prépublication v1 non évaluée par les pairs, sans déploiement industriel annoncé. Les prochaines étapes à surveiller : la publication du code, la robustesse du critique face à des environnements inédits, et la latence ajoutée par le routage à chaque pas de décision.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)
2arXiv cs.RO 

SEAM : exécution fluide de mouvements segmentés en actions pour les politiques vision-langage-action (VLA)

Une équipe de recherche publie SEAM (Smooth Execution of Action-Chunked Motion), une méthode d'inférence sans entraînement destinée aux politiques Vision-Language-Action (VLA) à appariement de flux (flow matching), décrite dans un article déposé sur arXiv (2607.04609). Testée sur le benchmark de simulation LIBERO-10 avec le modèle pi0.5 de Physical Intelligence, la méthode réduit de 28% les à-coups (jerk) aux frontières entre segments de trajectoire et de 27% la discontinuité de transition entre ces segments, tout en préservant le taux de réussite des tâches et en ajoutant un coût de calcul quasi nul par rapport à la version non guidée. Son mécanisme central, le Velocity-guided Loss Steering (VLS), exploite le fait que la fin non exécutée du segment précédent reste disponible comme référence de cohérence une fois le préfixe consommé par le robot, et applique une correction analytique après chaque étape d'Euler sans rétropropager dans le réseau. Le problème visé, la bifurcation multimodale, touche toutes les architectures VLA qui découpent leurs actions en segments de longueur fixe pour limiter la fréquence d'inférence, une approche partagée par des modèles comme pi0, GR00T N2 ou Helix. Quand deux segments adjacents, générés à partir de latents gaussiens indépendants, convergent vers des modes de trajectoire incompatibles, le robot produit des à-coups brusques aux jonctions, un symptôme visible de l'écart entre démonstration et exécution réelle. Les solutions existantes, rétropropagation à chaque étape de débruitage, échantillonnage par rejet ou réentraînement complet, imposaient toutes un compromis entre coût de calcul et fiabilité des tâches. Une correction déployable à l'inférence, sans toucher aux poids du modèle, intéresse directement les intégrateurs qui opèrent des politiques VLA figées sur du matériel de production. L'évaluation reste toutefois cantonnée à la simulation LIBERO-10, un banc d'essai standard mais éloigné des conditions réelles d'un bras ou d'un humanoïde en usine. La validation sur matériel physique et l'extension à d'autres politiques que pi_0.5 constituent les étapes naturelles avant toute adoption industrielle.

RechercheActu
1 source
Découpler vision, langage et action pour des politiques robotiques multitâches efficaces
3arXiv cs.RO 

Découpler vision, langage et action pour des politiques robotiques multitâches efficaces

Une équipe de recherche publie sur arXiv (2609.18374v1) une étude qui remet en question l'architecture standard des modèles Vision-Language-Action (VLA), lesquels associent un module d'action à un Vision-Language Model (VLM) de plusieurs milliards de paramètres dont le coût de calcul est payé à chaque pas de contrôle. Les auteurs testent une architecture découplée baptisée Decoupled Embodiment Model (DEM), combinant un encodeur visuel DINOv3 affiné, un encodeur de langage NeoBERT figé, et une tête d'action MeanFlow qui génère chaque segment d'action en un seul passage avant. Dans une expérience contrôlée, à démonstrations, budget d'entraînement, tâches et plateforme de mesure identiques, ce système est comparé à sept modèles VLA de référence, sur 18 tâches de manipulation simulées avec paraphrases linguistiques inédites et scènes randomisées, ainsi que sur trois tâches exécutées avec un robot physique. Résultat: DEM atteint un taux de réussite comparable aux meilleures politiques à backbone VLM, tout en tournant huit à dix-sept fois plus vite en fréquence d'inférence et en consommant six à quinze fois moins d'énergie par inférence. Pour les intégrateurs et les équipes robotique en entreprise, ce résultat pèse directement sur les décisions de déploiement: la latence et la consommation énergétique des VLA massifs limitent leur usage embarqué sur des robots à ressources de calcul contraintes, un frein bien identifié dans l'industrie humanoïde et la manipulation industrielle. En montrant qu'un encodeur vision autonome et un encodeur de langage encoder-only peuvent égaler la compréhension d'un grand VLM sur ces tâches, l'étude questionne l'hypothèse selon laquelle un backbone VLM géant serait indispensable pour obtenir une politique de manipulation multi-tâches performante. Cela ouvre la voie à des politiques moins coûteuses à opérer en production, un argument utile face au décalage régulièrement observé entre démonstrations spectaculaires et robustesse réelle sur le terrain. Les auteurs restent prudents: le gain est mesuré "dans ce périmètre de tâches" et selon leur propre protocole d'évaluation, pas comme une généralisation universelle. Cette publication s'inscrit dans une trajectoire de recherche où la tendance dominante des dernières années consistait à empiler des backbones VLM toujours plus lourds pour gagner en généralisation des politiques robotiques. Le papier renverse partiellement cette logique en s'appuyant sur les progrès récents des encodeurs autonomes, DINOv3 pour la vision et NeoBERT pour le texte, désormais capables de rivaliser avec de grands VLM sur les benchmarks d'embedding visuel et de compréhension du langage. L'étude ne détaille pas précisément l'identité des sept baselines VLA testées ni des tâches réalisées sur robot physique, et ne mentionne aucun calendrier de déploiement industriel: il s'agit à ce stade d'un travail de recherche académique publié en preprint, sans partenaire industriel ni essai pilote annoncés. La suite logique attendue serait une validation sur un plus grand nombre de tâches réelles et une comparaison directe avec les politiques VLA propriétaires déjà déployées commercialement par les acteurs humanoïdes du secteur.

UELes intégrateurs européens de robotique industrielle pourraient s'appuyer sur des politiques VLA moins coûteuses en calcul et en énergie pour des déploiements embarqués, mais aucun acteur ou institution française/européenne n'est cité dans l'étude.

RecherchePaper
1 source
Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques
4arXiv cs.RO 

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques

Une équipe de recherche propose un nouveau modèle baptisé Vision-Language-Policy, ou VLP, destiné à la planification dynamique de tâches robotiques à partir de commandes en langage naturel. Décrit dans un article déposé sur arXiv (2512.19178, version révisée), le système s'appuie sur un modèle vision-langage affiné sur des données réelles, capable d'interpréter des instructions sémantiques et de raisonner sur la scène de travail observée pour générer directement des politiques de comportement pilotant le robot. Les auteurs ont testé leur approche sur plusieurs robots différents et sur une variété de tâches en conditions réelles, démontrant que le modèle peut ajuster sa stratégie en cours d'exécution lorsque les instructions changent, sans nécessiter de replanification complète. Des vidéos de démonstration sont disponibles sur robovlp.github.io. L'article ne précise pas de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom de robot commercial identifiable, ce qui limite l'évaluation de la performance réelle du système face aux standards du secteur. L'intérêt de ce travail réside dans la promesse de généralisation inter-incarnations, c'est-à-dire la capacité d'un même modèle à fonctionner sur des morphologies de robots différentes sans réentraînement spécifique à chaque plateforme. C'est l'un des points durs actuels de l'IA robotique, où les modèles VLA (vision-language-action) peinent souvent à transférer d'un bras ou d'un humanoïde à un autre. Si l'adaptabilité dynamique aux changements de consigne se confirme à plus grande échelle, cela répondrait à une limite classique des architectures de planification traditionnelles, qui séparent rigidement le raisonnement de haut niveau de l'exécution bas niveau et s'adaptent mal aux imprévus. Ce travail s'inscrit dans la lignée des modèles VLA récents comme Pi-0 ou GR00T N2, qui cherchent tous à unifier perception, langage et action dans un même modèle entraîné de bout en bout. Il s'agit ici d'une contribution académique, sans annonce de partenaire industriel ni de déploiement commercial, et la prudence reste de mise tant qu'une validation indépendante sur des benchmarks standardisés n'a pas été publiée.

RechercheActu
1 source