Aller au contenu principal
RecherchearXiv cs.RO 

SafeStage : évaluer la sécurité avant, pendant et après la manipulation robotique par modèle vision-langage-action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente SafeStage, un benchmark structuré en trois étapes pour évaluer la sécurité des politiques de manipulation robotique conditionnées par le langage et la vision (VLA), publié sur arXiv (arXiv:2609.21223v1) en septembre 2026. L'outil comprend 97 scénarios de risque conçus spécifiquement pour tester trois phases du cycle de manipulation : les « dangers d'état initial » (relations spatiales ou physiques à résoudre avant de toucher à l'objet cible), la « sécurité pendant l'exécution » (contacts non intentionnels, trajectoires dangereuses, entrées dans des zones interdites, interactions non voulues avec d'autres objets) et les « dangers d'état final » (conditions instables ou dangereuses subsistant après l'achèvement nominal de la tâche). Le benchmark combine des vérifications basées sur les événements et sur l'état du système, et rapporte le taux de succès de la tâche indépendamment des résultats de sécurité propres à chaque étape. Les chercheurs ont testé des politiques VLA à action directe représentatives ainsi que des politiques s'appuyant sur des modèles du monde, dans un protocole commun en boucle fermée.

Le résultat central est qu'une tâche accomplie avec succès coexiste fréquemment avec des violations de sécurité, et que les différentes politiques testées présentent des profils d'échec distincts selon l'étape du cycle concernée. Ce découplage entre succès de tâche et sécurité vient contredire une hypothèse implicite répandue dans le secteur, celle qu'un robot qui termine sa tâche l'a nécessairement fait de manière sûre. Pour les intégrateurs et décideurs industriels évaluant des politiques VLA généralistes en vue d'usages en ligne de production ou en environnement partagé avec des humains, SafeStage offre un outil de diagnostic permettant de localiser précisément quand et comment une politique échoue en matière de sécurité, plutôt que de se fier à un simple taux de réussite de tâche ou à des tests isolés de refus sémantique. Ce constat arrive alors que la course aux politiques VLA généralistes, portée par des familles de modèles comme Pi-0, GR00T ou Helix dans l'écosystème plus large de la manipulation robotique, s'accélère sur la base de démonstrations souvent impressionnantes mais rarement soumises à une évaluation systématique de sécurité en boucle fermée.

Ce travail répond à une lacune des benchmarks existants, généralement centrés soit sur le succès de tâche, soit sur des contraintes physiques isolées, soit sur le refus sémantique de commandes dangereuses, soit sur des dommages physiques déjà constatés après coup, sans permettre de localiser à quel moment précis du cycle de manipulation survient une violation. En proposant un banc d'essai unifié et diagnostique, les auteurs visent un outil réutilisable pour comparer et améliorer les politiques VLA à mesure qu'elles se rapprochent d'un déploiement industriel réel. Le papier ne mentionne ni partenariat commercial ni calendrier de suite : il s'agit à ce stade d'une contribution de recherche académique destinée à la communauté robotique, sans acteur ni déploiement réel annoncé, ce qui la distingue nettement des communiqués marketing habituels du secteur des robots humanoïdes.

Impact France/UE

Ce benchmark académique n'implique aucun acteur français ou européen mais offre un outil générique que des intégrateurs robotiques européens pourraient utiliser pour évaluer la sécurité de politiques VLA avant déploiement industriel.

À lire aussi

Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue
1arXiv cs.RO 

Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue

Une équipe de chercheurs publie sur arXiv (référence 2508.13073, troisième version) une revue systématique consacrée aux modèles Vision-Language-Action (VLA) construits sur de grands modèles vision-langage (VLM) pour la manipulation robotique. Le travail propose une taxonomie en deux familles d'architectures : les modèles monolithiques, déclinés en conception à système unique ou à double système selon le degré d'intégration entre perception et action, et les modèles hiérarchiques, qui séparent explicitement la planification de l'exécution via des représentations intermédiaires interprétables. La revue couvre l'articulation de ces modèles avec l'apprentissage par renforcement, l'optimisation sans réentraînement, l'apprentissage à partir de vidéos humaines et les modèles du monde, et recense les jeux de données et benchmarks du domaine. Les auteurs publient une page de projet mise à jour en continu sur GitHub, sous le compte JiuTian-VL. Contrairement aux annonces produits qui rythment l'actualité de la robotique humanoïde, ce travail ne présente ni déploiement ni chiffre de performance vérifié : c'est un effort de mise en ordre académique, justifié par la fragmentation et les incohérences de taxonomie qui caractérisent aujourd'hui le champ des VLA. Pour les intégrateurs et décideurs B2B, l'intérêt est méthodologique plutôt qu'opérationnel : la distinction entre architectures monolithiques et hiérarchiques donne une grille pour décrypter des offres commerciales qui se réclament du "VLA" sans détailler leur conception interne. La revue rappelle aussi que plusieurs briques restent des chantiers ouverts, mémoire, perception 4D, adaptation efficace, coopération multi-agents, ce qui tempère l'idée qu'un modèle vision-langage-action généraliste serait déjà un problème résolu à l'échelle industrielle. Les VLA se sont imposés ces dernières années comme alternative aux méthodes robotiques à base de règles, jugées incapables de généraliser à des environnements non structurés, en s'appuyant sur des VLM pré-entraînés sur de vastes corpus image-texte. Cette revue s'inscrit dans une production académique croissante qui tente de cartographier un champ où de nombreux laboratoires publient des architectures concurrentes sans convention de classification commune, d'où l'objectif affiché de résoudre les incohérences des taxonomies existantes. Le document ne cite aucun système commercial ni partenaire industriel précis ; il est pensé comme une ressource vivante, régulièrement actualisée, utile pour situer les futures annonces de VLA propriétaires, qu'elles viennent de laboratoires de recherche ou de fabricants de robots humanoïdes, par rapport à l'état de l'art académique.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
2arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue
3arXiv cs.RO 

Modèles vision-langage-action (VLA) pour la robotique aérienne sans pilote et la manipulation bimanuelle : une revue

Une équipe de chercheurs publie sur arXiv (référence 2607.06706, mise en ligne le 7 juillet 2026) une revue de littérature consacrée aux modèles Vision-Language-Action (VLA), ces architectures qui unifient perception visuelle, compréhension du langage naturel et génération d'actions dans un seul modèle de fondation. L'objectif : permettre à un robot d'exécuter une instruction du type "plie la serviette" ou "vole vers le bâtiment rouge" directement à partir d'images caméra, sans étape de programmation intermédiaire. Le travail passe en revue 183 contributions publiées entre 2017 et 2026, organisées selon sept axes : les architectures VLA, les recettes d'entraînement, les représentations d'actions, la coordination bimanuelle (2022-2026), la navigation et le contrôle de drones (2017-2026), l'ancrage du langage dans la perception, et des enjeux transverses comme la mémoire et les modèles du monde. Les auteurs identifient au passage quatorze directions de recherche encore ouvertes dans ces deux domaines. L'intérêt de cette synthèse tient au rapprochement qu'elle opère entre deux champs jusqu'ici traités séparément. La manipulation bimanuelle, où deux bras à 7 degrés de liberté chacun doivent coordonner leurs mouvements pour plier, assembler ou réorienter un objet, sert de banc d'essai le plus exigeant pour les VLA appliqués à la manipulation. Or les auteurs montrent que les stratégies de coordination, les recettes d'entraînement et les représentations d'actions conçues pour ces bras robotiques se transfèrent directement aux drones, confrontés à un défi structurellement similaire : coordonner poussée, attitude et, de plus en plus, commandes de préhenseur à partir d'observations visuelles, sous des contraintes strictes de latence et de charge utile (payload). Pour les intégrateurs et décideurs du secteur robotique, cela suggère qu'un socle technique commun pourrait émerger entre robotique aérienne et manipulation au sol, plutôt que deux écosystèmes cloisonnés. Cette revue s'inscrit dans la montée en puissance des VLA comme cadre dominant de l'apprentissage robotique, portée par leur capacité à hériter des connaissances générales acquises lors d'un pré-entraînement à l'échelle d'Internet, un atout que les approches de contrôle classiques n'offrent pas. En couvrant neuf ans de littérature sur la manipulation bimanuelle et la navigation de drones dans un même cadre d'analyse, le travail offre une cartographie utile pour situer les futures publications et les futurs produits commerciaux dans ce paysage encore mouvant, sans toutefois lui-même annoncer de déploiement ou de système opérationnel nouveau.

RecherchePaper
1 source
LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action
4arXiv cs.RO 

LIBERO-VIFO : évaluer la capacité et la sécurité du suivi de repères visuels dans les modèles vision-langage-action

Un benchmark baptisé LIBERO-VIFO, décrit dans un article arXiv (2608.17600v1) publié comme nouvelle soumission, évalue pour la première fois de façon systématique deux dimensions distinctes des modèles Vision-Language-Action (VLA) : leur capacité à suivre des indices visuels autorisés, et le risque qu'ils suivent des indices visuels non autorisés. Le benchmark définit huit familles de signaux visuels couvrant des formes variées, et structure l'évaluation en quatre protocoles répartis en deux parties. La première partie mesure la compréhension du signal et son exécution correcte lorsqu'il est autorisé. La seconde partie teste ce qui se passe en cas de conflit entre l'instruction en langage naturel et le signal visuel, ainsi qu'en l'absence totale d'instruction verbale. Sept modèles VLA ont été évalués sur ce protocole, complété par des expériences additionnelles sur des scènes instanciées, des configurations jugées critiques pour la sécurité, et un déploiement sur robot réel. Le résultat central est double et contre-intuitif : comprendre un indice visuel ne garantit pas qu'un modèle VLA l'exécute correctement, mais à l'inverse, plusieurs modèles se sont montrés capables d'exécuter une tâche indiquée uniquement par un signal visuel, sans aucune instruction linguistique associée. Cela révèle un angle mort de sécurité resté largement ignoré jusqu'ici : la plupart des benchmarks existants traitent implicitement tout indice visuel comme légitime et ne mesurent que le succès final de la tâche, sans distinguer suivi autorisé et non autorisé. Pour les intégrateurs et décideurs déployant des robots pilotés par VLA en environnement partagé (usine, entrepôt, espace public), cela signifie qu'un marqueur, objet ou geste placé dans la scène par un tiers non habilité pourrait suffire à déclencher une action, en dehors de tout contrôle par instruction verbale. Cela nuance l'hypothèse selon laquelle le canal langage resterait le point de contrôle sûr et unique des architectures VLA. Les auteurs justifient LIBERO-VIFO par les limites des travaux antérieurs, cantonnés à un éventail restreint de formes d'indices et à une évaluation grossière fondée sur le seul succès de tâche, sans jamais interroger la légitimité du signal suivi. Le nom du benchmark suggère un ancrage dans la suite existante LIBERO, utilisée pour l'apprentissage de politiques de manipulation robotique. En couvrant à la fois capacité et sécurité du suivi de signaux visuels, et en confirmant ses constats jusque sur robot réel, ce travail entend établir la "sécurité centrée sur le visuel" comme nouvel axe d'évaluation pour la communauté VLA, aux côtés des travaux déjà existants sur les vulnérabilités liées au langage. Il s'agit à ce stade d'un benchmark académique et non d'un produit ou d'un déploiement industriel.

RechercheActu
1 source