Aller au contenu principal
RecherchearXiv cs.RO 

Refus qui fléchissent : mesurer et prédire la malléabilité des tâches dans les planificateurs VLM incarnés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2609.38971) une étude sur la robustesse des refus de sécurité des VLM (vision-language models) utilisés comme planificateurs de haut niveau pour robots. Le test est simple: placer un seul objet du quotidien dans l'environnement, sans pixel, gradient ni prompt sous contrôle adversarial. Sur 846 tâches qu'un planificateur protégé par une « constitution » (règles de sécurité explicites) refusait initialement, 20,2 % basculent vers l'acceptation avec un ou plusieurs objets, et le nombre d'objets nécessaires varie d'une tâche à l'autre. L'objet n'a pas besoin d'être choisi pour la tâche: des objets tirés d'une liste fixe, sans connaissance de l'environnement ni de l'instruction, contournent la sécurité presque aussi souvent que ceux proposés spécifiquement. Les auteurs prédisent aussi cette vulnérabilité: un score composite de signaux extraits d'un petit VLM open source identifie les tâches « malléables » 2,4 fois plus souvent qu'un tirage aléatoire, sans interroger la cible.

Ce résultat déplace le problème. Les red-teamings existants supposent un attaquant qui optimise le prompt, l'image ou un texte dans la scène, et les benchmarks mesurent si un modèle reconnaît un danger dans une scène figée. Ici, aucun adversaire n'est requis: un simple réarrangement ordinaire de l'environnement peut suffire à lever un refus. Pour un intégrateur, cela contredit l'hypothèse selon laquelle un alignement validé en laboratoire se transfère à des sites inconnus, alors que l'intérêt des VLM planificateurs est justement leur généralisation. L'analyse qualitative indique que la fragilité dépend de la visibilité du danger dans l'instruction et la scène: les tâches dont le risque est peu évident sont les plus contournées. La vulnérabilité est donc une propriété de la tâche, pas seulement du modèle. Les auteurs recommandent d'évaluer cette « malléabilité » tâche par tâche avant déploiement.

Il faut nuancer: il s'agit d'un préprint non évalué par les pairs, mesuré sur un seul type de garde-fou (constitutionnel) et sans que le résumé précise les modèles testés, ni si l'étude a eu lieu en simulation ou sur matériel réel. Le taux de 20,2 % porte sur des tâches déjà refusées, pas sur l'ensemble des requêtes. Le travail s'inscrit dans la montée des architectures où un VLM planifie et des politiques bas niveau exécutent, popularisées par les approches VLA et les modèles de fondation robotiques, et il prolonge les travaux d'attaques adversariales sur ces planificateurs en les remplaçant par des perturbations réalistes. L'étape suivante logique est l'intégration de tests de malléabilité dans les audits de sécurité avant mise en service, notamment pour les déploiements en environnements non contrôlés.

Dans nos dossiers

À lire aussi

PREFAIL : identifier les précurseurs d'échecs dans les tâches robotiques de prise-et-dépose
1arXiv cs.RO 

PREFAIL : identifier les précurseurs d'échecs dans les tâches robotiques de prise-et-dépose

Le fil relatif de l'objet transporte par rapport a son support permet a PREFAIL, une nouvelle méthode présentée sur arXiv (2607.16921v1), d'anticiper les échecs dans les taches de type "lift-and-place" exécutées par manipulation non préhensile, c'est-a-dire sans pince, l'objet étant simplement maintenu par friction sur un support ou un plateau mobile. Les auteurs partent d'un constat opérationnel: accélérer ces mouvements augmente le risque de perte de l'objet, tandis que ralentir la cadence dégradé le temps de cycle, un compromis central pour les lignes de manutention automatisée. En analysant ce mouvement relatif, la méthode détecte les signes précurseurs d'un échec avant qu'il ne survienne. Les chercheurs introduisent aussi un nouveau jeu de données qui identifie précisément le dernier instant d'intervention possible pour chaque manipulation a risque, c'est-a-dire jusqu'a quand une correction reste techniquement réalisable avant que la chute ou le glissement ne devienne inévitable. La méthode est validée a la fois en simulation et sur des données réelles, avec des résultats montrant une amélioration sensible de la précision et de la rapidité de détection par rapport aux approches existantes. Ce travail s'attaque a un angle mort concret de l'automatisation industrielle: la plupart des systèmes de manutention non préhensile, convoyeurs, plateaux, AMR transportant des pièces sans préhension active, fonctionnent aujourd'hui a des vitesses conservatrices précisément parce qu'aucune méthode fiable ne permet d'anticiper un échec en temps réel et d'agir a temps. Une prédiction de précurseurs véritablement actionable, plutôt qu'une simple détection a posteriori, ouvrirait la voie a des cadences plus élevées sans sacrifier le taux de réussite, un enjeu direct pour les intégrateurs et les opérateurs de lignes a haut volume en logistique, assemblage ou tri. La caractérisation du dernier instant d'intervention répond en outre a une limite méthodologique fréquente en recherche robotique: de nombreux travaux antérieurs signalent des échecs sans vérifier si une correction était encore possible au moment de la détection, rendant leurs métriques difficiles a interpréter opérationnellement. Les approches existantes de prédiction d'échec restent, selon les auteurs, limitées par leur sensibilité aux mouvements dynamiques et par une forte dépendance a la structure spécifique de la politique de contrôle utilisée, ce qui nuit a leur transferabilite d'un système a un autre. PREFAIL se positionne comme une alternative plus générique, fondée sur l'observation du mouvement relatif objet-support plutôt que sur l'inspection interne de la politique de commande. L'article ne mentionne aucun déploiement industriel ni partenaire commercial: il s'agit a ce stade d'une contribution de recherche académique, validée en simulation et sur des jeux de données réels contrôles, sans calendrier annonce de transfert vers un produit ou une ligne de production. La publication du dataset associe, qui documente précisément les fenêtres d'intervention, pourrait néanmoins devenir une référence pour comparer les futures méthodes de prédiction d'échec dans la manutention automatisée.

RecherchePaper
1 source
Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
2arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source
REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?
3arXiv cs.RO 

REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?

Des chercheurs ont publié REI-Bench (arXiv:2505.10872), le premier benchmark dédié à évaluer comment les planificateurs de tâches robotiques basés sur des grands modèles de langage (LLM) gèrent les instructions humaines vagues. L'étude porte spécifiquement sur les expressions référentielles (ER), formulations dont le sens dépend du contexte dialogique et de l'environnement immédiat, comme "prends ça" ou "mets-le là-bas". Les expériences montrent que cette ambiguïté fait chuter le taux de succès des planificateurs jusqu'à 36,9 points de pourcentage. L'analyse des cas d'échec révèle que la majorité provient d'objets manquants dans les plans générés : le modèle ne résout pas correctement la référence et omet l'objet cible de la séquence d'actions. Ce résultat est significatif pour les intégrateurs et les équipes qui déploient des robots en environnement non contrôlé. La quasi-totalité des benchmarks existants, et donc des pipelines de planification actuels, supposent des instructions claires et structurées, ce qui correspond à un utilisateur expert. Or, les populations prioritaires pour la robotique de service (personnes âgées, enfants, opérateurs non formés) sont précisément celles qui formulent des instructions les plus ambiguës. La dégradation mesurée n'est pas marginale : un écart de 37 points sur le taux de succès représente un planificateur fonctionnel en labo qui devient inutilisable en conditions réelles. Le papier souligne également que les approches classiques d'atténuation, prompts enrichis, chaînes de pensée (chain-of-thought), apprentissage en contexte (in-context learning), ne suffisent pas à combler cet écart. Pour y répondre, les auteurs proposent une méthode appelée "task-oriented context cognition" : avant de générer le plan d'action, le système produit explicitement une instruction reformulée et désambiguïsée à partir du contexte environnemental et dialogique. Cette approche atteint l'état de l'art sur REI-Bench en surpassant les baselines précitées. Le benchmark s'inscrit dans un effort plus large de la communauté pour combler le fossé entre performances en simulation et déploiement réel, un problème central pour des acteurs comme Boston Dynamics, Agility Robotics ou les startups européennes telles qu'Enchanted Tools, dont les robots humanoïdes devront interagir avec des utilisateurs non techniques. Les prochaines étapes naturelles seraient d'intégrer REI-Bench dans les pipelines d'évaluation de modèles VLA (vision-language-action) comme pi0 ou OpenVLA, où la résolution de références visuelles et linguistiques est un point de friction connu.

UEL'approche de désambiguïsation proposée (task-oriented context cognition) est directement applicable aux équipes européennes développant des robots de service pour utilisateurs non techniques, notamment les startups comme Enchanted Tools dont les humanoïdes devront gérer des instructions vagues d'opérateurs non formés.

RecherchePaper
1 source
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
4arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source