Aller au contenu principal
RecherchearXiv cs.RO 

ProAct-VLM : replanification de tâches vision-langage avant l'échec, avec retour de perception continu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs publie sur arXiv ProAct-VLM, un cadre de planification de tâches pour la manipulation robotique. Il intègre un modèle vision-langage (VLM) dans une boucle de perception en temps réel. Le code et la page projet sont hébergés sur GitHub (moured/ProAct-VLM). Le système surveille l'environnement en continu pendant l'exécution d'une tâche longue et replanifie dès qu'un changement pertinent apparaît, avant que l'action en cours n'échoue. Les auteurs l'ont comparé à plusieurs approches de référence et l'ont testé avec différents VLM comme backbone. Ils rapportent de meilleurs taux de succès et une meilleure efficacité sur des tâches de manipulation dynamiques à long horizon. Le résumé publié ne donne ni chiffres précis, ni nom de robot, ni liste des baselines. Le gain reste donc à vérifier dans le texte complet.

Le problème visé est courant en déploiement : une pièce déplacée, un objet tombé ou un opérateur qui passe suffisent à rendre un plan périmé ou dangereux. Les pipelines à règles, réglés à la main pour des scénarios précis, se généralisent mal en milieu ouvert. Les cadres à base de VLM existants replanifient surtout de façon réactive, après un échec d'exécution ou lors d'un contrôle en fin de tâche. Certains vérifient des conditions avant chaque action, mais ces contrôles ponctuels ne voient pas ce qui change pendant le mouvement. ProAct-VLM propose de passer d'une correction après l'échec à une anticipation pendant l'exécution. Pour un intégrateur, l'enjeu est de réduire les arrêts, les reprises et les risques de collision dans les environnements semi-structurés, comme la logistique ou l'assemblage avec présence humaine. Il faut toutefois rester prudent. Une boucle de perception continue couplée à un VLM pose des questions de latence, de coût de calcul et de fausses alertes qui déclenchent des replanifications inutiles. Le résumé n'en dit rien.

Ce travail s'inscrit dans le mouvement qui utilise les modèles vision-langage comme planificateurs de haut niveau, en complément des politiques VLA (vision-langage-action) qui pilotent directement les actionneurs. Les cadres de replanification réactifs et les vérifications de préconditions constituent les références directes. Ils sont cités comme les limites que ProAct-VLM cherche à dépasser. Il s'agit d'une prépublication (v1) non évaluée par des pairs. On ne sait pas encore si les résultats ont été obtenus en simulation ou sur robot réel, ni sur quelles plateformes. Les prochaines étapes à surveiller sont la publication du code, la reproduction indépendante et des tests sur matériel avec des perturbations réelles.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Adaptation de la planification avec pensées vision-langage entrelacées
1arXiv cs.RO 

Adaptation de la planification avec pensées vision-langage entrelacées

Une équipe de recherche présente APIVOT (Adaptive Planning with Interleaved Vision-Language Thoughts), un planificateur pour robots basé sur un modèle vision-langage (VLM), détaillé dans un article publié sur arXiv le 8 juillet 2026 (référence 2607.08024v1). Le système cible la planification à long horizon, c'est-à-dire des tâches robotiques composées de plusieurs étapes successives, comme des scénarios de cuisine impliquant la manipulation d'objets dans un espace contraint. Sa particularité est d'alterner de façon adaptative entre deux types de raisonnement: du texte pour décomposer les objectifs, sélectionner les objets pertinents et séquencer les actions, et des représentations visuelles générées pour imaginer les états futurs de la scène et vérifier en interne si un plan est géométriquement réalisable, notamment en cas d'espace libre limité ou de risque de collision entre objets. Sur des tâches de cuisine à long horizon, APIVOT surpasse à la fois des VLM généralistes et les frameworks de planification existants, avec l'écart de performance le plus marqué dans les environnements les plus contraints spatialement. Ce résultat s'inscrit dans un débat central pour l'industrie robotique: les modèles vision-langage-action (VLA) et les grands VLM généralistes savent-ils vraiment raisonner sur la géométrie d'une scène, ou se contentent-ils d'un raisonnement sémantique de surface qui échoue dès que l'espace se complique. En montrant qu'un module de vérification visuelle interne améliore concrètement le taux de succès et l'efficacité du raisonnement, APIVOT apporte un argument en faveur d'architectures hybrides plutôt que de VLM purement textuels pour la planification robotique, un enjeu direct pour les intégrateurs qui déploient des bras ou robots mobiles autonomes dans des environnements encombrés. L'article se positionne explicitement par rapport aux VLM généralistes et aux frameworks de planification antérieurs, utilisés comme lignes de base de comparaison, sans toutefois nommer de plateforme robotique commerciale précise ni d'acteur industriel. Il s'agit à ce stade d'une contribution de recherche évaluée en simulation ou en environnement contrôlé de cuisine, sans indication de déploiement produit ni de partenariat industriel annoncé; les auteurs présentent le "modality selection" adaptatif comme la piste principale à explorer pour les futurs systèmes de planification robotique.

RecherchePaper
1 source
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
2arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques
3arXiv cs.RO 

Vision-Langage-Politique : un modèle pour la planification dynamique des tâches robotiques

Une équipe de recherche propose un nouveau modèle baptisé Vision-Language-Policy, ou VLP, destiné à la planification dynamique de tâches robotiques à partir de commandes en langage naturel. Décrit dans un article déposé sur arXiv (2512.19178, version révisée), le système s'appuie sur un modèle vision-langage affiné sur des données réelles, capable d'interpréter des instructions sémantiques et de raisonner sur la scène de travail observée pour générer directement des politiques de comportement pilotant le robot. Les auteurs ont testé leur approche sur plusieurs robots différents et sur une variété de tâches en conditions réelles, démontrant que le modèle peut ajuster sa stratégie en cours d'exécution lorsque les instructions changent, sans nécessiter de replanification complète. Des vidéos de démonstration sont disponibles sur robovlp.github.io. L'article ne précise pas de métriques chiffrées de type charge utile, degrés de liberté ou temps de cycle, ni de nom de robot commercial identifiable, ce qui limite l'évaluation de la performance réelle du système face aux standards du secteur. L'intérêt de ce travail réside dans la promesse de généralisation inter-incarnations, c'est-à-dire la capacité d'un même modèle à fonctionner sur des morphologies de robots différentes sans réentraînement spécifique à chaque plateforme. C'est l'un des points durs actuels de l'IA robotique, où les modèles VLA (vision-language-action) peinent souvent à transférer d'un bras ou d'un humanoïde à un autre. Si l'adaptabilité dynamique aux changements de consigne se confirme à plus grande échelle, cela répondrait à une limite classique des architectures de planification traditionnelles, qui séparent rigidement le raisonnement de haut niveau de l'exécution bas niveau et s'adaptent mal aux imprévus. Ce travail s'inscrit dans la lignée des modèles VLA récents comme Pi-0 ou GR00T N2, qui cherchent tous à unifier perception, langage et action dans un même modèle entraîné de bout en bout. Il s'agit ici d'une contribution académique, sans annonce de partenaire industriel ni de déploiement commercial, et la prudence reste de mise tant qu'une validation indépendante sur des benchmarks standardisés n'a pas été publiée.

RechercheActu
1 source
Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
4arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source