Aller au contenu principal
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
RecherchearXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés.

Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable.

EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

Dans nos dossiers

À lire aussi

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)
1arXiv cs.RO 

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)

Des chercheurs proposent V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), une méthode qui augmente les modèles VLA (Vision-Language-Action) d'un signal de valeur appris pour améliorer la planification en manipulation robotique. Les VLA encodent perception visuelle, langage et commande motrice pour générer des actions, mais leur comportement purement réactif se dégrade hors distribution d'entraînement ou sur des tâches à horizon long. V-VLAPS ajoute une tête de valeur légère (value head), entraînée sur des trajectoires hors-ligne (offline rollouts), qui prédit les retours Monte Carlo et guide un MCTS (Monte Carlo Tree Search) vers les branches de plus haute valeur. Sur les cinq suites du benchmark LIBERO, V-VLAPS égale la baseline sans valeur au budget de recherche standard ; avec un budget élargi, il la dépasse dans toutes les suites, avec +6 points de pourcentage sur LIBERO-Object et +4 points sur LIBERO-10. L'apport central est de démontrer que les représentations internes des VLA encodent non seulement des informations sur l'échec d'une trajectoire (déjà documenté dans la littérature), mais peuvent aussi estimer la valeur pendant la planification. Cela ouvre une voie pragmatique pour les intégrateurs : renforcer des politiques VLA existantes sans réentraînement complet, par simple ajout d'une tête de valeur et d'un budget de recherche accru. L'analyse révèle toutefois une limite claire : la majorité des échecs durs sont des timeouts au niveau racine, là où les valeurs prédites restent peu différenciées, ce qui plafonne le gain observé et indique que le signal de valeur est encore insuffisamment discriminant en début de trajectoire. Ce travail (préprint arXiv, janvier 2026) s'inscrit dans une série de méthodes cherchant à coupler la puissance générative des VLA modernes (RT-2, OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) avec des mécanismes de planification structurée, face aux approches concurrentes par world models et diffusion planifiante. Les résultats sont obtenus uniquement en simulation sur LIBERO et ne sont pas encore validés sur robot réel, limite classique de ce type de contribution arxiv. La prochaine étape naturelle est une évaluation sim-to-real pour vérifier si le signal de valeur appris se transfère hors simulation, notamment sur des tâches à contacts complexes ou en environnement non structuré.

RechercheOpinion
1 source
GaLa : des modèles vision-langage guidés par hypergraphe pour la planification procédurale
2arXiv cs.RO 

GaLa : des modèles vision-langage guidés par hypergraphe pour la planification procédurale

Une équipe de chercheurs a publié sur arXiv (arXiv:2604.17241) un nouveau framework vision-langage baptisé GaLa, conçu pour améliorer la planification procédurale dans les systèmes d'IA incarnée. Le système repose sur une représentation par hypergraphe : chaque objet détecté dans une scène devient un nœud, tandis que des hyper-arêtes agrègent ces objets selon leurs attributs fonctionnels et leur sémantique pour former des régions cohérentes. GaLa intègre également un encodeur baptisé TriView HyperGraph Encoder, qui impose une cohérence sémantique entre trois niveaux de représentation (vue nœud, vue zone, vue association nœud-zone) via apprentissage contrastif. Les expériences menées sur les benchmarks ActPlan1K et ALFRED montrent des gains significatifs sur le taux de succès d'exécution, le score LCS (Longest Common Subsequence) et la correction des plans générés, sans que les auteurs ne publient de chiffres absolus précis dans le résumé disponible. Ce travail cible un problème bien documenté dans la robotique d'interaction : les VLMs (Vision-Language Models) actuels raisonnent correctement sur du langage et de l'image de façon isolée, mais peinent à saisir les relations spatiales implicites et la hiérarchie fonctionnelle d'une scène réelle. Pour un robot devant exécuter une séquence de tâches domestiques (préparer un repas, ranger des objets), comprendre que le plan de travail et le réfrigérateur appartiennent à la même région fonctionnelle change radicalement la qualité du plan généré. GaLa propose une couche de structuration explicite en amont du raisonnement VLM, ce qui réduit la dépendance aux capacités d'inférence implicite des modèles de fondation et ouvre la voie à une meilleure généralisation sur des scènes non vues. Le benchmark ALFRED, développé par Allen AI, est devenu la référence standard pour évaluer la planification procédurale en environnement simulé domestique, et ActPlan1K cible des scénarios procéduraux plus complexes. La tendance actuelle dans ce sous-domaine consiste à enrichir les VLMs généralistes (GPT-4o, LLaVA, InternVL) avec des modules de représentation structurée, une approche que GaLa pousse plus loin que les travaux précédents via l'hypergraphe. Les concurrents directs incluent des travaux comme SQA3D, EmbodiedScan ou les pipelines VLA (Vision-Language-Action) de Physical Intelligence (pi0) et de Google DeepMind, qui cherchent eux aussi à réduire le gap simulation-réel. GaLa reste pour l'instant un résultat de recherche académique sans déploiement physique annoncé.

RechercheActu
1 source
Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon
3arXiv cs.RO 

Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon

Le laboratoire de recherche Omron Sinic X a publié une version mise à jour sur arXiv d'un article présentant ViLaIn-TAMP, un système hybride de planification pour robots bimanuels. Le framework combine trois briques : un interpréteur vision-langage (ViLaIn, dérivé d'un travail antérieur) qui convertit des entrées multimodales en spécifications structurées au format PDDL, un moteur de planification tâche-et-mouvement (TAMP) qui transforme ces spécifications en séquences de trajectoires concrètes en vérifiant leur faisabilité géométrique et symbolique avant exécution, et un module de planification corrective (CP) qui récupère les retours d'échec moteur et les réinjecte comme contraintes pour affiner la spécification initiale. Les chercheurs ont conçu des tâches de manipulation bimanuelle complexes dans un contexte de cuisine pour évaluer le système. Résultat : ViLaIn-TAMP dépasse de 17,5 points le taux de réussite moyen d'une approche de référence où un modèle vision-langage sert directement de planificateur, et le module correctif ajoute 32,9 points supplémentaires. Le framework a aussi été testé sur un robot physique à deux bras. L'enjeu dépasse la simple performance chiffrée. La quasi-totalité des travaux existants sur la planification pilotée par le langage se limite à des tâches de préhension-dépose à un seul bras, laissant la manipulation bimanuelle, où les sous-tâches sont étroitement interdépendantes et où les collisions inter-bras doivent être gérées explicitement, largement inexplorée. Les modèles vision-langage seuls agissent en boîte noire, sans garanties de sécurité vérifiables, tandis que les planificateurs symboliques classiques offrent ces garanties mais exigent une expertise poussée pour être configurés. En combinant les deux, ViLaIn-TAMP vise à répondre à un besoin concret pour les intégrateurs industriels : obtenir un comportement robotique interprétable et vérifiable avant déploiement, plutôt qu'une démonstration qui échoue silencieusement en conditions réelles. Le travail s'inscrit dans la continuité d'un ViLaIn antérieur, adapté ici pour la planification tâche-et-mouvement complète plutôt que la seule interprétation de scène. Il se positionne explicitement contre les approches où un modèle vision-langage fait office de planificateur de bout en bout, une tendance qui gagne du terrain mais que ces résultats questionnent en matière de fiabilité sur tâches longues et bimanuelles. Le code et les démonstrations sont disponibles sur la page du projet hébergée par Omron Sinic X.

RecherchePaper
1 source
Adaptation de la planification avec pensées vision-langage entrelacées
4arXiv cs.RO 

Adaptation de la planification avec pensées vision-langage entrelacées

Une équipe de recherche présente APIVOT (Adaptive Planning with Interleaved Vision-Language Thoughts), un planificateur pour robots basé sur un modèle vision-langage (VLM), détaillé dans un article publié sur arXiv le 8 juillet 2026 (référence 2607.08024v1). Le système cible la planification à long horizon, c'est-à-dire des tâches robotiques composées de plusieurs étapes successives, comme des scénarios de cuisine impliquant la manipulation d'objets dans un espace contraint. Sa particularité est d'alterner de façon adaptative entre deux types de raisonnement: du texte pour décomposer les objectifs, sélectionner les objets pertinents et séquencer les actions, et des représentations visuelles générées pour imaginer les états futurs de la scène et vérifier en interne si un plan est géométriquement réalisable, notamment en cas d'espace libre limité ou de risque de collision entre objets. Sur des tâches de cuisine à long horizon, APIVOT surpasse à la fois des VLM généralistes et les frameworks de planification existants, avec l'écart de performance le plus marqué dans les environnements les plus contraints spatialement. Ce résultat s'inscrit dans un débat central pour l'industrie robotique: les modèles vision-langage-action (VLA) et les grands VLM généralistes savent-ils vraiment raisonner sur la géométrie d'une scène, ou se contentent-ils d'un raisonnement sémantique de surface qui échoue dès que l'espace se complique. En montrant qu'un module de vérification visuelle interne améliore concrètement le taux de succès et l'efficacité du raisonnement, APIVOT apporte un argument en faveur d'architectures hybrides plutôt que de VLM purement textuels pour la planification robotique, un enjeu direct pour les intégrateurs qui déploient des bras ou robots mobiles autonomes dans des environnements encombrés. L'article se positionne explicitement par rapport aux VLM généralistes et aux frameworks de planification antérieurs, utilisés comme lignes de base de comparaison, sans toutefois nommer de plateforme robotique commerciale précise ni d'acteur industriel. Il s'agit à ce stade d'une contribution de recherche évaluée en simulation ou en environnement contrôlé de cuisine, sans indication de déploiement produit ni de partenariat industriel annoncé; les auteurs présentent le "modality selection" adaptatif comme la piste principale à explorer pour les futurs systèmes de planification robotique.

RecherchePaper
1 source