Aller au contenu principal
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
RecherchearXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés.

Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable.

EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

Dans nos dossiers

À lire aussi

DATAFARM : planification des tâches et mouvements alignée sur la distribution pour l'entraînement des modèles vision-langage-action
1arXiv cs.RO 

DATAFARM : planification des tâches et mouvements alignée sur la distribution pour l'entraînement des modèles vision-langage-action

Des chercheurs du PRPL Group ont publié le 14 septembre 2026 sur arXiv (2609.12316v1) DATAFARM, une méthode de planification tâche-mouvement (TAMP) alignée sur la distribution de pré-entraînement pour affiner des modèles vision-langage-action (VLA). Le constat de départ est frappant : les trajectoires TAMP brutes, bien qu'elles exécutent correctement les tâches visées, apportent très peu de gain une fois utilisées pour affiner un VLA déjà pré-entraîné, en raison d'un décalage entre leur distribution comportementale et celle des données de pré-entraînement du modèle. DATAFARM corrige ce décalage en alignant les trajectoires générées sur trois axes du modèle pré-entraîné : la configuration des articulations du robot, le style de mouvement et le profil temporel d'exécution. Testée sur trois tâches de manipulation sur table accessibles à TAMP et une tâche de pliage de linge hors de sa portée, la méthode atteint un taux de réussite moyen de 56,7%, contre seulement 8,3% pour les trajectoires TAMP brutes, se rapprochant des 61,7% obtenus par téléopération humaine. Sur la manipulation d'objets déformables, une tâche située hors de la distribution d'affinage, le modèle affiné conserve 85% de réussite, contre 90% pour le modèle pré-entraîné seul. Ce résultat cible un goulot d'étranglement central pour l'entraînement des modèles fondation en robotique : la collecte de démonstrations de qualité. Pour les intégrateurs et laboratoires qui cherchent à affiner des VLA sans multiplier les sessions de téléopération humaine, coûteuses et difficiles à mettre à l'échelle, DATAFARM montre que la planification automatisée peut redevenir une source de données exploitable, à condition de traiter explicitement l'écart de distribution plutôt que d'utiliser les trajectoires brutes telles quelles. L'étude contredit une hypothèse répandue dans le secteur selon laquelle toute trajectoire réussissant la tâche visée constitue automatiquement une bonne donnée d'entraînement : le succès de la tâche ne suffit pas, la façon dont le mouvement est exécuté compte tout autant. Le maintien d'un taux de réussite élevé sur une tâche totalement hors distribution suggère aussi que cet alignement ne dégrade pas les capacités générales du VLA, un risque fréquent avec un fine-tuning ciblé. La génération de démonstrations reste le principal frein à l'échelle pour les modèles VLA généralistes du type Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus de trajectoires collectées majoritairement par téléopération humaine. Le TAMP est utilisé de longue date en robotique classique pour produire des plans d'action vérifiés, mais son adoption pour le fine-tuning de VLA restait jusqu'ici limitée faute de preuve d'efficacité, ce que confirme précisément l'échec documenté des trajectoires TAMP brutes dans cette étude. DATAFARM se présente ainsi comme une alternative complémentaire aux pipelines de données synthétiques par simulation, plutôt qu'un remplacement de la téléopération. Code et détails expérimentaux sont disponibles sur prpl-group.com/datafarm ; à ce stade, le travail reste une publication de recherche, sans déploiement sur des robots commerciaux ni calendrier de mise en production annoncé.

RecherchePaper
1 source
H-WM : planification de tâches et de mouvements robotiques guidée par un modèle du monde hiérarchique
2arXiv cs.RO 

H-WM : planification de tâches et de mouvements robotiques guidée par un modèle du monde hiérarchique

Des chercheurs proposent H-WM (Hierarchical World Model), un cadre qui prédit conjointement les transitions d'états logiques et visuelles pour guider les modèles Vision-Language-Action (VLA) sur des tâches longues. L'architecture associe deux niveaux. Un modèle de monde logique de haut niveau prédit des actions symboliques et des états fondés sur des prédicats, à la manière de la planification de tâches et de mouvements (TAMP) classique. Un modèle de monde visuel de bas niveau prédit les transitions d'états visuels latents. Ces deux sorties sont injectées dans le VLA comme guidage d'état intermédiaire pendant l'exécution. Les auteurs annoncent des gains constants sur trois benchmarks à horizon long ainsi que sur des robots réels, grâce à une exécution plus stable et à une moindre accumulation d'erreurs. Ils publient aussi LIBERO-Logic, un jeu de données aligné image par image qui associe observations visuelles et états robotiques continus à des actions logiques et à des états logiques à base de prédicats. Il s'agit d'un travail de recherche (arXiv 2602.11291, version 3), sans produit ni déploiement industriel. L'enjeu touche l'un des principaux points faibles des VLA : la dérive sur les longues séquences. Les modèles de monde fondés sur la prédiction visuelle, latente ou linguistique sont difficiles à relier à des actions exécutables, et leurs erreurs s'accumulent à mesure que l'horizon s'allonge. H-WM suggère qu'une couche symbolique compacte peut servir d'ancrage sans abandonner la perception, une piste hybride entre l'IA symbolique et l'apprentissage de bout en bout. Pour un intégrateur, la leçon est que les séquences d'assemblage ou de logistique en plusieurs étapes pourraient gagner en fiabilité sans réentraîner un VLA complet. La prudence reste de mise. L'extrait ne chiffre ni les gains, ni les VLA de référence, ni la nature des tâches sur robots réels. Les benchmarks de type LIBERO restent des environnements de simulation, et le passage à des cadences industrielles n'est pas démontré. Ce travail s'inscrit dans la montée des modèles de monde comme brique centrale du contrôle robotique, face aux VLA généralistes de type Pi-0 ou GR00T, qui peinent sur les tâches longues. Il rejoint aussi la renaissance de la planification symbolique couplée aux modèles de fondation. Le jeu de données LIBERO-Logic, étendu à partir du benchmark LIBERO, constitue sans doute la contribution la plus réutilisable, car il offre à d'autres équipes des annotations logiques alignées. La suite dépendra de la généralisation à des scènes ouvertes, de la qualité des prédicats produits automatiquement et du coût d'annotation. Aucun calendrier de pilote n'est annoncé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)
3arXiv cs.RO 

V-VLAPS : planification guidée par valeur pour les modèles vision-langage-action (VLA)

Des chercheurs proposent V-VLAPS (Value-Guided Vision-Language-Action Planning and Search), une méthode qui augmente les modèles VLA (Vision-Language-Action) d'un signal de valeur appris pour améliorer la planification en manipulation robotique. Les VLA encodent perception visuelle, langage et commande motrice pour générer des actions, mais leur comportement purement réactif se dégrade hors distribution d'entraînement ou sur des tâches à horizon long. V-VLAPS ajoute une tête de valeur légère (value head), entraînée sur des trajectoires hors-ligne (offline rollouts), qui prédit les retours Monte Carlo et guide un MCTS (Monte Carlo Tree Search) vers les branches de plus haute valeur. Sur les cinq suites du benchmark LIBERO, V-VLAPS égale la baseline sans valeur au budget de recherche standard ; avec un budget élargi, il la dépasse dans toutes les suites, avec +6 points de pourcentage sur LIBERO-Object et +4 points sur LIBERO-10. L'apport central est de démontrer que les représentations internes des VLA encodent non seulement des informations sur l'échec d'une trajectoire (déjà documenté dans la littérature), mais peuvent aussi estimer la valeur pendant la planification. Cela ouvre une voie pragmatique pour les intégrateurs : renforcer des politiques VLA existantes sans réentraînement complet, par simple ajout d'une tête de valeur et d'un budget de recherche accru. L'analyse révèle toutefois une limite claire : la majorité des échecs durs sont des timeouts au niveau racine, là où les valeurs prédites restent peu différenciées, ce qui plafonne le gain observé et indique que le signal de valeur est encore insuffisamment discriminant en début de trajectoire. Ce travail (préprint arXiv, janvier 2026) s'inscrit dans une série de méthodes cherchant à coupler la puissance générative des VLA modernes (RT-2, OpenVLA, Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) avec des mécanismes de planification structurée, face aux approches concurrentes par world models et diffusion planifiante. Les résultats sont obtenus uniquement en simulation sur LIBERO et ne sont pas encore validés sur robot réel, limite classique de ce type de contribution arxiv. La prochaine étape naturelle est une évaluation sim-to-real pour vérifier si le signal de valeur appris se transfère hors simulation, notamment sur des tâches à contacts complexes ou en environnement non structuré.

RechercheOpinion
1 source
Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle
4arXiv cs.RO 

Imagine-TAMP : planification des tâches et des mouvements guidée par l'imagination en observabilité partielle

Un cycle de planification robotique conçu pour décider quand observer et quand agir vient d'être détaillé dans un article arXiv publié le 18 septembre 2026 (arXiv:2609.20396v1), intitulé Imagine-TAMP: Imagination-Guided Task and Motion Planning in Partial Observability. Le système cible un problème concret des robots manipulateurs en environnement encombré : quand la position d'un objet cible est partiellement cachée, faut-il chercher un nouvel angle d'observation ou déplacer d'abord l'objet qui obstrue la vue. Imagine-TAMP combine deux mécanismes d'"imagination" : un modèle vision-langage qui met à jour une croyance probabiliste (particle belief) sur la position de la cible en s'appuyant sur des relations de bon sens avec les objets visibles, et un modèle génératif de scène qui estime la géométrie plausible des zones non observées. À partir de ces hypothèses, le système génère plusieurs squelettes de plan symboliques, leur attribue des coûts non uniformes reflétant à la fois l'effort de manipulation et la probabilité de révéler la cible, puis affine le squelette retenu en plan moteur exécuté, avec replanification si de nouvelles observations contredisent la croyance initiale. Dans des scènes d'étagère à points de vue contraints, l'évaluation géométrique non uniforme fait passer le taux de succès de 46,0% à 84,0% par rapport à une approche de référence, et l'ajout du modèle sémantique réduit encore les manipulations et replanifications inutiles. Sur un robot réel, le système complet réduit le temps de planification de 32% comparé à une version n'utilisant que la géométrie. L'enjeu dépasse la démonstration académique : la décision observer-versus-manipuler est un goulot d'étranglement classique pour les robots de logistique et de préparation de commandes travaillant dans des bacs ou étagères encombrés, où les approches TAMP classiques s'appuient sur des coûts symboliques grossiers ou une planification géométrique coûteuse, sans jamais estimer la probabilité qu'une observation révèle réellement la cible. En montrant qu'un modèle vision-langage peut injecter du bon sens dans cette décision avant d'engager un calcul moteur coûteux, les auteurs illustrent une tendance plus large où les VLM servent de couche de raisonnement pour la planification plutôt que de générateur direct d'actions, à la différence des approches VLA comme Pi-0 ou GR00T N2. Le travail s'inscrit dans la lignée du TAMP, qui combine planification symbolique et planification de mouvement continue, en cherchant à corriger sa faiblesse historique face à l'observabilité partielle. Il s'agit d'un preprint, sans validation par les pairs ni partenaire industriel identifié dans le résumé ; les auteurs ne précisent pas de calendrier de suite ni d'extension à d'autres classes de tâches.

RecherchePaper
1 source