Recherche, ancrage, planification : suffisance fonctionnelle pour la planification tâche-mouvement avec connaissance incomplète de la scène
GRAB-TAMP est un framework de planification de tâches et de mouvements (TAMP) piloté par des foundation models, capable de traiter des instructions en langage naturel et des observations visuelles. Publié sur arXiv le 22 septembre 2026 sous la référence 2609.23113, avec un code disponible sur GitHub (dépôt Narendhiranv04/GRAB-TAMP), le système recherche dans la scène les entités nécessaires à la tâche, ancre chaque rôle fonctionnel requis à un objet physique valide via des contrôles sémantiques, géométriques et relationnels, puis ne déclenche la planification qu'une fois obtenue une affectation complète établissant ce que les auteurs nomment la "suffisance fonctionnelle". Testé sur 32 variantes de scènes réparties en trois domaines simulés, cuisine, salon et atelier, et sur 200 essais jugés faisables, le système atteint 54,0% de réussite de bout en bout et 67,3% de couverture des objectifs de plan, soit 25,7 points de pourcentage de mieux que la moyenne de trois autres frameworks TAMP concurrents testés dans les mêmes conditions d'exécution.
L'enjeu visé est un angle mort connu des pipelines TAMP pilotés par foundation models: comprendre une instruction en langage ne garantit pas que la scène observée contienne réellement de quoi la réaliser, et la plupart des architectures existantes supposent à tort une connaissance complète de la scène, produisant des plans irréalisables dès que la perception est partielle, un cas fréquent hors laboratoire. En conditionnant la planification à cette vérification préalable, GRAB-TAMP réduit ce risque et améliore nettement le taux de réussite face à des baselines comparables. Un score de 54% en environnement simulé, même en net progrès, montre toutefois que le problème de la connaissance incomplète de la scène reste loin d'être résolu à l'échelle, un repère utile pour les intégrateurs qui évaluent des piles VLA ou des agents de planification fondés sur des LLM avant un déploiement réel plutôt qu'en démonstration contrôlée.
GRAB-TAMP prolonge le TAMP classique, historiquement fondé sur une modélisation symbolique complète de l'environnement, vers des tâches spécifiées par le langage et la vision grâce aux foundation models. L'abstract ne précise ni l'affiliation des auteurs ni les noms des trois frameworks concurrents servant de référence, mais fixe une comparaison à conditions d'exécution identiques, ce qui rend les écarts de performance directement lisibles. Aucun déploiement sur robot physique n'est mentionné: les résultats proviennent uniquement de scènes simulées, sans partenariat industriel ni pilote annoncé à ce stade. La suite passe par la publication du code, ouvrant la voie à une réplication indépendante et à une extension éventuelle vers des scènes ou des robots réels.
Dans nos dossiers




