Aller au contenu principal
RecherchearXiv cs.RO 

Recherche, ancrage, planification : suffisance fonctionnelle pour la planification tâche-mouvement avec connaissance incomplète de la scène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GRAB-TAMP est un framework de planification de tâches et de mouvements (TAMP) piloté par des foundation models, capable de traiter des instructions en langage naturel et des observations visuelles. Publié sur arXiv le 22 septembre 2026 sous la référence 2609.23113, avec un code disponible sur GitHub (dépôt Narendhiranv04/GRAB-TAMP), le système recherche dans la scène les entités nécessaires à la tâche, ancre chaque rôle fonctionnel requis à un objet physique valide via des contrôles sémantiques, géométriques et relationnels, puis ne déclenche la planification qu'une fois obtenue une affectation complète établissant ce que les auteurs nomment la "suffisance fonctionnelle". Testé sur 32 variantes de scènes réparties en trois domaines simulés, cuisine, salon et atelier, et sur 200 essais jugés faisables, le système atteint 54,0% de réussite de bout en bout et 67,3% de couverture des objectifs de plan, soit 25,7 points de pourcentage de mieux que la moyenne de trois autres frameworks TAMP concurrents testés dans les mêmes conditions d'exécution.

L'enjeu visé est un angle mort connu des pipelines TAMP pilotés par foundation models: comprendre une instruction en langage ne garantit pas que la scène observée contienne réellement de quoi la réaliser, et la plupart des architectures existantes supposent à tort une connaissance complète de la scène, produisant des plans irréalisables dès que la perception est partielle, un cas fréquent hors laboratoire. En conditionnant la planification à cette vérification préalable, GRAB-TAMP réduit ce risque et améliore nettement le taux de réussite face à des baselines comparables. Un score de 54% en environnement simulé, même en net progrès, montre toutefois que le problème de la connaissance incomplète de la scène reste loin d'être résolu à l'échelle, un repère utile pour les intégrateurs qui évaluent des piles VLA ou des agents de planification fondés sur des LLM avant un déploiement réel plutôt qu'en démonstration contrôlée.

GRAB-TAMP prolonge le TAMP classique, historiquement fondé sur une modélisation symbolique complète de l'environnement, vers des tâches spécifiées par le langage et la vision grâce aux foundation models. L'abstract ne précise ni l'affiliation des auteurs ni les noms des trois frameworks concurrents servant de référence, mais fixe une comparaison à conditions d'exécution identiques, ce qui rend les écarts de performance directement lisibles. Aucun déploiement sur robot physique n'est mentionné: les résultats proviennent uniquement de scènes simulées, sans partenariat industriel ni pilote annoncé à ce stade. La suite passe par la publication du code, ouvrant la voie à une réplication indépendante et à une extension éventuelle vers des scènes ou des robots réels.

Dans nos dossiers

À lire aussi

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
1arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source
Quand les automates rencontrent les flux : compilation de logique temporelle pour la planification tâche-mouvement en robotique
2arXiv cs.RO 

Quand les automates rencontrent les flux : compilation de logique temporelle pour la planification tâche-mouvement en robotique

Une équipe de recherche en robotique présente SAM-TD (Synchronous Action Monitoring with Token Destruction), une méthode de compilation permettant d'imposer des contraintes de logique temporelle linéaire sur traces finies (LTLf) dans la planification tâche-mouvement (TAMP) basée sur les flux, ou "streams". Publiée sur arXiv en aout 2026, l'approche traduit des spécifications LTLf arbitraires en automates, puis intègre des gardes d'automates régressées directement dans les schémas d'action, définis avant le début de la planification. Pendant la recherche de plan, SAM-TD met à jour de façon synchrone l'état de chaque automate et s'appuie sur un jeton de validité partagé entre tous les automates pour élaguer les branches qui violent les contraintes. Les auteurs rapportent ce qu'ils présentent comme la première démonstration de TAMP basée sur des streams sous contraintes LTL_f, testée dans trois environnements robotiques PDDLStream, et affirment que SAM-TD reste compétitif face aux méthodes de référence de compilation de contraintes temporelles sur des benchmarks PDDL discrets classiques. Le TAMP basé sur les streams combine planification symbolique discrète et génération continue de paramètres géométriques (poses, prises, trajectoires) produits à la volée pendant la recherche de solution. Jusqu'ici, ces planificateurs ne vérifiaient que l'atteignabilité d'un objectif, sans garantir de contraintes temporelles comme l'ordre d'exécution critique pour la sécurité, l'invariance ou la liveness, pourtant indispensables sur des tâches à long horizon. Le verrou technique tenait au fait que les streams génèrent un ensemble d'objets géométriques en expansion continue au fil des boucles de raffinement, incompatible avec les techniques existantes de compilation de logique temporelle conçues pour un ensemble d'objets fixe et énumérable. En levant ce verrou sans modifier le planificateur sous-jacent ni exiger d'énumération préalable des objets, SAM-TD ouvre la voie à des architectures capables de respecter des règles de sécurité formelles tout en conservant la flexibilité des générateurs continus, un enjeu direct pour les intégrateurs qui déploient des manipulateurs en environnement partagé avec des humains ou soumis à des contraintes réglementaires strictes. Le cadre PDDLStream, sur lequel s'appuie ce travail, sert de référence académique pour coupler planification classique PDDL et générateurs de paramètres continus en robotique ; les techniques antérieures de compilation de logique temporelle avaient été conçues pour ce contexte discret et supposaient un monde d'objets clos, d'où leur incompatibilité avec les streams. SAM-TD se positionne comme une extension du cadre existant plutôt que comme un nouveau planificateur, ce qui pourrait faciliter son adoption par les équipes déjà équipées d'outils PDDLStream. L'article ne mentionne ni pilote industriel ni calendrier de déploiement sur robot réel : les résultats se limitent à des environnements simulés et à des benchmarks PDDL standards, laissant ouverte la question du passage à l'échelle en conditions réelles.

RecherchePaper
1 source
Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon
3arXiv cs.RO 

Interpréteur vision-langage ancré pour la planification bimanuelle de tâches et mouvements à long horizon

Le laboratoire de recherche Omron Sinic X a publié une version mise à jour sur arXiv d'un article présentant ViLaIn-TAMP, un système hybride de planification pour robots bimanuels. Le framework combine trois briques : un interpréteur vision-langage (ViLaIn, dérivé d'un travail antérieur) qui convertit des entrées multimodales en spécifications structurées au format PDDL, un moteur de planification tâche-et-mouvement (TAMP) qui transforme ces spécifications en séquences de trajectoires concrètes en vérifiant leur faisabilité géométrique et symbolique avant exécution, et un module de planification corrective (CP) qui récupère les retours d'échec moteur et les réinjecte comme contraintes pour affiner la spécification initiale. Les chercheurs ont conçu des tâches de manipulation bimanuelle complexes dans un contexte de cuisine pour évaluer le système. Résultat : ViLaIn-TAMP dépasse de 17,5 points le taux de réussite moyen d'une approche de référence où un modèle vision-langage sert directement de planificateur, et le module correctif ajoute 32,9 points supplémentaires. Le framework a aussi été testé sur un robot physique à deux bras. L'enjeu dépasse la simple performance chiffrée. La quasi-totalité des travaux existants sur la planification pilotée par le langage se limite à des tâches de préhension-dépose à un seul bras, laissant la manipulation bimanuelle, où les sous-tâches sont étroitement interdépendantes et où les collisions inter-bras doivent être gérées explicitement, largement inexplorée. Les modèles vision-langage seuls agissent en boîte noire, sans garanties de sécurité vérifiables, tandis que les planificateurs symboliques classiques offrent ces garanties mais exigent une expertise poussée pour être configurés. En combinant les deux, ViLaIn-TAMP vise à répondre à un besoin concret pour les intégrateurs industriels : obtenir un comportement robotique interprétable et vérifiable avant déploiement, plutôt qu'une démonstration qui échoue silencieusement en conditions réelles. Le travail s'inscrit dans la continuité d'un ViLaIn antérieur, adapté ici pour la planification tâche-et-mouvement complète plutôt que la seule interprétation de scène. Il se positionne explicitement contre les approches où un modèle vision-langage fait office de planificateur de bout en bout, une tendance qui gagne du terrain mais que ces résultats questionnent en matière de fiabilité sur tâches longues et bimanuelles. Le code et les démonstrations sont disponibles sur la page du projet hébergée par Omron Sinic X.

RecherchePaper
1 source
Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles
4arXiv cs.RO 

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles

Des chercheurs présentent dans un preprint arXiv (2605.17593) un cadre de planification baptisé "motion-uncertainty-aware next-best-view" (NBV), destiné à reconstruire en 3D des objets rigides en mouvement planaire avec un robot mobile équipé d'un capteur de profondeur. Le problème central est le délai entre la sélection d'un viewpoint et son exécution : au moment où le robot atteint la position choisie, l'objet a déjà bougé, rendant caduc tout plan basé sur une pose prédite unique. Pour y répondre, chaque viewpoint candidat est évalué non pas sur une position fixe, mais sur l'ensemble des états futurs plausibles de l'objet, modélisés par un lisseur à processus gaussien à fenêtre glissante (fixed-lag Gaussian Process smoother) alimenté par des mesures de position bruitées. Les expériences, menées en simulation et en conditions réelles, montrent une complétude de reconstruction supérieure à celle des planificateurs NBV non-prédictifs et des méthodes de tracking-seul. Ce résultat comble un angle mort documenté de la robotique perceptive : les planificateurs NBV classiques optimisent la couverture de surface en supposant des objets statiques, tandis que les méthodes de perception active orientées mouvement favorisent le suivi au détriment de la qualité de reconstruction. La combinaison des deux dans un seul cadre probabiliste est directement applicable à l'inspection automatisée de pièces sur convoyeur, au contrôle qualité en ligne ou à la génération de jumeaux numériques en environnement dynamique. Traiter le futur comme une distribution d'états plutôt qu'une estimation ponctuelle améliore la robustesse aux perturbations capteurs et aux variations de dynamique que les approches déterministes ne gèrent pas. La planification NBV est un problème actif depuis les années 1990 en robotique perceptive, mais son extension aux objets en mouvement reste peu traitée dans la littérature. L'usage de processus gaussiens pour la prédiction de trajectoire est éprouvé dans d'autres domaines, rarement couplé jusqu'ici à des scores de couverture de surface en contexte NBV. Il s'agit d'un preprint sans évaluation par les pairs à ce stade, sans partenaire industriel ni déploiement annoncé. Les métriques de complétude avancées restent à confirmer sur des dynamiques plus complexes : les expériences actuelles se limitent au mouvement planaire et aux objets rigides. Les extensions naturelles incluent le mouvement 3D non-planaire, les objets déformables et les configurations multi-cibles. Aucun acteur français ou européen n'est impliqué dans cette publication.

RecherchePaper
1 source