Aller au contenu principal
RecherchearXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé.

L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon.

Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

Dans nos dossiers

À lire aussi

GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues
1arXiv cs.RO 

GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues

Des chercheurs présentent GraphThink, un nouveau framework de planification pour agents robotiques pilotés par des grands modèles de langage (LLM), détaillé dans un article publié le 7 août 2026 sur arXiv (2608.07905v1). Le système combine deux structures de données : un graphe de tâches (task graph), qui guide le raisonnement du LLM via un prompting contextuel et un raffinement itératif pour limiter les hallucinations de planification, et un graphe de scène (scene graph), qui sert de mémoire environnementale pour déclencher une replanification en boucle fermée dès qu'un événement imprévu survient. L'entraînement du planificateur s'appuie sur GRPO (Group Relative Policy Optimization), avec une conception de récompense calquée sur le graphe de tâches. Sur le benchmark ALFRED, référence standard pour l'exécution de tâches ménagères instruites en langage naturel par un agent virtuel, GraphThink atteint l'état de l'art : son module de haut niveau dépasse les LLM propriétaires accessibles par API, aussi bien sur l'ensemble de validation que sur des tâches longues inédites (held-out long-horizon tasks), avec une bonne généralisation zero-shot et few-shot à des environnements et tâches jamais vus. Ce résultat cible un problème central pour l'industrie de la robotique humanoïde et des agents incarnés : les planificateurs fondés sur des LLM génériques hallucinent souvent des actions physiquement impossibles et perdent en cohérence sur des séquences de tâches longues, un écart classique entre démonstration et usage réel. En ancrant le raisonnement dans une représentation structurée de l'environnement plutôt que dans le seul texte, GraphThink illustre une piste concrète pour fiabiliser les architectures de type VLA (vision-language-action) utilisées par des systèmes comme GR00T N2 ou Helix, sans dépendre uniquement de modèles propriétaires massifs. Il s'agit toutefois d'un résultat de recherche évalué en simulation sur ALFRED, non d'un déploiement sur robot physique. Le champ des planificateurs LLM pour la robotique s'est développé depuis des approches comme SayCan ou Code as Policies, et la comparaison de GraphThink aux LLM API démontre surtout un gain méthodologique en environnement contrôlé ; sa validation sur du matériel réel reste l'étape suivante attendue.

RecherchePaper
1 source
Quand les automates rencontrent les flux : compilation de logique temporelle pour la planification tâche-mouvement en robotique
2arXiv cs.RO 

Quand les automates rencontrent les flux : compilation de logique temporelle pour la planification tâche-mouvement en robotique

Une équipe de recherche en robotique présente SAM-TD (Synchronous Action Monitoring with Token Destruction), une méthode de compilation permettant d'imposer des contraintes de logique temporelle linéaire sur traces finies (LTLf) dans la planification tâche-mouvement (TAMP) basée sur les flux, ou "streams". Publiée sur arXiv en aout 2026, l'approche traduit des spécifications LTLf arbitraires en automates, puis intègre des gardes d'automates régressées directement dans les schémas d'action, définis avant le début de la planification. Pendant la recherche de plan, SAM-TD met à jour de façon synchrone l'état de chaque automate et s'appuie sur un jeton de validité partagé entre tous les automates pour élaguer les branches qui violent les contraintes. Les auteurs rapportent ce qu'ils présentent comme la première démonstration de TAMP basée sur des streams sous contraintes LTL_f, testée dans trois environnements robotiques PDDLStream, et affirment que SAM-TD reste compétitif face aux méthodes de référence de compilation de contraintes temporelles sur des benchmarks PDDL discrets classiques. Le TAMP basé sur les streams combine planification symbolique discrète et génération continue de paramètres géométriques (poses, prises, trajectoires) produits à la volée pendant la recherche de solution. Jusqu'ici, ces planificateurs ne vérifiaient que l'atteignabilité d'un objectif, sans garantir de contraintes temporelles comme l'ordre d'exécution critique pour la sécurité, l'invariance ou la liveness, pourtant indispensables sur des tâches à long horizon. Le verrou technique tenait au fait que les streams génèrent un ensemble d'objets géométriques en expansion continue au fil des boucles de raffinement, incompatible avec les techniques existantes de compilation de logique temporelle conçues pour un ensemble d'objets fixe et énumérable. En levant ce verrou sans modifier le planificateur sous-jacent ni exiger d'énumération préalable des objets, SAM-TD ouvre la voie à des architectures capables de respecter des règles de sécurité formelles tout en conservant la flexibilité des générateurs continus, un enjeu direct pour les intégrateurs qui déploient des manipulateurs en environnement partagé avec des humains ou soumis à des contraintes réglementaires strictes. Le cadre PDDLStream, sur lequel s'appuie ce travail, sert de référence académique pour coupler planification classique PDDL et générateurs de paramètres continus en robotique ; les techniques antérieures de compilation de logique temporelle avaient été conçues pour ce contexte discret et supposaient un monde d'objets clos, d'où leur incompatibilité avec les streams. SAM-TD se positionne comme une extension du cadre existant plutôt que comme un nouveau planificateur, ce qui pourrait faciliter son adoption par les équipes déjà équipées d'outils PDDLStream. L'article ne mentionne ni pilote industriel ni calendrier de déploiement sur robot réel : les résultats se limitent à des environnements simulés et à des benchmarks PDDL standards, laissant ouverte la question du passage à l'échelle en conditions réelles.

RecherchePaper
1 source
Exploiter les affordances entre objets pour une planification efficace des tâches à contact riche
3arXiv cs.RO 

Exploiter les affordances entre objets pour une planification efficace des tâches à contact riche

Des chercheurs proposent une nouvelle méthode de planification robotique baptisée U-TAMP (Unified Task-and-Motion Planning), détaillée dans un preprint publié le 27 août 2026 sur arXiv (référence 2608.25641v1). Le travail s'attaque à une limite connue des approches classiques de planification tâche-mouvement (TAMP), qui modélisent les objets de façon simplifiée et ignorent des propriétés physiques essentielles (matière, forme, prise possible) pour réussir des tâches impliquant des contacts complexes, comme empoigner ou poser un objet sur un autre. Les auteurs utilisent un modèle vision-langage (VLM) pour générer automatiquement des abstractions des affordances entre objets, c'est-à-dire des contraintes de préhension et de support qui décrivent comment deux objets peuvent interagir physiquement. Ces contraintes enrichissent le domaine de planification pour gérer des objets aux propriétés variables. La méthode a été testée dans des scénarios simulés de rangement de table de cuisine, et comparée à la version originale de U-TAMP ainsi qu'à un planificateur VLM de référence s'appuyant sur le sens commun pour déduire les affordances. Résultat annoncé : un taux de réussite de planification nettement supérieur et des temps de calcul réduits d'un à deux ordres de grandeur par rapport aux méthodes concurrentes. Pour les équipes de recherche en robotique manipulatrice, ce travail illustre une piste alternative à l'apprentissage de bout en bout défendu par les modèles vision-langage-action comme Pi-0 ou GR00T N2 : plutôt que de tout confier à un réseau appris sur des données, il s'agit d'injecter du sens commun physique, via un VLM, dans un moteur de planification symbolique classique, pour gagner en vitesse et en fiabilité sans sacrifier l'interprétabilité. La réduction du temps de planification est particulièrement pertinente pour les tâches longues et séquentielles typiques de l'industrie et du service à la personne. Il faut toutefois noter que ces résultats restent cantonnés à la simulation, sur un seul type de scénario domestique, sans validation sur robot réel ni indication de déploiement industriel. Le TAMP est un champ de recherche établi qui combine raisonnement symbolique et planification de mouvement continue ; ce papier s'inscrit dans la lignée d'un système U-TAMP préexistant, qu'il étend avec la brique VLM pour l'affordance. Les prochaines étapes attendues, non précisées dans l'article, seraient une validation sur plateforme physique et une extension à des tâches de manipulation plus variées que le simple rangement de table.

RecherchePaper
1 source
Relaxations semi-définies pour la planification de mouvement sans collision
4arXiv cs.RO 

Relaxations semi-définies pour la planification de mouvement sans collision

Une équipe de chercheurs a soumis sur arXiv (identifiant 2606.14063) une analyse théorique des relaxations semi-définies (SDP) appliquées à la planification de trajectoires sans collision. Le problème étudié est volontairement élémentaire : un robot ponctuel doit rejoindre une cible en évitant des obstacles sphériques dans R^n, sous contraintes de continuité de trajectoire et avec un coût sur les dérivées au carré. Ce problème est d'abord formulé exactement comme un problème non-convexe sur des courbes polynomiales, puis une relaxation semi-définie naturelle est construite. Les benchmarks montrent un gain de vitesse de 10 à 100 fois par rapport aux solveurs de programmation non-linéaire directs SNOPT et IPOPT, avec une variance des temps de résolution nettement plus faible. La méthode est validée comme fonction de pilotage convexe dans un planificateur RRT pour des trajectoires quadrirotor à snap minimal avec continuité C^4 (jusqu'à la 4e dérivée). Les deux contributions théoriques constituent, selon les auteurs, la première analyse formelle des SDP pour ce problème. La première établit que résoudre la relaxation convexe revient à résoudre globalement un problème de planification connexe dans un espace de dimension potentiellement supérieure, ce qui donne des conditions nécessaires et suffisantes de tightness ainsi qu'une intuition géométrique claire des cas où la relaxation est lâche. La seconde identifie une réduction de symétrie décisive : les tailles des cônes semi-définis positifs (PSD) évoluent linéairement avec le degré polynomial et sont indépendantes de la dimension ambiante, évitant ainsi l'explosion combinatoire typique des méthodes NLP en haute dimension. La planification sans collision reste un verrou fondamental de la robotique, où les solveurs NLP classiques souffrent de sensibilité aux initialisations et de convergence vers des minima locaux sous-optimaux. Des frameworks comme Drake (groupe Tedrake, MIT CSAIL) utilisent déjà des relaxations convexes de type GCS ou DSOS, mais sans les garanties théoriques que ce travail commence à formaliser. L'extension aux obstacles non-sphériques et aux robots articulés à degrés de liberté multiples reste entière, deux généralisations indispensables avant tout déploiement industriel. Des applications en navigation de drones en intérieur ou en planification de mouvement pour bras manipulateurs constituent les prochaines étapes logiques.

RecherchePaper
1 source