Aller au contenu principal
RecherchearXiv cs.RO 

TANDEM : planification tâches et mouvements avec démonstrations à la demande pour affiner efficacement les modèles VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un système baptisé TANDEM (Tamp with As-Needed Demonstrations for Efficient Model fine-tuning), décrit dans un article déposé sur arXiv le 24 septembre 2026 (arXiv:2609.28314v1), combine planification tâche-et-mouvement (TAMP) et téléopération humaine sélective pour collecter des démonstrations robotiques. Le système utilise des modèles vision-langage préentraînés pour étendre à la volée le domaine de planification lorsque celui-ci manque de prédicats ou de compétences, en insérant des "opérateurs magiques" exécutés par un humain via téléopération. Après chaque étape humaine, TANDEM reperçoit la scène pour vérifier que l'effet attendu s'est bien produit avant de reprendre la planification autonome. Sur cinq tâches de manipulation longue durée dépassant les capacités du planificateur TAMP de base, TANDEM collecte 2,9 fois plus de démonstrations qu'une téléopération complète de la tâche, pour un temps d'intervention humaine identique. En affinant un modèle vision-langage-action préentraîné π0.5-DROID avec seulement 20 démonstrations TANDEM par tâche, le taux de succès moyen passe de 0% à 60% sur les cinq tâches testées.

L'intérêt de ces résultats tient au goulot d'étranglement bien identifié dans l'entraînement des modèles fondation robotiques (VLA) : la téléopération humaine, coûteuse et lente, sert aujourd'hui à démontrer des gestes que des planificateurs classiques savent déjà exécuter seuls. En réservant l'intervention humaine aux seules étapes hors de portée du planificateur, TANDEM optimise le ratio données utiles par heure d'opérateur, un paramètre critique pour les laboratoires qui cherchent à faire passer les VLA de la démonstration en conditions contrôlées à des taux de succès exploitables en usine. Le saut de 0% à 60% souligne surtout combien les VLA préentraînés restent dépendants d'un fine-tuning ciblé plutôt que d'un volume brut de données.

Le TAMP est une approche de planification robotique classique, limitée de longue date par des domaines d'action prédéfinis et rigides. TANDEM s'inscrit dans l'écosystème des modèles π0/π0.5 (Physical Intelligence) et du jeu de données DROID, aux côtés d'autres VLA comme GR00T N2 (NVIDIA) ou Helix (Figure), tous confrontés au même défi de mise à l'échelle des données d'entraînement. L'article, tout juste publié, ne précise pas de calendrier de déploiement industriel ni de partenaire pilote.

À lire aussi

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
1arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
DATAFARM : planification des tâches et mouvements alignée sur la distribution pour l'entraînement des modèles vision-langage-action
2arXiv cs.RO 

DATAFARM : planification des tâches et mouvements alignée sur la distribution pour l'entraînement des modèles vision-langage-action

Des chercheurs du PRPL Group ont publié le 14 septembre 2026 sur arXiv (2609.12316v1) DATAFARM, une méthode de planification tâche-mouvement (TAMP) alignée sur la distribution de pré-entraînement pour affiner des modèles vision-langage-action (VLA). Le constat de départ est frappant : les trajectoires TAMP brutes, bien qu'elles exécutent correctement les tâches visées, apportent très peu de gain une fois utilisées pour affiner un VLA déjà pré-entraîné, en raison d'un décalage entre leur distribution comportementale et celle des données de pré-entraînement du modèle. DATAFARM corrige ce décalage en alignant les trajectoires générées sur trois axes du modèle pré-entraîné : la configuration des articulations du robot, le style de mouvement et le profil temporel d'exécution. Testée sur trois tâches de manipulation sur table accessibles à TAMP et une tâche de pliage de linge hors de sa portée, la méthode atteint un taux de réussite moyen de 56,7%, contre seulement 8,3% pour les trajectoires TAMP brutes, se rapprochant des 61,7% obtenus par téléopération humaine. Sur la manipulation d'objets déformables, une tâche située hors de la distribution d'affinage, le modèle affiné conserve 85% de réussite, contre 90% pour le modèle pré-entraîné seul. Ce résultat cible un goulot d'étranglement central pour l'entraînement des modèles fondation en robotique : la collecte de démonstrations de qualité. Pour les intégrateurs et laboratoires qui cherchent à affiner des VLA sans multiplier les sessions de téléopération humaine, coûteuses et difficiles à mettre à l'échelle, DATAFARM montre que la planification automatisée peut redevenir une source de données exploitable, à condition de traiter explicitement l'écart de distribution plutôt que d'utiliser les trajectoires brutes telles quelles. L'étude contredit une hypothèse répandue dans le secteur selon laquelle toute trajectoire réussissant la tâche visée constitue automatiquement une bonne donnée d'entraînement : le succès de la tâche ne suffit pas, la façon dont le mouvement est exécuté compte tout autant. Le maintien d'un taux de réussite élevé sur une tâche totalement hors distribution suggère aussi que cet alignement ne dégrade pas les capacités générales du VLA, un risque fréquent avec un fine-tuning ciblé. La génération de démonstrations reste le principal frein à l'échelle pour les modèles VLA généralistes du type Pi-0, GR00T N2 ou Helix, qui s'appuient sur de vastes corpus de trajectoires collectées majoritairement par téléopération humaine. Le TAMP est utilisé de longue date en robotique classique pour produire des plans d'action vérifiés, mais son adoption pour le fine-tuning de VLA restait jusqu'ici limitée faute de preuve d'efficacité, ce que confirme précisément l'échec documenté des trajectoires TAMP brutes dans cette étude. DATAFARM se présente ainsi comme une alternative complémentaire aux pipelines de données synthétiques par simulation, plutôt qu'un remplacement de la téléopération. Code et détails expérimentaux sont disponibles sur prpl-group.com/datafarm ; à ce stade, le travail reste une publication de recherche, sans déploiement sur des robots commerciaux ni calendrier de mise en production annoncé.

RecherchePaper
1 source
Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement
3arXiv cs.RO 

Utiliser le raisonnement des VLM pour contraindre la planification tâche-mouvement

Des chercheurs proposent une méthode baptisée VIZ-COAST, décrite dans une nouvelle version (v3) d'un article déposé sur arXiv (2510.25548), qui exploite des modèles vision-langage (VLM) pré-entraînés à grande échelle pour améliorer la planification de tâches et de mouvements (TAMP, Task and Motion Planning) en robotique. Le principe repose sur le raisonnement spatial de bon sens de ces VLM pour repérer, avant même de lancer la recherche de plan, les endroits où un plan de haut niveau risque de ne pas se traduire en trajectoire de mouvement continue exécutable. Les auteurs ont testé leur approche sur trois domaines TAMP jugés complexes, en extrayant des contraintes plausibles directement à partir d'images et de descriptions de domaine. Résultat annoncé : une réduction drastique des temps de planification, et dans certains cas une élimination complète des échecs de raffinement (downward refinement), avec une généralisation à un ensemble varié d'instances au sein d'un même domaine plus large. Il s'agit à ce stade d'un travail de recherche publié en prépublication, sans déploiement industriel ni produit commercialisé associé. L'enjeu touche un goulot d'étranglement classique de la planification robotique à long horizon : les plans de tâches sont construits sur une abstraction du monde pour rendre la recherche efficace, mais cette abstraction ne garantit pas qu'un plan valide au niveau symbolique puisse réellement être exécuté par un planificateur de mouvement continu. Quand ce lien (le raffinement descendant) est mauvais, des plans en apparence corrects échouent en cours d'exécution, forçant un replanification coûteuse en temps. Les méthodes existantes ne corrigent ce problème qu'après coup, une fois l'échec constaté, en gaspillant du temps de calcul sur des branches de recherche infaisables. L'apport de VIZ-COAST est de déplacer cette détection en amont, en utilisant le sens commun spatial des VLM comme filtre a priori plutôt que comme diagnostic a posteriori, ce qui rejoint une tendance plus large consistant à injecter les capacités des modèles de fondation vision-langage dans les piles de planification classiques utilisées par l'industrie robotique, notamment pour les systèmes de manipulation et de navigation à long horizon. Le contexte scientifique est celui des limites bien connues du TAMP, où l'écart entre plan symbolique et exécution physique reste un frein à l'autonomie des robots sur des tâches longues et complexes. Les travaux antérieurs cités par les auteurs se contentaient d'encoder les échecs de raffinement en contraintes correctives une fois détectés pendant la planification. VIZ-COAST s'inscrit dans la lignée des approches combinant VLM et robotique symbolique, sans toutefois préciser d'implémentation matérielle, de partenaire industriel ni de calendrier de déploiement : il s'agit pour l'instant d'une validation expérimentale sur des domaines de test, dont la prochaine étape logique serait une évaluation sur des plateformes robotiques réelles.

RecherchePaper
1 source
GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon
4arXiv cs.RO 

GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon

Des chercheurs présentent GAVEL (Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning), décrit dans un preprint arXiv publié en septembre 2026 (arXiv:2609.19315v1). Le système ajoute une couche de vérification aux plans générés par un LLM pour des robots : un graphe modélisant les relations entre objets, les préconditions et effets des actions, et des croyances probabilistes sur la position d'objets non observés, simule chaque action avant exécution et répare directement les violations, sans repasser par le LLM sauf en cas d'erreur sémantique. Sur le benchmark de simulation BEHAVIOR-1K, avec le modèle Qwen3-8B, GAVEL fait passer le taux de réussite de 41,2% à 91,8% sur 100 tâches longues isolées et de 19,9% à 92,6% sur 500 instructions multi-tâches, tout en réduisant d'environ 5,4% la distance de déplacement grâce au raisonnement probabiliste sur la localisation des objets. Le résultat pointe un écart connu de la robotique embarquée : un LLM seul reste fragile dès qu'il doit exécuter un plan long dans un monde partiellement observable, ce qui nourrit le fossé entre démonstrations et déploiements fiables. En déportant la vérification vers un modèle symbolique explicite plutôt que vers des appels répétés au LLM, GAVEL réduit le coût et la latence du replanning, un enjeu concret pour les intégrateurs qui déploient des agents robotiques à grande échelle. L'approche suggère aussi que la seule montée en échelle des LLM ou des architectures vision-langage-action ne suffira pas à garantir la fiabilité du raisonnement long-horizon, et plaide pour des architectures hybrides combinant raisonnement symbolique vérifiable et modèles généralistes. GAVEL s'inscrit dans la lignée des travaux utilisant les LLM comme planificateurs de haut niveau, une approche distincte des modèles vision-langage-action bout-en-bout comme Pi-0, GR00T N2 ou Helix, qui apprennent une politique directe sans couche symbolique séparée. Il reprend des principes de planification classique, préconditions et effets à la manière de PDDL, combinés à la flexibilité d'instruction en langage naturel des LLM modernes. Le travail reste, à ce stade, un résultat validé uniquement en simulation sur BEHAVIOR-1K, sans déploiement sur robot physique ni pilote industriel annoncé ; les auteurs indiquent que la méthode fonctionne aussi bien avec des modèles compacts qu'avec des LLM hébergés de pointe, ouvrant la voie à des tests sur des tâches et plateformes plus variées.

RecherchePaper
1 source