Aller au contenu principal
PDDL-ART : abstraction symbolique autonome par démonstration pour la manipulation robotique à long horizon via modèles vision-langage
RecherchearXiv cs.RO 

PDDL-ART : abstraction symbolique autonome par démonstration pour la manipulation robotique à long horizon via modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La rédaction manuelle de domaines PDDL est un goulot d'étranglement connu de la planification symbolique en robotique, exigeant une expertise spécialisée pour formaliser actions, préconditions et effets : PDDL-ART cherche à déléguer cette tâche à un VLM guidé par une seule démonstration. Pour les intégrateurs visant des tâches multi-étapes complexes, cela laisse entrevoir une planification symbolique reconfigurable sans ingénieur PDDL dédié, combinant la fiabilité des planificateurs classiques et la flexibilité des modèles de fondation, en alternative aux politiques purement end-to-end. Ces résultats restent toutefois ceux d'un preprint non relu par les pairs, obtenus sur un nombre restreint de tâches contrôlées ; le gain de 15 points sur la référence mérite confirmation à plus grande échelle et sur des environnements plus variés.

Une équipe de recherche présente PDDL-ART dans un article publié sur arXiv le 19 août 2026 (arXiv:2608.17146v1), un framework qui automatise la construction de domaines et problèmes PDDL (Planning Domain Definition Language) pour la planification robotique à long horizon. Le système s'appuie sur un modèle vision-langage (VLM) pour générer ces descriptions à partir d'une seule démonstration expert, d'une consigne en langage naturel et d'une bibliothèque de noms d'actions disponibles, sans gabarit de domaine ni fine-tuning. Un pipeline de correction en trois étapes, syntaxique, sémantique puis d'exécution, vérifie la cohérence du résultat, notamment via un ancrage symbolique des prédicats qui mobilise les capacités d'utilisation d'outils du VLM pour un raisonnement géométrique et temporel allant au-delà de la simple lecture d'image. Sur des tâches de maintenance moteur et de manipulation domestique impliquant mémoire et inférence de prédicats abstraits, PDDL-ART atteint un taux de réussite moyen de 93,3 %, contre 78,3 % pour un planificateur de référence basé uniquement sur un VLM.

PDDL structure la planification symbolique depuis la fin des années 1990, mais son adoption a toujours buté sur la difficulté de traduire des observations sensorielles en prédicats exploitables, un problème que les VLM récents dotés de capacités d'appel d'outils permettent d'attaquer différemment. L'article ne cite aucun laboratoire ni entreprise associée au projet, ce qui le situe pour l'instant au stade de recherche académique plutôt que de produit ou de déploiement industriel ; aucun acteur français ou européen n'y figure. La comparaison à un planificateur VLM de référence positionne PDDL-ART face aux approches neuronales pures de la génération actuelle de modèles vision-langage-action, sans calendrier annoncé pour une publication du code ou une suite expérimentale.

À lire aussi

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action
1arXiv cs.RO 

Foresight par apprentissage résiduel pour la manipulation robotique à long horizon avec des modèles vision-langage-action

Le laboratoire de recherche en robotique derrière l'étude "Foresight Residual RL" a publié le 24 juillet 2026 sur arXiv (2607.16506v1) une méthode visant à corriger un défaut connu des politiques Vision-Language-Action (VLA) sur les tâches d'assemblage complexes. Le problème identifié est concret : sur une tâche en trois phases (saisie, déplacement-insertion, rotation) simulant le serrage d'un écrou avec une clé dans l'environnement Isaac Gym, les méthodes classiques de reinforcement learning résiduel appliquées à une politique VLA gelée échouent à enchaîner les sous-tâches correctement, même quand chaque sous-tâche individuelle réussit. La solution proposée, baptisée Foresight Residual RL, entraîne un prédicteur visuel qui estime, à partir d'une image de l'état terminal d'une sous-tâche, la probabilité de succès des sous-tâches suivantes, et utilise cette estimation comme multiplicateur de récompense pour orienter l'apprentissage. Sur la tâche testée, la méthode atteint 85,6% de réussite sur l'ensemble de la séquence, contre 54,5% pour le RL résiduel standard et des résultats inférieurs pour les politiques VLA de base seules. Ce résultat pointe un angle mort largement sous-estimé dans le déploiement industriel des politiques génératives pour la manipulation robotique : optimiser chaque geste isolément ne garantit pas un enchaînement fiable des tâches. Pour les intégrateurs qui envisagent des lignes d'assemblage à tolérances serrées, contact-riche, type ligne électronique ou mécanique de précision, la démonstration confirme un écart persistant entre la performance en démonstration isolée et la performance en séquence réelle, un des points de vigilance recurrents pointés par les acteurs du secteur, sceptiques face aux vidéos promotionnelles de robots humanoïdes. Le fait que le succès par sous-tâche reste inchangé alors que le succès global bondit change la manière de penser l'entraînement : il ne s'agit plus seulement de maximiser un taux de réussite par étape, mais de façonner l'état terminal produit à chaque étape pour qu'il reste exploitable par l'étape suivante, une nuance directement pertinente pour les équipes qui construisent des pipelines d'apprentissage par renforcement sur des bases VLA préentraînées comme Pi-0 ou GR00T. Cette approche s'inscrit dans la lignée des travaux récents combinant politiques VLA préentraînées et affinage par RL résiduel, une stratégie de plus en plus utilisée pour adapter des modèles de manipulation généralistes à des tâches industrielles spécifiques sans réentraîner l'ensemble du modèle. La méthode a été validée uniquement en simulation, sur une tâche mécanique unique et relativement contrainte ; aucune date de transfert vers un robot physique ni de partenariat industriel n'est mentionnée dans l'article. Les auteurs positionnent leurs travaux comme une réponse méthodologique générale au problème d'attribution de crédit sur des horizons longs, un défi que partagent les principaux laboratoires travaillant sur les politiques génératives pour bras robotiques et humanoïdes, de Physical Intelligence à NVIDIA, sans qu'aucun acteur français ou européen ne soit cité dans cette publication.

RecherchePaper
1 source
Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique
2arXiv cs.RO 

Dual mémoire latente dans les modèles vision-langage-action pour la manipulation robotique

Des chercheurs ont publié le 7 juillet 2026 sur arXiv (arXiv:2607.07608v1) un nouveau framework baptisé LaMem-VLA, conçu pour doter les modèles Vision-Language-Action (VLA) d'une mémoire native directement intégrée à leur espace latent de raisonnement. Aujourd'hui, la plupart des VLA prédisent une action à partir de la seule observation courante sous hypothèse markovienne, ce qui les rend peu efficaces sur les tâches longues et dépendantes du temps. LaMem-VLA repose sur quatre composants coordonnés: un "curator" qui organise l'expérience passée en deux coffres mémoire, court terme et long terme; un "seeker" qui interroge ces coffres via la cognition multimodale pour en extraire les preuves pertinentes au contexte; un "condenser" qui reconstruit ces preuves en tokens de mémoire latente compacts; et un "weaver" qui injecte ces tokens avec l'observation et l'instruction courantes dans une seule séquence d'embedding continue. Les auteurs rapportent une supériorité de leur approche sur les benchmarks SimplerEnv et LIBERO, deux références standard pour évaluer la manipulation robotique pilotée par VLA. L'enjeu dépasse la simple performance sur benchmark. Les VLA actuels, qu'ils s'appuient sur des architectures type Pi-0, GR00T N2 ou Helix, butent tous sur une mémoire de travail limitée à la fenêtre d'observation courante, ce qui les fragilise dès qu'une tâche exige de se souvenir d'une action antérieure, par exemple qu'un tiroir a déjà été ouvert. Les solutions existantes, élargir la fenêtre d'observation ou interroger une banque mémoire externe comme contexte auxiliaire, laissent cette mémoire hors de l'espace latent natif du modèle, limitant son intégration au raisonnement multimodal. En rendant la mémoire nativement latente, LaMem-VLA vise à réduire l'écart entre démonstrations courtes réussies en laboratoire et déploiements réels où les séquences de tâches s'étirent, un critère que surveillent de près les intégrateurs industriels évaluant la fiabilité des VLA au delà du simple "pick and place". Ce travail s'inscrit dans une vague de recherche sur la mémoire des VLA, alors que le secteur de la robotique humanoïde et généraliste, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2, Figure avec Helix, cherche à dépasser les tâches courtes démontrées en vidéo pour viser des chaînes d'actions plus longues et industriellement exploitables. Classé "Announce Type: new" sur arXiv et non encore relu par les pairs, le papier ne mentionne aucun déploiement matériel ni partenariat industriel: il s'agit pour l'instant d'une contribution académique validée uniquement en simulation. Les suites attendues, classiques pour ce type de travaux, seraient une validation sur robot physique et une comparaison directe avec les architectures mémoire déjà explorées par les grands laboratoires de robotique généraliste.

RechercheActu
1 source
Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue
3arXiv cs.RO 

Grands modèles vision-langage-action (VLA) pour la manipulation robotique : une revue

Une équipe de chercheurs publie sur arXiv (référence 2508.13073, troisième version) une revue systématique consacrée aux modèles Vision-Language-Action (VLA) construits sur de grands modèles vision-langage (VLM) pour la manipulation robotique. Le travail propose une taxonomie en deux familles d'architectures : les modèles monolithiques, déclinés en conception à système unique ou à double système selon le degré d'intégration entre perception et action, et les modèles hiérarchiques, qui séparent explicitement la planification de l'exécution via des représentations intermédiaires interprétables. La revue couvre l'articulation de ces modèles avec l'apprentissage par renforcement, l'optimisation sans réentraînement, l'apprentissage à partir de vidéos humaines et les modèles du monde, et recense les jeux de données et benchmarks du domaine. Les auteurs publient une page de projet mise à jour en continu sur GitHub, sous le compte JiuTian-VL. Contrairement aux annonces produits qui rythment l'actualité de la robotique humanoïde, ce travail ne présente ni déploiement ni chiffre de performance vérifié : c'est un effort de mise en ordre académique, justifié par la fragmentation et les incohérences de taxonomie qui caractérisent aujourd'hui le champ des VLA. Pour les intégrateurs et décideurs B2B, l'intérêt est méthodologique plutôt qu'opérationnel : la distinction entre architectures monolithiques et hiérarchiques donne une grille pour décrypter des offres commerciales qui se réclament du "VLA" sans détailler leur conception interne. La revue rappelle aussi que plusieurs briques restent des chantiers ouverts, mémoire, perception 4D, adaptation efficace, coopération multi-agents, ce qui tempère l'idée qu'un modèle vision-langage-action généraliste serait déjà un problème résolu à l'échelle industrielle. Les VLA se sont imposés ces dernières années comme alternative aux méthodes robotiques à base de règles, jugées incapables de généraliser à des environnements non structurés, en s'appuyant sur des VLM pré-entraînés sur de vastes corpus image-texte. Cette revue s'inscrit dans une production académique croissante qui tente de cartographier un champ où de nombreux laboratoires publient des architectures concurrentes sans convention de classification commune, d'où l'objectif affiché de résoudre les incohérences des taxonomies existantes. Le document ne cite aucun système commercial ni partenaire industriel précis ; il est pensé comme une ressource vivante, régulièrement actualisée, utile pour situer les futures annonces de VLA propriétaires, qu'elles viennent de laboratoires de recherche ou de fabricants de robots humanoïdes, par rapport à l'état de l'art académique.

RecherchePaper
1 source
PO-PDDL : apprentissage de POMDP symboliques à partir de démonstrations visuelles pour la planification robotique sous incertitude
4arXiv cs.RO 

PO-PDDL : apprentissage de POMDP symboliques à partir de démonstrations visuelles pour la planification robotique sous incertitude

Des chercheurs ont proposé PO-PDDL (arXiv:2606.15654, juin 2026), une formulation symbolique des processus de décision markoviens partiellement observables (POMDP) pour la planification robotique en conditions réelles. Le système étend PDDL, standard de facto en planification symbolique depuis les années 1990, en y intégrant explicitement l'observabilité partielle, la stochasticité des actions et la gestion des croyances (beliefs). Un pipeline d'apprentissage reconstruit automatiquement les trajectoires d'état symbolique latentes à partir de vidéos d'exécution de robot réel, détecte les incohérences entre états inférés et observations visuelles pour localiser les zones d'incertitude perceptive, puis apprend les modèles de transition et d'observation stochastiques correspondants. Les domaines générés sont réutilisables entre tâches et permettent une planification en ligne dans l'espace des croyances. Testée sur des tâches de manipulation longue durée (long-horizon) en environnement physique réel, la méthode surpasse les approches existantes d'apprentissage de modèles PDDL et POMDP, avec un coût de planification significativement réduit. L'apport concret pour les intégrateurs robotiques est de supprimer l'effort d'ingénierie lié à la construction manuelle des modèles POMDP, traditionnellement l'un des verrous de la planification symbolique déployable. Apprendre depuis des vidéos de robots réels plutôt que depuis des simulateurs contourne partiellement le gap sim-to-real qui fragilise nombre d'approches d'apprentissage. La syntaxe PDDL préservée ouvre une voie d'intégration avec des LLM pour la spécification de tâches, un axe actif en recherche (voir LLM+P, ProgPrompt). Le fait que les domaines soient réutilisables et que la planification opère en temps réel sous incertitude perceptive et d'exécution représente un pas vers des architectures neuro-symboliques exploitables hors laboratoire. La planification symbolique butte depuis longtemps sur la difficulté de paramétrer les POMDP pour des environnements physiques réels. Des travaux antérieurs comme FAMA ou LOCM ont progressé sur l'apprentissage de modèles PDDL déterministes, sans traiter simultanément stochasticité et observabilité partielle depuis des observations visuelles brutes. PO-PDDL se positionne aussi face aux politiques de bout en bout (VLA, politiques de diffusion) qui absorbent l'incertitude dans le réseau sans la modéliser explicitement. La lisibilité et débuggabilité du formalisme symbolique restent un argument différenciant pour le déploiement industriel. Il s'agit pour l'instant d'un preprint non évalué par les pairs ; les prochaines étapes naturelles incluent l'évaluation sur des manipulations plus complexes et l'intégration dans des stacks open-source comme ROS 2.

RecherchePaper
1 source