Aller au contenu principal
H-WM : planification de tâches et de mouvements robotiques guidée par un modèle du monde hiérarchique
RecherchearXiv cs.RO 

H-WM : planification de tâches et de mouvements robotiques guidée par un modèle du monde hiérarchique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent H-WM (Hierarchical World Model), un cadre qui prédit conjointement les transitions d'états logiques et visuelles pour guider les modèles Vision-Language-Action (VLA) sur des tâches longues. L'architecture associe deux niveaux. Un modèle de monde logique de haut niveau prédit des actions symboliques et des états fondés sur des prédicats, à la manière de la planification de tâches et de mouvements (TAMP) classique. Un modèle de monde visuel de bas niveau prédit les transitions d'états visuels latents. Ces deux sorties sont injectées dans le VLA comme guidage d'état intermédiaire pendant l'exécution. Les auteurs annoncent des gains constants sur trois benchmarks à horizon long ainsi que sur des robots réels, grâce à une exécution plus stable et à une moindre accumulation d'erreurs. Ils publient aussi LIBERO-Logic, un jeu de données aligné image par image qui associe observations visuelles et états robotiques continus à des actions logiques et à des états logiques à base de prédicats. Il s'agit d'un travail de recherche (arXiv 2602.11291, version 3), sans produit ni déploiement industriel.

L'enjeu touche l'un des principaux points faibles des VLA : la dérive sur les longues séquences. Les modèles de monde fondés sur la prédiction visuelle, latente ou linguistique sont difficiles à relier à des actions exécutables, et leurs erreurs s'accumulent à mesure que l'horizon s'allonge. H-WM suggère qu'une couche symbolique compacte peut servir d'ancrage sans abandonner la perception, une piste hybride entre l'IA symbolique et l'apprentissage de bout en bout. Pour un intégrateur, la leçon est que les séquences d'assemblage ou de logistique en plusieurs étapes pourraient gagner en fiabilité sans réentraîner un VLA complet. La prudence reste de mise. L'extrait ne chiffre ni les gains, ni les VLA de référence, ni la nature des tâches sur robots réels. Les benchmarks de type LIBERO restent des environnements de simulation, et le passage à des cadences industrielles n'est pas démontré.

Ce travail s'inscrit dans la montée des modèles de monde comme brique centrale du contrôle robotique, face aux VLA généralistes de type Pi-0 ou GR00T, qui peinent sur les tâches longues. Il rejoint aussi la renaissance de la planification symbolique couplée aux modèles de fondation. Le jeu de données LIBERO-Logic, étendu à partir du benchmark LIBERO, constitue sans doute la contribution la plus réutilisable, car il offre à d'autres équipes des annotations logiques alignées. La suite dépendra de la généralisation à des scènes ouvertes, de la qualité des prédicats produits automatiquement et du coût d'annotation. Aucun calendrier de pilote n'est annoncé.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Planification des tâches et des mouvements robotiques par invite hiérarchique à double module LLM
1arXiv cs.RO 

Planification des tâches et des mouvements robotiques par invite hiérarchique à double module LLM

Des chercheurs ont publié le 12 mai 2026 sur arXiv (référence 2605.08330) un framework de planification tâche-et-mouvement pour robots de service, reposant sur deux modules LLM distincts organisés en hiérarchie. Le premier module, dit "agent de haut niveau", interprète des commandes en langage naturel et génère des séquences d'actions via un prompt de style ReAct, en s'appuyant sur des outils de perception et de manipulation (pick, place, release). Le second module, dédié au raisonnement spatial de bas niveau, prend en charge les instructions de placement précis, par exemple "pose la tasse à côté de l'assiette", en calculant les positions 3D à partir de la géométrie des objets et de la configuration de la scène. La détection d'objets et l'estimation de pose sont assurées par YOLOX-GDRNet. Sur 24 scénarios de test couvrant des commandes spatiales simples, des instructions de haut niveau et des requêtes infaisables, le système affiche un taux de succès global de 86 %. Cette architecture en deux étages répond à un problème bien connu en robotique de service : un LLM généraliste gère mal simultanément la logique séquentielle des tâches et le raisonnement géométrique fin. Séparer ces deux fonctions réduit la surface d'erreur et rend le système plus robuste aux ambiguïtés spatiales, un point de friction majeur dans les scénarios d'assistance à domicile ou hospitaliers. Le taux de 86 % est encourageant, mais il convient de nuancer : 24 scénarios constituent une base d'évaluation très réduite, et les conditions de test en laboratoire restent éloignées de la variabilité d'un environnement réel non structuré. Aucun robot physique n'est mentionné, le module d'exécution motrice étant décrit comme un "stub", ce qui signifie que les résultats restent pour l'instant purement simulés ou partiellement maquettés. Ce travail s'inscrit dans le prolongement des approches LLM-to-robot popularisées par SayCan de Google (2022) et les travaux RT-2 et OpenVLA, qui ont démontré qu'un modèle de langage peut servir de planificateur de haut niveau pour un robot. La spécificité ici est le découplage explicite du raisonnement spatial dans un sous-module dédié, plutôt que de tout faire porter au modèle principal, une direction cohérente avec les limites documentées des VLA (Vision-Language-Action models) sur les tâches de placement précis. Aucun partenaire industriel ni calendrier de déploiement n'est communiqué ; l'étape suivante logique serait une validation sur robot réel dans un contexte de service structuré.

RechercheOpinion
1 source
Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage
2arXiv cs.RO 

Planification de tâches et de mouvements guidée par la preuve avec des modèles vision-langage

EAFG (Evidence Acquisition and Feasibility Gating), publié sur arXiv le 20 août 2026 (2608.20084v1), est un framework de planification de tâches et de mouvements (TAMP) pilotée par des modèles vision-langage (VLM) pour robots manipulateurs. Face à une instruction longue, comme cuisiner un plat, le VLM peut halluciner la présence d'objets jamais observés et bâtir des sous-objectifs sur ses connaissances a priori plutôt que sur la perception réelle, causant des échecs d'exécution. EAFG fait d'abord explorer le robot, via des sous-objectifs générés par le VLM et exécutés par TAMP, pour recueillir des preuves visuelles ; une porte de faisabilité décide ensuite de planifier, d'explorer davantage, ou d'arrêter. Sur des tâches culinaires à usage d'objets ambigu, EAFG améliore la complétion des recettes en découvrant les objets pertinents avant de planifier, et réduit les tentatives inutiles quand un objet requis est absent, sans chiffres précis publiés. Cette approche cible un point de friction concret pour l'industrialisation des robots manipulateurs pilotés par VLM : l'écart entre la compréhension sémantique d'une instruction et la vérification géométrique et perceptive de sa faisabilité réelle. Pour les intégrateurs opérant en environnement partiellement observable, un robot qui agit sur des suppositions non vérifiées représente un risque opérationnel, en temps perdu ou en échecs silencieux. En séparant explicitement planifier, explorer et arrêter, EAFG remet en question l'hypothèse implicite de nombreux pipelines VLM+TAMP selon laquelle une seule perception de la scène suffit avant de planifier une tâche longue, une piste utile face au fossé persistant entre démonstrations contrôlées et déploiement fiable. EAFG s'inscrit dans la lignée des travaux combinant VLM et planification robotique, un courant structuré notamment autour d'approches comme SayCan, qui traduisent des instructions en langage naturel en séquences d'actions exécutables. Il s'agit ici d'une contribution académique : aucun robot commercial ni déploiement en production n'est mentionné, et le résumé ne précise pas si les expériences culinaires ont été menées sur un robot physique ou en simulation. La suite logique pour ce type de recherche serait une validation sur des tâches plus longues, dans des environnements moins contrôlés que la cuisine, et une comparaison directe avec d'autres pipelines VLM+TAMP sur des benchmarks partagés.

RecherchePaper
1 source
GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues
3arXiv cs.RO 

GraphThink : une planification robotique guidée par un graphe de raisonnement pour les tâches longues

Des chercheurs présentent GraphThink, un nouveau framework de planification pour agents robotiques pilotés par des grands modèles de langage (LLM), détaillé dans un article publié le 7 août 2026 sur arXiv (2608.07905v1). Le système combine deux structures de données : un graphe de tâches (task graph), qui guide le raisonnement du LLM via un prompting contextuel et un raffinement itératif pour limiter les hallucinations de planification, et un graphe de scène (scene graph), qui sert de mémoire environnementale pour déclencher une replanification en boucle fermée dès qu'un événement imprévu survient. L'entraînement du planificateur s'appuie sur GRPO (Group Relative Policy Optimization), avec une conception de récompense calquée sur le graphe de tâches. Sur le benchmark ALFRED, référence standard pour l'exécution de tâches ménagères instruites en langage naturel par un agent virtuel, GraphThink atteint l'état de l'art : son module de haut niveau dépasse les LLM propriétaires accessibles par API, aussi bien sur l'ensemble de validation que sur des tâches longues inédites (held-out long-horizon tasks), avec une bonne généralisation zero-shot et few-shot à des environnements et tâches jamais vus. Ce résultat cible un problème central pour l'industrie de la robotique humanoïde et des agents incarnés : les planificateurs fondés sur des LLM génériques hallucinent souvent des actions physiquement impossibles et perdent en cohérence sur des séquences de tâches longues, un écart classique entre démonstration et usage réel. En ancrant le raisonnement dans une représentation structurée de l'environnement plutôt que dans le seul texte, GraphThink illustre une piste concrète pour fiabiliser les architectures de type VLA (vision-language-action) utilisées par des systèmes comme GR00T N2 ou Helix, sans dépendre uniquement de modèles propriétaires massifs. Il s'agit toutefois d'un résultat de recherche évalué en simulation sur ALFRED, non d'un déploiement sur robot physique. Le champ des planificateurs LLM pour la robotique s'est développé depuis des approches comme SayCan ou Code as Policies, et la comparaison de GraphThink aux LLM API démontre surtout un gain méthodologique en environnement contrôlé ; sa validation sur du matériel réel reste l'étape suivante attendue.

RecherchePaper
1 source
Robot humanoïde : planification dynamique de tâches guidée par LLM et logique temporelle hiérarchique pour le transfert d'objets
4arXiv cs.RO 

Robot humanoïde : planification dynamique de tâches guidée par LLM et logique temporelle hiérarchique pour le transfert d'objets

Des chercheurs proposent un nouveau cadre neuro-symbolique pour piloter des tâches de transfert d'objets (handover) entre plusieurs robots en présence d'humains, en combinant modèles de langage (LLM) et logique temporelle formelle. Le système traduit une instruction humaine en langage naturel en spécifications hiérarchiques de type LTLf (Linear Temporal Logic sur traces finies), puis résout un problème conjoint d'allocation de tâches et de planification, appelé STAP (Simultaneous Task Allocation and Planning). Contrairement aux approches statiques classiques, l'architecture intègre une boucle de planification à horizon glissant (receding horizon planning) couplée à une perception en temps réel, ce qui lui permet de réajuster dynamiquement les plans lorsque l'environnement change, par exemple si une personne se déplace ou modifie sa consigne. Les auteurs rapportent des expériences menées à la fois en simulation et sur des robots réels. Ce travail s'attaque à un problème central pour l'industrie robotique : les LLM permettent aujourd'hui à des non-experts de formuler des tâches complexes en langage naturel, mais les plans générés restent souvent cinématiquement infaisables ou inefficaces sur des horizons longs, faute de garanties formelles. À l'inverse, les méthodes de logique temporelle offrent des garanties de correction et d'optimalité, mais fonctionnent généralement hors-ligne et passent mal à l'échelle. En démontrant un gain mesurable de taux de réussite, de fluidité d'interaction et une réduction du surcoût de replanification par rapport à des méthodes de référence, cette approche illustre une piste concrète pour fiabiliser les systèmes multi-robots collaboratifs en environnement partagé avec des humains, un enjeu direct pour les intégrateurs qui cherchent à dépasser le stade de la démonstration contrôlée. Le papier s'inscrit dans la lignée des travaux cherchant à combiner l'expressivité des LLM avec la rigueur des méthodes formelles de planification, un axe de recherche actif face aux limites connues des architectures purement neuronales de type VLA (vision-language-action) pour les tâches longues et critiques en sécurité. Il s'agit d'une republication (replace) sur arXiv, signe d'une révision par les auteurs ; le texte ne précise pas d'affiliation industrielle ni de calendrier de déploiement commercial, ce qui en fait une contribution de recherche plutôt qu'une annonce produit.

RecherchePaper
1 source