Aller au contenu principal
Planification à long terme grâce à des politiques bi-niveaux sur des modèles du monde symboliques
RecherchearXiv cs.RO 

Planification à long terme grâce à des politiques bi-niveaux sur des modèles du monde symboliques

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche publie sur arXiv (réf. 2605.15975, mai 2026) BISON, un système de planification robotique à deux niveaux conçu pour résoudre des tâches longue durée impliquant des séquences d'actions complexes. L'architecture repose sur des "bilevel policies" : une politique bas niveau (π^ll), un réseau de neurones entraîné par imitation sur des démonstrations continues, et une politique haut niveau (π^hl), construite à partir d'abstractions symboliques de ces mêmes démonstrations, enrichies par généralisation inductive. Sur les benchmarks étendus MetaWorld, BISON surpasse les méthodes VLA (Vision-Language-Action) et les architectures end-to-end en généralisation à de longues séquences et à des environnements contenant davantage d'objets que ceux vus à l'entraînement. Le chiffre mis en avant : la composante symbolique seule peut résoudre des problèmes impliquant 10 000 objets pertinents en moins d'une minute.

L'enjeu technique sous-jacent est bien connu des équipes de robotique industrielle : l'apprentissage par imitation fonctionne remarquablement bien pour le contrôle fin des manipulateurs, mais ne passe pas à l'échelle dès qu'une tâche exige plusieurs dizaines d'étapes enchaînées. Les VLA de nouvelle génération comme Pi-0 ou les dérivés de RT-2 restent en difficulté sur ce point. BISON propose de ne pas choisir entre les deux paradigmes, mais de les stratifier : le réseau neuronal gère la dextérité physique, le raisonnement symbolique prend en charge la séquence globale. Pour un intégrateur ou un COO industriel, cela signifie potentiellement des robots capables d'exécuter des gammes opératoires longues sans replanification humaine à chaque étape, avec un coût mémoire et temps d'inférence réduit par rapport aux approches monolithiques.

BISON s'inscrit dans un retour discret mais croissant aux approches hybrides neuro-symboliques, en réaction aux limites des architectures entièrement end-to-end qui dominent la littérature depuis 2022. La comparaison directe avec les VLA dans les expériences est un positionnement explicite dans ce débat. Il faut toutefois noter que les évaluations sont réalisées en simulation (MetaWorld), sans validation en environnement physique rapportée à ce stade, ce qui laisse entière la question du sim-to-real gap. La page projet est disponible, aucun calendrier de déploiement réel n'est annoncé.

Dans nos dossiers

À lire aussi

GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon
1arXiv cs.RO 

GAVEL : modèles du monde en graphe pour une planification de tâches LLM vérifiée et efficace à long horizon

Des chercheurs présentent GAVEL (Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning), décrit dans un preprint arXiv publié en septembre 2026 (arXiv:2609.19315v1). Le système ajoute une couche de vérification aux plans générés par un LLM pour des robots : un graphe modélisant les relations entre objets, les préconditions et effets des actions, et des croyances probabilistes sur la position d'objets non observés, simule chaque action avant exécution et répare directement les violations, sans repasser par le LLM sauf en cas d'erreur sémantique. Sur le benchmark de simulation BEHAVIOR-1K, avec le modèle Qwen3-8B, GAVEL fait passer le taux de réussite de 41,2% à 91,8% sur 100 tâches longues isolées et de 19,9% à 92,6% sur 500 instructions multi-tâches, tout en réduisant d'environ 5,4% la distance de déplacement grâce au raisonnement probabiliste sur la localisation des objets. Le résultat pointe un écart connu de la robotique embarquée : un LLM seul reste fragile dès qu'il doit exécuter un plan long dans un monde partiellement observable, ce qui nourrit le fossé entre démonstrations et déploiements fiables. En déportant la vérification vers un modèle symbolique explicite plutôt que vers des appels répétés au LLM, GAVEL réduit le coût et la latence du replanning, un enjeu concret pour les intégrateurs qui déploient des agents robotiques à grande échelle. L'approche suggère aussi que la seule montée en échelle des LLM ou des architectures vision-langage-action ne suffira pas à garantir la fiabilité du raisonnement long-horizon, et plaide pour des architectures hybrides combinant raisonnement symbolique vérifiable et modèles généralistes. GAVEL s'inscrit dans la lignée des travaux utilisant les LLM comme planificateurs de haut niveau, une approche distincte des modèles vision-langage-action bout-en-bout comme Pi-0, GR00T N2 ou Helix, qui apprennent une politique directe sans couche symbolique séparée. Il reprend des principes de planification classique, préconditions et effets à la manière de PDDL, combinés à la flexibilité d'instruction en langage naturel des LLM modernes. Le travail reste, à ce stade, un résultat validé uniquement en simulation sur BEHAVIOR-1K, sans déploiement sur robot physique ni pilote industriel annoncé ; les auteurs indiquent que la méthode fonctionne aussi bien avec des modèles compacts qu'avec des LLM hébergés de pointe, ouvrant la voie à des tests sur des tâches et plateformes plus variées.

RecherchePaper
1 source
Mémoire linguistique explicite pour la planification à long terme dans les modèles vision-langage-action
2arXiv cs.RO 

Mémoire linguistique explicite pour la planification à long terme dans les modèles vision-langage-action

Une équipe de recherche propose sur arXiv (référence 2608.04765) une nouvelle architecture pour les modèles vision-langage-action (VLA), conçue pour améliorer la planification sur des tâches longues et complexes. Le système repose sur un module de mémoire linguistique explicite qui convertit les observations visuelles successives en une séquence textuelle cohérente, dotée d'une logique temporelle. L'architecture est hiérarchique et découplée en deux niveaux : un modèle vision-langage (VLM) de haut niveau, entraîné selon un paradigme de question-réponse visuelle, effectue le raisonnement sémantique et met à jour récursivement la mémoire ainsi que les sous-instructions ; un modèle VLA de bas niveau exécute ensuite le contrôle continu et précis à partir de ces sous-instructions et des observations visuelles. Les auteurs ont évalué la méthode dans plusieurs environnements de simulation, puis mené des expériences de transfert sim-to-real sur une plateforme robotique réelle, sans préciser dans le résumé le type de bras, le payload utilisé, ni le nom de l'institution. L'enjeu dépasse l'amélioration incrémentale : les modèles VLA actuels butent sur les tâches longues car ils sont conditionnés uniquement par l'observation courante, ce qui les rend de fait non-markoviens et sujets à une dérive, les erreurs d'exécution s'accumulant faute de correction en boucle fermée. C'est précisément le fossé entre démonstration et réalité que pointent les critiques des vidéos humanoïdes : enchaîner plusieurs sous-tâches de façon fiable, sans réinitialisation entre chaque étape. En rendant la mémoire du système explicite et interprétable (sous forme de texte plutôt que de vecteurs latents opaques), l'approche offre aussi une traçabilité utile pour le débogage industriel, un point sensible pour des intégrateurs qui doivent comprendre pourquoi un robot échoue en cours de tâche plutôt que se contenter d'un taux de succès global. Ce travail s'inscrit dans une lignée de recherches cherchant à corriger les limites du contrôle bout en bout pur, où le fine-tuning sur l'action tend à dégrader les représentations sémantiques héritées des VLM, un problème documenté sur des familles de modèles comme RT-2, OpenVLA, Pi-0 de Physical Intelligence ou GR00T N2 de Nvidia. D'autres équipes explorent des pistes voisines, mémoire épisodique, planification hiérarchique, modèles du monde, pour traiter le même problème d'horizon long. Publié en août 2026 sous forme de preprint, sans code ni benchmark comparatif détaillé dans le résumé, ce travail reste à ce stade une contribution académique : il faudra des évaluations sur des suites de référence partagées et des tests au-delà du laboratoire pour juger si la mémoire linguistique explicite tient sa promesse de robustesse en conditions réelles.

RechercheOpinion
1 source
RoboHarness : orchestration mémoire de politiques robotiques hétérogènes pour la planification à long terme
3arXiv cs.RO 

RoboHarness : orchestration mémoire de politiques robotiques hétérogènes pour la planification à long terme

Le laboratoire à l'origine de RoboHarness propose un framework unifié qui encapsule des systèmes de contrôle robotique développés indépendamment, qu'il s'agisse de modèles VLA (vision-langage-action), de politiques d'apprentissage par renforcement (RL) ou de planificateurs tâche-et-mouvement (TAMP), sous forme de compétences agentiques réutilisables. L'idée centrale est d'orchestrer ces politiques hétérogènes sans les ré-entraîner conjointement, via une mémoire d'exécution multimodale et des preuves collectées en ligne qui cartographient les limites de capacité de chaque politique. Un composant appelé Memory Bridge récupère les trajectoires d'exécution associées à la politique suivante, estime sa région de distribution "in-distribution", puis guide le robot vers cette zone pour stabiliser les transitions entre politiques. Le système a été testé sur trois benchmarks publics, 500 tâches personnalisées et 135 expériences sur robot réel, avec des gains significatifs en planification zero-shot sur des horizons longs et en robustesse hors distribution. Le problème que RoboHarness cherche à résoudre est structurel pour l'industrie robotique: aucune politique unique, aussi performante soit-elle sur son benchmark d'origine, ne couvre l'ensemble des capacités nécessaires à une tâche longue et complexe. Les méthodes de planification existantes reposent sur des compétences homogènes et prédéfinies, avec une applicabilité fixe, ce qui limite leur capacité à combiner des modèles VLA génériques avec des politiques RL spécialisées ou des planificateurs TAMP plus rigoureux. En proposant un routage conscient des capacités et une décomposition dynamique des tâches, ce travail répond directement à une hypothèse contestée du secteur: qu'un seul modèle généraliste suffirait à couvrir la diversité des tâches robotiques. Pour les intégrateurs et les équipes R&D, cela ouvre la voie à des architectures modulaires où plusieurs politiques spécialisées, potentiellement issues de fournisseurs différents, cohabitent sans réentraînement coûteux. Ce travail s'inscrit dans un contexte de recherche académique, publié sur arXiv fin juillet 2026, plutôt que dans une annonce produit commerciale. Il rejoint un courant de recherche actif sur l'orchestration de politiques robotiques multiples, alors que le secteur voit se multiplier des modèles VLA à vocation généraliste censés unifier perception et action en un seul réseau. RoboHarness prend le contre-pied de cette tendance en misant sur la composition de systèmes hétérogènes plutôt que sur un modèle monolithique unique, un pari qui reste à valider au-delà des benchmarks académiques et des essais en laboratoire, notamment sur la robustesse en conditions industrielles réelles et à plus grande échelle.

RecherchePaper
1 source
Les limites de planification des modèles du monde latents
4arXiv cs.RO 

Les limites de planification des modèles du monde latents

Une étude publiée sur arXiv (2609.39235) cartographie les limites de planification des modèles du monde latents, ces prédicteurs censés permettre à un robot d'« imaginer » l'évolution de son environnement avant d'agir. Les auteurs construisent des prédicteurs conditionnés par l'action sur cinq encodeurs visuels auto-supervisés gelés : V-JEPA 2, V-JEPA 2.1, VideoMAEv2, VideoPrism et DINOv2. Ils les évaluent sur diverses tâches de manipulation Meta-World et sur des interactions réelles tirées de BridgeData V2. Avec des rollouts de cinq pas, longueur d'entraînement du prédicteur, le modèle ne classe correctement les actions que pour des cibles situées 5 à 10 pas de contrôle plus loin, alors que les objectifs des tâches se trouvent à 16 à 53 pas. Un prédicteur 81 fois plus grand ou un entraînement sur des rollouts plus longs n'étendent pas cette portée. L'encodeur, lui, influence la portée et le succès en boucle fermée, V-JEPA 2.1 se montrant le plus régulier. Le point le plus significatif est que cette limite ne vient pas d'une prédiction imparfaite. Avec le vrai simulateur, donc une prédiction parfaite, le succès tombe de 92 % à 41 % lorsque la cible passe de 5 à 20 pas au-delà d'un rollout de cinq pas. Le goulet d'étranglement est donc la structure de la planification, pas seulement la qualité du modèle. Pour des objectifs lointains, l'imagination pure réussit dans 23 % des épisodes, la planification avec retour d'information (MPC) monte à 30 %, un rollout aussi long que la distance à l'objectif atteint 47 %, et des sous-objectifs experts proches atteignent 76 %. Pour les intégrateurs et les équipes R&D, cela tempère l'idée qu'il suffit de grossir le modèle ou les données : il faut des horizons imaginés plus longs ou une décomposition hiérarchique en sous-objectifs. Cela invite aussi à lire avec prudence les démonstrations qui montrent ce que ces modèles réussissent sans préciser à quelle distance se trouvait le but. L'étude arrive alors que les modèles du monde de la famille JEPA, portés par Meta, sont présentés comme une voie vers des robots généralistes, en concurrence avec les approches VLA (vision-langage-action) qui prédisent directement les actions. Les auteurs montrent une complémentarité : dans sa plage de planification, un modèle du monde peut filtrer huit actions proposées par une politique VLA et faire passer son succès de 65 % à 77 % sur 16 tâches. Il s'agit de résultats académiques, en simulation et sur données robotiques existantes, sans déploiement industriel ni produit annoncé. Les suites probables portent sur des rollouts plus longs, des sous-objectifs générés automatiquement et l'intégration à des VLA, sans calendrier précisé.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source