Découpler planification et contrôle pour des agents instructibles
Une équipe de recherche publie sur arXiv (2608.26788v1) l'article « Decoupling Planning and Control for Instructable Agents », qui présente le système Instruct-to-Act. L'architecture associe un modèle vision-langage (VLM) pré-entraîné, chargé de traduire instructions et observations en plans de haut niveau peu fréquents, à un contrôleur de type « world model » entraîné pour agir en autonomie à haute fréquence à partir de ces instructions. Pour le rendre instructable, les chercheurs relabellisent des trajectoires du contrôleur avec des instructions synthétiques et optimisent conjointement clonage de comportement, récompense et modélisation du monde. Le système est testé sur sept environnements simulés, dont trois multi-agents où des planificateurs VLM coordonnent par le langage pendant que les contrôleurs entraînés agissent comme actionneurs.
Ce travail répond à une limite bien identifiée dans le secteur : les VLM planifient bien à partir d'instructions et d'observations, mais peinent à transformer ces plans en actions fiables et rapides en environnement inconnu, tandis que les contrôleurs « world model » contrôlent vite mais manquent de guidage sur la tâche à accomplir. À espaces d'observation et d'action équivalents, l'approche découplée surpasse de façon constante les variantes contrôleur seul et génération d'action directe par le VLM, tout en gardant un contrôle rapide et en permettant de changer de planificateur VLM sans réentraîner le contrôleur, un atout pour des intégrateurs voulant faire évoluer le « cerveau » sans retoucher les « réflexes » du robot. Elle reste toutefois seulement compétitive, et non systématiquement supérieure, face à des références vision-langage-action (VLA) et RL multi-agent solides, sur six tâches sur sept.
Il s'agit d'un article de recherche, non d'une annonce produit : le résumé ne cite aucune entreprise ni robot commercial, et les sept environnements testés sont simulés, sans déploiement sur matériel réel évoqué. La démarche rejoint une tendance de l'apprentissage robotique consistant à séparer un raisonnement lent de haut niveau d'un contrôle réactif rapide, déjà explorée par des systèmes industriels comme Helix chez Figure ou GR00T N2 chez Nvidia. Aucun pilote ni calendrier vers des robots physiques n'est mentionné : la contribution porte sur la méthodologie et sa capacité à généraliser entre plusieurs bancs d'essai simulés.
Dans nos dossiers




