Politiques de scène à base d'agents
Des chercheurs du laboratoire Robotics and Embodied AI de Montréal (Mila, page projet montrealrobotics.ca) publient la deuxième version d'Agentic Scene Policies (ASP), un cadre de contrôle robotique qui vise la généralisation zéro-shot, c'est-à-dire l'exécution d'instructions en langage naturel sur des objets jamais vus, sans entraînement spécifique. ASP unifie, dans un seul espace d'actions « agentique », la localisation des objets et les compétences du robot, via une interface d'outils exposée à un agent. La représentation de la scène en 3D repose sur un modèle vision-langage (VLM), et les compétences s'appuient sur des affordances au niveau des parties d'objets, comme la poignée d'un tiroir ou la fiche d'un chargeur. Cela permet des interactions zéro-shot telles que débrancher un chargeur ou ouvrir un tiroir. Les auteurs affirment que ASP surpasse systématiquement les principaux modèles VLA (vision-langage-action) en zéro-shot lors d'expériences réelles, et présentent une version mobile du cadre pour répondre à des requêtes à l'échelle d'une pièce. Le résumé ne donne ni chiffres de taux de réussite, ni noms des VLA comparés, ni détails sur le robot utilisé. Ces éléments sont à chercher dans le papier complet.
L'intérêt tient au débat entre deux architectures. Les VLA détournent un VLM pour produire des actions de bout en bout, mais leur généralisation à de nouvelles instructions et à de nouveaux objets reste fragile. Les politiques modulaires, qui combinent représentation de scène, planification de mouvement et VLM, sont plus interprétables et donnent de bons résultats zéro-shot. Elles souffrent toutefois de deux faiblesses : une recherche d'objets purement sémantique, sans raisonnement spatial explicite, et des compétences limitées à la saisie et à la navigation de base. ASP s'attaque aux deux. Si l'avantage sur les VLA se confirme sur des protocoles indépendants, cela plaide pour des architectures hybrides, où un agent de langage orchestre des primitives géométriques robustes plutôt que de tout apprendre de bout en bout. Pour les intégrateurs, l'attrait est concret : un système modulaire se diagnostique, se corrige et s'étend en ajoutant des outils, sans réentraîner un modèle de plusieurs milliards de paramètres. Il faut cependant rester prudent. Il s'agit d'un travail académique, non d'un produit, et la comparaison dépend du choix des VLA de référence, de leur réglage et des tâches retenues. Les cadences, la fiabilité sur de longues séries et les modes de défaillance ne sont pas documentés dans le résumé.
Ce travail s'inscrit dans la lignée des approches qui font piloter des robots par des VLM et des LLM, avec des cartes sémantiques 3D et des outils de saisie issus de la vision. En face, les VLA généralistes tels que Pi-0 de Physical Intelligence, GR00T de NVIDIA ou Helix de Figure ont gagné en visibilité, avec une promesse de généralisation encore peu vérifiée hors des environnements d'entraînement. La publication de cette version 2 (une révision d'un papier d'abord soumis en septembre 2025) suggère un travail affiné après relecture. Les prochaines étapes probables sont des tests sur davantage d'objets et de scènes, des comparaisons plus larges avec les VLA récents et une extension de la version mobile à des tâches de longue durée.
Dans nos dossiers




