
PROBE : questions-réponses visuelles ancrées dans la manipulation avec des agents VLM
Publié le 19 août 2026 sur arXiv (2608.17129), le framework PROBE évalue et entraîne des VLM capables de manipuler des objets pour répondre à des questions visuelles, une tâche formalisée sous le nom de Manipulation-Grounded Visual Question Answering (MG-VQA). Les auteurs construisent PROBE-Sim, un simulateur de table avec objets du quotidien et un bras doté d'outils de préhension et de poussée, puis PROBE-Bench : 150 tâches en six types de questions sur des scènes encombrées, où les méthodes agentiques à base d'outils battent la perception seule de 8,0% en moyenne. Le finetuning PROBE-Agent, qui distille les trajectoires d'un grand modèle enseignant vers un modèle open-weight plus petit, porte ce gain à 11,5%, avec généralisation à des objets inédits et une première validation sim-to-real sur table réelle.
Ce travail pointe une limite peu documentée des VLM actuels : performants en ancrage 2D et raisonnement spatial sur des scènes statiques, ils peinent dès qu'une action de manipulation modifie la scène à interpréter. Pour les concepteurs de modèles vision-language-action et les intégrateurs de robotique de service, cela suggère que le reality gap ne se limite pas au contrôle moteur mais touche aussi le raisonnement visuel, longtemps jugé résolu par des benchmarks statiques. Les gains chiffrés restent des moyennes internes sur des tâches hétérogènes et valent comme signal directionnel plutôt que comme mesure absolue ; ils indiquent néanmoins qu'une brique de raisonnement dynamique manipulation-perception se rapproche, condition préalable à des robots d'assistance à domicile ou d'inventaire en entrepôt capables de gérer du désordre réel.
PROBE s'inscrit dans la continuité des travaux combinant VLM et usage agentique d'outils, actif depuis que ces modèles ont démontré de solides capacités de planification sur des scènes fixes. Il s'agit d'une contribution académique publiée sur arXiv, évaluée majoritairement dans PROBE-Sim, avec une validation réelle limitée à des environnements de table contrôlés plutôt qu'à un déploiement domestique effectif. Le choix de distiller un grand modèle enseignant vers un modèle open-weight plus petit suit une pratique courante en robotique, où le coût d'inférence embarqué pousse à compresser des modèles de fondation volumineux, sans calendrier de déploiement ni partenaire industriel annoncé.
Dans nos dossiers




