Les VLM décrivent mais ne mesurent pas : comprendre les scènes centrées sur les objets pour la manipulation robotique
Une équipe de recherche publie un article arXiv (2609.28184v1) proposant un système de perception modulaire piloté par un modèle vision-langage (VLM) pour la manipulation robotique en environnement inconnu. Partant d'une seule observation RGB-D, le pipeline segmente la scène en régions au niveau objet, les fait annoter sémantiquement par un VLM, puis ancre ces annotations avec les données de profondeur pour construire une représentation centrée sur les objets, indépendante de la tâche à accomplir. Les auteurs ont testé leur approche sur 151 scènes de table (tabletop scènes) et montrent que cette décomposition conserve la qualité sémantique d'un VLM classique tout en améliorant nettement la localisation et l'estimation de profondeur par rapport à une inférence géométrique directe par le VLM seul. La représentation obtenue a ensuite été intégrée à un module de planification de tâches pour piloter l'exécution robotique, en s'appuyant sur des briques logicielles existantes plutôt que sur un modèle entraîné de bout en bout.
Le constat de fond, résumé par le titre même de l'article, cible une faiblesse connue mais rarement quantifiée des VLM appliqués à la robotique: ils décrivent bien une scène mais mesurent mal les distances, positions et profondeurs nécessaires à une prise fiable. Pour les intégrateurs qui misent sur des architectures vision-langage-action pour de la manipulation générique, ce travail confirme qu'il est risqué de confier au VLM la géométrie brute et suggère plutôt une architecture hybride où le modèle gère la sémantique tandis que des capteurs et des méthodes de segmentation classiques gèrent la métrique. C'est un signal utile face à l'engouement actuel pour les modèles VLA supposés tout résoudre en bout en bout: la précision spatiale reste un maillon faible qui nécessite un ancrage explicite plutôt qu'une confiance aveugle dans les sorties du modèle.
Cette publication s'inscrit dans le débat plus large sur l'écart entre les capacités sémantiques impressionnantes des VLM récents et leur fiabilité métrique, un sujet qui traverse actuellement la recherche en robotique de manipulation autant que le développement de robots humanoïdes généralistes. L'article ne présente ni produit commercial ni déploiement industriel: il s'agit d'une contribution méthodologique construite à partir d'approches existantes ("off-the-shelf"), dont la suite logique serait une validation au-delà des scènes de table, sur des environnements moins contraints et des tâches de manipulation plus complexes.
Dans nos dossiers




