Robot Sensor : préhension guidée par le langage dans des scènes complexes à plusieurs morphologies
Des chercheurs du Intelligent Systems Lab de l'Université de Toronto ont publié SeededGrasp, un nouveau framework de saisie robotique guidée par le langage, capable de fonctionner dans des scènes encombrées avec plusieurs types de robots (multi-embodiment). Plutôt que de demander à un modèle vision-langage (VLM) de prédire directement la prise à effectuer, ce qui limite sa compréhension spatiale, ou d'entraîner un VLM conjointement avec le modèle de saisie, ce qui exige un volume de données et de calcul considérable, l'équipe découple les deux étapes : le VLM se contente de désigner un point d'amorçage (seed point) sur l'objet cible, qui sert ensuite de conditionnement à un modèle de génération de prise léger et spécialisé. Pour entraîner cette architecture, les chercheurs publient également le premier jeu de données de saisie multi-embodiment sur table, comprenant plus de 2,5 millions de prises annotées dans des scènes encombrées. Les résultats expérimentaux font état de 72% de réussite en simulation et 78% en conditions réelles, surpassant les approches de référence existantes. Le code et les données sont disponibles sur le site du projet (uoft-isl.github.io/seeded-grasp).
Pour les intégrateurs et les équipes de recherche en robotique, l'intérêt de SeededGrasp tient à son efficacité en données : en séparant le raisonnement sémantique de haut niveau (comprendre quel objet saisir et pourquoi) de l'exécution géométrique de bas niveau (calculer une prise stable), la méthode évite l'entraînement de bout en bout très coûteux qu'exigent les modèles VLA (vision-langage-action) intégrés. Elle permet aussi de réutiliser le même module de perception sémantique sur différents robots et pinces, un problème récurrent pour l'industrie qui doit aujourd'hui redévelopper des pipelines de saisie spécifiques à chaque plateforme. Le fait que le taux de réussite en réel (78%) dépasse celui en simulation (72%) est notable : il suggère que le découplage limite l'écart classique entre démonstration simulée et déploiement physique, plutôt que de le masquer par une simulation trop favorable.
Cette publication s'inscrit dans un mouvement plus large de recherche sur les modèles vision-langage-action appliqués à la manipulation robotique, aux côtés de travaux comme RT-2, OpenVLA ou les approches de saisie zero-shot guidée par instructions textuelles, qui cherchent toutes à rapprocher la compréhension du langage naturel et le contrôle physique des robots. La contribution principale de SeededGrasp reste ici la mise à disposition ouverte d'un dataset de grande échelle spécifiquement conçu pour la généralisation entre plusieurs types de robots, une ressource rare dans le domaine et qui pourrait accélérer les travaux d'autres laboratoires sur la saisie en environnement encombré. Aucune date de déploiement industriel n'est mentionnée : il s'agit pour l'instant d'une contribution de recherche académique, publiée sur arXiv, sans partenariat commercial annoncé.
Dans nos dossiers




