Kitchen Robotic Manipulation utilisant des modèles fondation
Un pipeline de perception modulaire pour la manipulation robotique en cuisine, dédié notamment au tri de la vaisselle, vient d'être détaillé dans un article publié sur arXiv (2608.04042) par l'équipe RAIVLab. Le système enchaîne détection d'objets en vocabulaire ouvert, segmentation multi-vues, reconstruction 3D par instance, puis fusion de caractéristiques 2D-3D pour l'estimation de pose en 6D et la planification de préhension. Sa conception modulaire permet de substituer librement les modèles de fondation visuels et géométriques utilisés à chaque étage. Après une évaluation extensive, la combinaison la plus performante identifiée associe LLMDet pour la détection, SAMv2 pour la segmentation, DINOv2 pour l'extraction de caractéristiques et GeoTransformer pour le recalage géométrique. Sur un benchmark maison de 20 scènes de cuisine encombrées et partiellement occultées, cette configuration atteint un score ADI de 89,12%. Les auteurs ont aussi testé le système sur un robot physique, avec deux tâches concrètes : le transfert de vaisselle de l'évier au lave-vaisselle et l'empilement de tasses, sans réentraînement spécifique à l'environnement testé.
Pour l'industrie robotique, l'intérêt tient moins à la performance brute, mesurée sur un benchmark propriétaire donc non directement comparable à d'autres travaux, qu'à la démonstration qu'un assemblage de modèles de fondation "sur étagère" peut généraliser sans réentraînement à un nouvel environnement domestique encombré. C'est un point sensible pour les intégrateurs qui cherchent à déployer des robots de service en cuisine ou en restauration collective : la robustesse à l'occlusion et au désordre reste l'un des principaux obstacles entre démonstration en laboratoire et usage réel. En proposant une architecture modulaire plutôt qu'une politique bout en bout, l'équipe offre aussi une méthodologie réutilisable pour comparer objectivement les modèles de vision et de géométrie disponibles, un exercice rarement mené de façon aussi systématique.
Ce travail s'inscrit dans la vague plus large des modèles de fondation appliqués à la robotique, où des architectures comme SAM ou DINO, conçues au départ pour la vision générique, sont réutilisées comme briques de perception dans des pipelines de manipulation, en complément des politiques de bout en bout de type VLA telles que Pi-0 ou GR00T N2. Contrairement à ces dernières, qui apprennent directement une politique d'action, cette approche se concentre sur la perception et l'estimation de pose en amont de la préhension. Publié en preprint sans mention de partenariat industriel, le projet met à disposition son code et ses données sur GitHub, une étape qui devra être suivie d'une validation sur un éventail plus large de tâches et d'environnements avant d'envisager un usage industriel.
Dans nos dossiers




