FunArt : décoder la structure fonctionnelle et l'articulation à partir de latents 3D génératifs
Des chercheurs ont publié en septembre 2026 sur arXiv (2609.20673v1) un framework baptisé FunArt, conçu pour permettre à des robots d'identifier des objets articulés (portes, tiroirs, couvercles) à partir d'une seule prise de vue RGB-D statique, sans interaction physique préalable. Le système reconstruit la géométrie des objets observés, la convertit dans la représentation O-Voxel du modèle génératif 3D TRELLIS.2, et exploite le VAE figé à compression parcimonieuse de ce dernier comme a priori structurel. Un décodeur léger à base de requêtes combine ensuite des latents compacts au niveau de l'objet avec des caractéristiques denses alignées sur la surface, pour segmenter conjointement les parties mobiles et les éléments fonctionnels interactifs (poignées, boutons) tout en estimant le type de mouvement, l'axe, l'origine et l'amplitude de rotation ou translation. Évalué sur le jeu de données Articulate3D, FunArt établit un nouvel état de l'art sur trois tâches (segmentation des parties mobiles, estimation de l'articulation, segmentation des éléments fonctionnels), avec ou sans connaissance préalable de l'objet. En configuration de bout en bout, les gains rapportés atteignent 1,5 point d'AP50 sur les parties mobiles, 2,8 points sous contrainte conjointe d'origine et d'axe, et 6,7 points sur les éléments fonctionnels par rapport aux meilleures méthodes concurrentes.
Cette approche cible une limite persistante de la perception robotique: la plupart des représentations de scènes articulées actuelles infèrent la cinématique à partir d'interactions observées, le robot devant pousser, tirer ou ouvrir un objet pour en apprendre le fonctionnement, tandis que les méthodes travaillant sur des scans statiques dissocient généralement l'articulation des éléments fonctionnels qui permettent de la déclencher. FunArt montre qu'un modèle génératif 3D pré-entraîné pour la synthèse d'objets encode déjà des indices structurels exploitables pour déduire, à partir d'un seul scan, comment un objet peut être manipulé et par où le saisir. Pour les équipes de perception et de planification robotique, cela ouvre la voie à une initialisation de la compréhension de la scène avant tout contact physique, réduisant potentiellement les essais-erreurs lors de la manipulation d'objets inconnus dans des environnements humains, et alimente le débat sur la réutilisation de latents génératifs 3D comme briques de perception plutôt que sur l'entraînement d'encodeurs dédiés pour chaque tâche.
FunArt s'appuie sur TRELLIS.2, modèle génératif 3D existant dont le VAE sert ici de squelette structurel figé, une stratégie qui s'inscrit dans une tendance plus large à recycler des modèles génératifs entraînés sur de vastes corpus 3D comme briques de perception plutôt qu'à concevoir des architectures dédiées from scratch. Le benchmark Articulate3D, utilisé pour l'évaluation, sert de référence standard dans la communauté vision 3D et robotique pour comparer segmentation et estimation d'articulation via la métrique AP50. L'article ne mentionne ni partenariat industriel, ni déploiement sur robot physique, ni acteur européen comme Wandercraft, Exotec, Pollen Robotics ou Enchanted Tools: il s'agit à ce stade d'une contribution de recherche en vision par ordinateur publiée en preprint, dont l'intégration dans une pile de perception robotique complète, avec planification de mouvement et exécution, reste une étape à venir.
Dans nos dossiers




