
FUSE : ancrage actif de l'affordance fonctionnelle par acquisition adaptative de preuves sémantiques et géométriques
Un preprint publié sur arXiv (2608.12683v1) introduit une nouvelle tâche baptisée « Active Functional Affordance Grounding » : un agent doit explorer activement une scène pour localiser un objet répondant à une fonction demandée, par exemple un objet pour verser un liquide, plutôt qu'à une simple étiquette d'identité. Les auteurs proposent FUSE, un framework d'acquisition de preuves sémantiques et géométriques combinant une exploration pilotée par une mesure explicite d'incertitude et un planificateur amorti appris qui choisit les points de vue les plus informatifs quand les indices fonctionnels sont occultés ou incomplets. Ils publient aussi un benchmark bâti sur le simulateur Habitat pour évaluer cette tâche. Selon les expériences rapportées, FUSE atteint la meilleure performance de localisation non-oracle observée parmi les méthodes comparées, réduit le calcul de 1,33 fois par rapport à une exploration entièrement explicite, et reste efficace avec plusieurs sources de connaissances sur les affordances.
Ce travail cible un angle mort des systèmes de perception embarquée actuels : la plupart des méthodes de affordance grounding opèrent depuis un point de vue fixe et échouent dès qu'un indice fonctionnel est masqué ou invisible sous un seul angle. Pour des intégrateurs qui cherchent à faire raisonner un robot sur ce à quoi sert un objet plutôt que sur ce qu'il est, ce mécanisme d'exploration active pilotée par l'incertitude constitue un prérequis en amont de toute manipulation. Le résultat rappelle aussi qu'un grand modèle vision-langage ne suffit pas à lui seul si l'agent ne sait pas décider où regarder ensuite pour lever une ambiguïté fonctionnelle ; le gain de calcul de 1,33x reste toutefois mesuré uniquement en simulation, sans validation rapportée sur robot physique.
Le papier combine deux lignées de recherche jusque-là largement séparées, l'affordance grounding sémantique qui associe langage et régions de scène, et la perception active centrée sur le choix du prochain meilleur point de vue. Le résumé ne précise ni l'affiliation des auteurs ni de calendrier de suite, et l'évaluation se limite pour l'instant au benchmark Habitat introduit par les auteurs eux-mêmes, sans comparaison sur un jeu de données tiers ni déploiement sur une plateforme réelle. La suite logique, non annoncée dans ce résumé, serait un transfert vers un robot physique et une comparaison face à des méthodes d'exploration active plus générales.
Dans nos dossiers




