2025
Prompt-CAM: Making Vision Transformers Interpretable for Fine-Grained Analysis
CVPR 2025poster
We present a simple approach to make pre-trained Vision Transformers (ViTs) interpretable for fine-grained analysis, aiming to identify and localize the traits that distinguish visually similar categories, such as bird species. Pre-trained ViTs, such as DINO, have demonstrated remarkable capabilitie…