2026
Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation
CVPR 2026
The limited understanding capacity of the visual encoder in Contrastive Language-Image Pre-training (CLIP) has become a key bottleneck for downstream performance. This capacity includes both Discriminative Ability (D-Ability), which reflects class separability, and Detail Perceptual Ability (P-Abili