2026
Cross-modal Identity Mapping: Minimizing Information Loss in Modality Conversion via Reinforcement Learning
CVPR 2026
Large Vision-Language Models (LVLMs) often omit or misrepresent critical visual content in generated image captions. Minimizing such information loss will force LVLMs to focus on image details to generate precise descriptions. However, measuring information loss during modality conversion is inheren