2025
Zero-Shot Vision Encoder Grafting via LLM Surrogates
ICCV 2025poster
Vision language models (VLMs) typically pair a modestly sized vision encoder with a large language model (LLM), e.g., Llama-70B, making the decoder the primary computational burden during training.To reduce costs, a promising strategy is to first train the vision encoder using a small language model…