Data Selection for Fine-tuning Vision Language Models via Cross Modal Alignment Trajectories
Data-efficient learning aims to eliminate redundancy in large training datasets by train- ing models on smaller subsets of the most informative examples. While data selection has been extensively explored for vision models and large language models (LLMs), it remains underexplored for Large Vision-L…