2026
MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding
ICLR 2026poster
Vision-language alignment in multi-modal large language models (MLLMs) relies on supervised fine-tuning (SFT) or reinforcement learning (RL). To align multi-modal large language models (MLLMs) in the post-training stage, supervised fine-tuning (SFT) is a stable choice but requires human annotations…