← Search

Siyong Jian

2 accepted papers

2026

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

ICLR 2026poster

Vision-language alignment in multi-modal large language models (MLLMs) relies on supervised fine-tuning (SFT) or reinforcement learning (RL). To align multi-modal large language models (MLLMs) in the post-training stage, supervised fine-tuning (SFT) is a stable choice but requires human annotations…

Cited by 0SourcecodeScholar