Enhance Modality Robustness in Text-Centric Multimodal Alignment with Adversarial Prompting
Converting different modalities into generalized text, which then serves as input prompts for large language models (LLMs), is a common approach for aligning multimodal models, particularly when pairwise data is limited. Text-centric alignment method leverages the unique properties of text as a moda…