InfiMM: Advancing Multimodal Understanding with an Open-Sourced Visual Language Model
Haogeng Liu, Quanzeng You, Yiqi Wang, Xiaotian Han, Bohan Zhai, Yongfei Liu, Wentao Chen, Yiren Jian
Abstract
In this work, we present InfiMM, an advanced Multimodal Large Language Model that adapts to intricate vision-language tasks. InfiMM, inspired by the Flamingo architecture, distinguishes itself through the utilization of large-scale training data, comprehensive training strategies, and diverse large language models. This approach ensures the preservation of Flamingo’s foundational strengths while simultaneously introducing augmented capabilities. Empirical evaluations across a variety of benchmarks underscore InfiMM’s remarkable capability in multimodal understanding. The code can be found at: https://anonymous.4open.science/r/infimm-zephyr-F60C/.
BibTeX
@inproceedings{liu-etal-2024-infimm,
title = "{I}nfi{MM}: Advancing Multimodal Understanding with an Open-Sourced Visual Language Model",
author = "Liu, Haogeng and
You, Quanzeng and
Wang, Yiqi and
Han, Xiaotian and
Zhai, Bohan and
Liu, Yongfei and
Chen, Wentao and
Jian, Yiren and
Tao, Yunzhe and
Yuan, Jianbo and
He, Ran and
Yang, Hongxia",
editor = "Ku, Lun-Wei and
Martins, Andre and
Srikumar, Vivek",
booktitle = "Findings of the Association for Computational Linguistics: ACL 2024",
month = aug,
year = "2024",
address = "Bangkok, Thailand",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.findings-acl.27/",
doi = "10.18653/v1/2024.findings-acl.27",
pages = "485--492"
}