ACL 2024findings0 citations

InfiMM: Advancing Multimodal Understanding with an Open-Sourced Visual Language Model

Haogeng Liu, Quanzeng You, Yiqi Wang, Xiaotian Han, Bohan Zhai, Yongfei Liu, Wentao Chen, Yiren Jian

Abstract

In this work, we present InfiMM, an advanced Multimodal Large Language Model that adapts to intricate vision-language tasks. InfiMM, inspired by the Flamingo architecture, distinguishes itself through the utilization of large-scale training data, comprehensive training strategies, and diverse large language models. This approach ensures the preservation of Flamingo’s foundational strengths while simultaneously introducing augmented capabilities. Empirical evaluations across a variety of benchmarks underscore InfiMM’s remarkable capability in multimodal understanding. The code can be found at: https://anonymous.4open.science/r/infimm-zephyr-F60C/.

BibTeX
@inproceedings{liu-etal-2024-infimm,
    title = "{I}nfi{MM}: Advancing Multimodal Understanding with an Open-Sourced Visual Language Model",
    author = "Liu, Haogeng  and
      You, Quanzeng  and
      Wang, Yiqi  and
      Han, Xiaotian  and
      Zhai, Bohan  and
      Liu, Yongfei  and
      Chen, Wentao  and
      Jian, Yiren  and
      Tao, Yunzhe  and
      Yuan, Jianbo  and
      He, Ran  and
      Yang, Hongxia",
    editor = "Ku, Lun-Wei  and
      Martins, Andre  and
      Srikumar, Vivek",
    booktitle = "Findings of the Association for Computational Linguistics: ACL 2024",
    month = aug,
    year = "2024",
    address = "Bangkok, Thailand",
    publisher = "Association for Computational Linguistics",
    url = "https://aclanthology.org/2024.findings-acl.27/",
    doi = "10.18653/v1/2024.findings-acl.27",
    pages = "485--492"
}