← Search

Liangyu Zhong

1 accepted papers

2025

FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering

NeurIPS 2025poster

While Multimodal Large Language Models (MLLMs) offer strong perception and reasoning capabilities for image-text input, Visual Question Answering (VQA) focusing on small image details still remains a challenge. Although visual cropping techniques seem promising, recent approaches have several limita…

Cited by 0SourceScholar