← Search

Parth Thakkar

1 accepted papers

2025

Finding Needles in Images: Can Multi-modal LLMs Locate Fine Details?

ACL 2025long

While Multi-modal Large Language Models (MLLMs) have shown impressive capabilities in document understanding tasks, their ability to locate and reason about fine-grained details within complex documents remains understudied. Consider searching a restaurant menu for a specific nutritional detail or i…

Cited by 0SourcePDFScholar