2026
ORCA: Orchestrated Reasoning with Collaborative Agents for Document Visual Question Answering
CVPR 2026
Document Visual Question Answering (DocVQA) remains challenging for existing Vision-Language Models (VLMs), especially under complex reasoning and multi-step workflows. Current approaches struggle to decompose intricate questions into manageable sub-tasks and often fail to leverage specialized proce