2026
V-ABS: Action-Observer Driven Beam Search for Dynamic Visual Reasoning
ICML 2026poster
Multimodal large language models (MLLMs) have achieved remarkable success in general perception, yet complex multi-step visual reasoning remains a persistent challenge. Although recent agentic approaches incorporate tool use, they often neglect critical execution feedback. Consequently, they suffer …