2025
CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays
NeurIPS 2025spotlight
Recent progress in Large Vision-Language Models (LVLMs) has enabled promising applications in medical tasks, such as report generation and visual question answering. However, existing benchmarks focus mainly on the final diagnostic answer, offering limited insight into whether models engage in clini…