← Search

Travis Zack

1 accepted papers

2025

Position: Medical Large Language Model Benchmarks Should Prioritize Construct Validity

ICML 2025oral

Medical large language models (LLMs) research often makes bold claims, from encoding clinical knowledge to reasoning like a physician. These claims are usually backed by evaluation on competitive benchmarks—a tradition inherited from mainstream machine learning. But how do we separate real progress…

Cited by 1SourcePDFScholar