2024
MedCalc-Bench: Evaluating Large Language Models for Medical Calculations
NeurIPS 2024oral
Current benchmarks for evaluating large language models (LLMs) in medicine are primarily focused on question-answering involving domain knowledge and descriptive reasoning. While such qualitative capabilities are vital to medical diagnosis, in real-world scenarios, doctors frequently use clinical ca…