← Search

Soren Dunn

1 accepted papers

2024

MedCalc-Bench: Evaluating Large Language Models for Medical Calculations

NeurIPS 2024oral

Current benchmarks for evaluating large language models (LLMs) in medicine are primarily focused on question-answering involving domain knowledge and descriptive reasoning. While such qualitative capabilities are vital to medical diagnosis, in real-world scenarios, doctors frequently use clinical ca…