2025
LTD-Bench: Evaluating Large Language Models by Letting Them Draw
NeurIPS 2025poster
Current evaluation paradigms for large language models (LLMs) represent a critical blind spot in AI research—relying on opaque numerical metrics that conceal fundamental limitations in spatial reasoning while providing no intuitive understanding of model capabilities. This deficiency creates a dange…