2025
Trojsten Benchmark: Evaluating LLM Problem-Solving in Slovak STEM Competition Problems
EMNLP 2025
Large language models show promising performance on reasoning tasks, yet evaluation methods for low-resource languages remain limited, particularly for complex STEM problem-solving. We introduce Trojsten Benchmark, a Slovak-language dataset of 1,108 high-school competition problems with reference so