2024
OffsetBias: Leveraging Debiased Data for Tuning Evaluators
EMNLP 2024finding
Employing Large Language Models (LLMs) to assess the quality of generated responses has become a widely adopted evaluation method. Specifically, instruct-tuned models and fine-tuned judge models based on open-source LLMs have been reported. While it is known that judge models are vulnerable to certa…