← Search

Ren Meiying

1 accepted papers

2024

OffsetBias: Leveraging Debiased Data for Tuning Evaluators

EMNLP 2024finding

Employing Large Language Models (LLMs) to assess the quality of generated responses has become a widely adopted evaluation method. Specifically, instruct-tuned models and fine-tuned judge models based on open-source LLMs have been reported. While it is known that judge models are vulnerable to certa…