← Search

YoonHyung Roh

1 accepted papers

2024

Exploring Domain Robust Lightweight Reward Models based on Router Mechanism

ACL 2024findings

Recent advancements in large language models have heavily relied on the large reward model from reinforcement learning from human feedback for fine-tuning. However, the use of a single reward model across various domains may not always be optimal, often requiring retraining from scratch when new dom…

Cited by 0SourcePDFScholar