2026
Post-training Large Language Models for Diverse High-Quality Responses
ICLR 2026poster
Reinforcement learning has emerged as a popular method for post-training large language models (LLMs). While improving the model's performance on downstream tasks, it often reduces the model's output diversity, leading to narrow, canonical responses. Existing methods to enhance diversity are limited…