2025
GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
NeurIPS 2025poster
Post-training plays a crucial role in refining and aligning large language models to meet specific tasks and human preferences. While recent advancements in post-training techniques, such as Group Relative Policy Optimization (GRPO), leverage increased sampling with relative reward scoring to achiev…