2026
Critique-Coder: Enhancing Coder Models by Critique Reinforcement Learning
ICLR 2026poster
Reinforcement Learning (RL) has emerged as a popular training paradigm, particularly when paired with reasoning models. While effective, it primarily focuses on generating responses and lacks mechanisms to explicitly foster critique or reflection. Several recent studies, like Critique-Fine-Tuning (C…