2026
On Group Relative Policy Optimization Collapse in Agent Search: The Lazy Likelihood-Displacement
ICML 2026poster
Tool-integrated (TI) reinforcement learning (RL) enables large language models (LLMs) to perform multi-step reasoning by interacting with external tools such as search engines and retrievers. Group Relative Policy Optimization (GRPO), exemplified by the recent Search-R1, offers fast convergence and …