2026
ArenaRL: Scaling RL for Open-Ended Agents via Tournament-based Relative Ranking
ICML 2026poster
Reinforcement learning (RL) has advanced LLM agents on verifiable tasks but remains challenging for open-ended tasks with vast solution spaces (e.g., complex travel planning). Lacking objective ground truth, current RL algorithms rely on reward models assigning scalar scores to individual responses.…