2026
AReaL-DTA: Dynamic Tree Attention for Efficient Reinforcement Learning of Large Language Models
ICML 2026poster
Reinforcement learning (RL) based post-training for large language models (LLMs) is computationally expensive, as it generates many rollout sequences that could frequently share long token prefixes. Existing RL frameworks usually process these sequences independently, repeatedly recomputing identica…