2026
Learning to Parallel: Accelerating Diffusion Large Language Models via Adaptive Parallel Decoding
ICLR 2026poster
Autoregressive decoding in large language models (LLMs) requires $\mathcal{O}(n)$ sequential steps for $n$ tokens, fundamentally limiting inference throughput. Recent diffusion-based LLMs (dLLMs) enable parallel token generation through iterative denoising. However, current parallel decoding strateg…