2026
When Drafts Evolve: Speculative Decoding Meets Online Learning
ICML 2026poster
Speculative decoding has emerged as a widely adopted paradigm for accelerating large language model inference, where a lightweight draft model rapidly generates candidate tokens that are then verified in parallel by a larger target model. However, due to limited model capacity, drafts often struggle…