← Search

Juntao Zhao

1 accepted papers

2025

QSpec: Speculative Decoding with Complementary Quantization Schemes

EMNLP 2025

Quantization is widely adopted to accelerate inference and reduce memory consumption in large language models (LLMs). While activation-weight joint quantization enables efficient low-precision decoding, it suffers substantial performance degradation on multi-step reasoning tasks. We propose QSPEC, a