2025
MUSTAFAR: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference
NeurIPS 2025poster
We demonstrate that unstructured sparsity significantly improves KV cache compression for LLMs, enabling sparsity levels up to 70\% without compromising accuracy or requiring fine-tuning. We conduct a systematic exploration of pruning strategies and find per-token magnitude-based pruning as highly e…