← Search

Donghyeon Joo

1 accepted papers

2025

MUSTAFAR: Promoting Unstructured Sparsity for KV Cache Pruning in LLM Inference

NeurIPS 2025poster

We demonstrate that unstructured sparsity significantly improves KV cache compression for LLMs, enabling sparsity levels up to 70\% without compromising accuracy or requiring fine-tuning. We conduct a systematic exploration of pruning strategies and find per-token magnitude-based pruning as highly e…

Cited by 0SourcecodeScholar