DesireKV: Decoupling Sensitivity and Importance for Reasoning-Aware KV Cache Compression
Large language models performing chain-of-thought (CoT) reasoning generate extensive intermediate sequences that consume substantial memory through key-value (KV) cache storage. Unlike conventional text generation, reasoning sequences exhibit unique characteristics, including repetitive logic patter