← Search

Chengye YU

1 accepted papers

2025

SmartCache: Context-aware Semantic Cache for Efficient Multi-turn LLM Inference

NeurIPS 2025poster

Large Language Models (LLMs) for multi-turn conversations suffer from inefficiency: semantically similar queries across different user sessions trigger redundant computation and duplicate memory-intensive Key-Value (KV) caches. Existing optimizations such as prefix caching overlook semantic similari…

Cited by 0SourceScholar