← Search

Rui Kang

1 accepted papers

2026

WarmServe: Enabling One-for-Many GPU Prewarming for Multi-LLM Serving

ICML 2026poster

Deploying multiple models within shared GPU clusters is a key strategy to improve resource efficiency in large language model (LLM) serving. Existing multi-LLM serving systems improve GPU utilization at the cost of degraded inference performance, particularly time-to-first-token (TTFT). We attribute…

Cited by 0SourceScholar