2026
SplitScaling: Adaptive Scaling for Disaggregated LLM Serving Against Traffic Bursts via DRL
IJCAI 2026
The disaggregated Prefill-Decode (PD) architecture has emerged as a prominent paradigm for efficient Large Language Model inference serving. However, resource management remains a critical challenge, particularly under the dual burstiness of real-world scenarios—characterized by volatile fluctuation