← Search

Seunggeun Cho

1 accepted papers

2025

SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs

NeurIPS 2025spotlight

Large language models (LLMs) power many modern applications, but serving them at scale remains costly and resource-intensive. Current server-centric systems overlook consumer-grade GPUs at the edge. We introduce SpecEdge, an edge-assisted inference framework that splits LLM workloads between edge an…

Cited by 0SourcecodeScholar