2025
SpecEdge: Scalable Edge-Assisted Serving Framework for Interactive LLMs
NeurIPS 2025spotlight
Large language models (LLMs) power many modern applications, but serving them at scale remains costly and resource-intensive. Current server-centric systems overlook consumer-grade GPUs at the edge. We introduce SpecEdge, an edge-assisted inference framework that splits LLM workloads between edge an…