2026
FIRM-MoE:Fine-GrainedExpert Decomposition for Resource-Adaptive MoE Inference
AAAI 2026technical
Mixture-of-Experts (MoE) is a sparse neural architecture that significantly increases model capacity while maintaining low computational complexity. However, deploying MoE-based large language models (LLMs) on memory-constrained edge devices remains challenging due to their substantial memory requir