← Search

Bin Qian

1 accepted papers

2026

FIRM-MoE:Fine-GrainedExpert Decomposition for Resource-Adaptive MoE Inference

AAAI 2026technical

Mixture-of-Experts (MoE) is a sparse neural architecture that significantly increases model capacity while maintaining low computational complexity. However, deploying MoE-based large language models (LLMs) on memory-constrained edge devices remains challenging due to their substantial memory requir

Cited by 0SourcePDFScholar