2026
HEAPr: Hessian-based Efficient Atomic Expert Pruning in Output Space
ICLR 2026poster
Mixture-of-Experts (MoE) architectures in large language models (LLMs) deliver exceptional performance and reduced inference costs compared to dense LLMs. However, their large parameter counts result in prohibitive memory requirements, limiting practical deployment. While existing pruning methods pr…