← Search

Zhongbin Zhou

1 accepted papers

2026

HEAPr: Hessian-based Efficient Atomic Expert Pruning in Output Space

ICLR 2026poster

Mixture-of-Experts (MoE) architectures in large language models (LLMs) deliver exceptional performance and reduced inference costs compared to dense LLMs. However, their large parameter counts result in prohibitive memory requirements, limiting practical deployment. While existing pruning methods pr…

Cited by 0SourcecodeScholar