2025
DenoiseRotator: Enhance Pruning Robustness for LLMs via Importance Concentration
NeurIPS 2025poster
Pruning is a widely used technique to compress large language models (LLMs) by removing unimportant weights, but it often suffers from significant performance degradation—especially under semi-structured sparsity constraints. Existing pruning methods primarily focus on estimating the importance of i…