← Search

Miles Williams

2 accepted papers

2025

Self-calibration for Language Model Quantization and Pruning

NAACL 2025long

Quantization and pruning are fundamental approaches for model compression, enabling efficient inference for language models. In a post-training setting, state-of-the-art quantization and pruning methods require calibration data, a small set of unlabeled examples. Conventionally, this is randomly sam…

2024

On the Impact of Calibration Data in Post-training Quantization and Pruning

ACL 2024long

Quantization and pruning form the foundation of compression for neural networks, enabling efficient inference for large language models (LLMs). Recently, various quantization and pruning techniques have demonstrated remarkable performance in a post-training setting. They rely upon calibration data,…