2024
When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models
EMNLP 2024finding
Large language models (LLMs) exhibit excellent performance in various tasks. However, the memory requirements of LLMs present a great challenge when deploying on memory-limited devices, even for quantized LLMs. This paper introduces a framework to compress LLM after quantization further, achieving a…