← Search

Weilan Wang

1 accepted papers

2024

When Compression Meets Model Compression: Memory-Efficient Double Compression for Large Language Models

EMNLP 2024finding

Large language models (LLMs) exhibit excellent performance in various tasks. However, the memory requirements of LLMs present a great challenge when deploying on memory-limited devices, even for quantized LLMs. This paper introduces a framework to compress LLM after quantization further, achieving a…