2021
DominoSearch: Find layer-wise fine-grained N:M sparse schemes from dense neural networks
NeurIPS 2021poster
Neural pruning is a widely-used compression technique for Deep Neural Networks (DNNs). Recent innovations in Hardware Architectures (e.g. Nvidia Ampere Sparse Tensor Core) and N:M fine-grained Sparse Neural Network algorithms (i.e. every M-weights contains N non-zero values) reveal a promising resea…