2023
A Study on Knowledge Distillation from Weak Teacher for Scaling Up Pre-trained Language Models
ACL 2023findings
Distillation from Weak Teacher (DWT) is a method of transferring knowledge from a smaller, weaker teacher model to a larger student model to improve its performance. Previous studies have shown that DWT can be effective in the vision domain and natural language processing (NLP) pre-training stage. S…