2020
Reducing Underflow in Mixed Precision Training by Gradient Scaling
IJCAI 2020poster
By leveraging the half-precision floating-point format (FP16) well supported by recent GPUs, mixed precision training (MPT) enables us to train larger models under the same or even smaller budget. However, due to the limited representation range of FP16, gradients can often experience severe underfl…