Enhancing Hate Speech Classifiers through a Gradient-assisted Counterfactual Text Generation Strategy
Counterfactual data augmentation (CDA) is a promising strategy for improving hate speech classification, but automating counterfactual text generation remains a challenge. Strong attribute control can distort meaning, while prioritizing semantic preservation may weaken attribute alignment. We propos