2025
Optimizing Adaptive Attacks against Watermarks for Language Models
ICML 2025spotlight
Large Language Models (LLMs) can be misused to spread unwanted content at scale. Content watermarking deters misuse by hiding messages in content, enabling its detection using a secret *watermarking key*. Robustness is a core security property, stating that evading detection requires (significant) d…