← Search

Yuqi Zha

2 accepted papers

2026

Lookahead-GCG: Improving Multi-Model Gradient-Based Jailbreaking Attacks via Nesterov Momentum

ICML 2026poster

Transferable jailbreaking attacks enable red-teaming of black-box large language models by optimizing adversarial prompts on open-source surrogates. A natural approach to improve transferability is multi-model training---optimizing against multiple source models simultaneously. Yet this approach has…

Cited by 0SourceScholar
2025

Provable Policy Gradient for Robust Average-Reward MDPs Beyond Rectangularity

ICML 2025poster

Robust Markov Decision Processes (MDPs) offer a promising framework for computing reliable policies under model uncertainty. While policy gradient methods have gained increasing popularity in robust discounted MDPs, their application to the average-reward criterion remains largely unexplored. This p…

Cited by 0SourcePDFScholar