adversarial prompts
- SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification
- Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
- T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
- VERA: Variational Inference Framework for Jailbreaking Large Language Models