attack success rate
Attack success rate refers to the proportion of adversarial attacks (deliberate attempts to mislead AI models) that successfully achieve the desired misclassification of inputs, important for assessing model robustness.
- A Set of Generalized Components to Achieve Effective Poison-only Clean-label Backdoor Attacks with Collaborative Sample Selection and Triggers
- Analogy-based Multi-Turn Jailbreak against Large Language Models
- Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming
- Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- LARGO: Latent Adversarial Reflection through Gradient Optimization for Jailbreaking LLMs
- Lifelong Safety Alignment for Language Models
- Mitigating Sexual Content Generation via Embedding Distortion in Text-conditioned Diffusion Models
- One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
- RepGuard: Adaptive Feature Decoupling for Robust Backdoor Defense in Large Language Models
- SNEAKDOOR: Stealthy Backdoor Attacks against Distribution Matching-based Dataset Condensation
- Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence
- T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- Virus Infection Attack on LLMs: Your Poisoning Can Spread "VIA" Synthetic Data
- WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks