adversarial perturbations
Deliberate modifications made to input data intended to deceive AI models. Studying adversarial perturbations helps in improving model robustness against attacks and ensuring reliability.
- A Frustratingly Simple Yet Highly Effective Attack Baseline: Over 90% Success Rate Against the Strong Black-box Models of GPT-4.5/4o/o1
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Explicitly Modeling Subcortical Vision with a Neuro-Inspired Front-End Improves CNN Robustness
- Fit the Distribution: Cross-Image/Prompt Adversarial Attacks on Multimodal Large Language Models
- Functional Virtual Adversarial Training for Semi-Supervised Time Series Classification
- JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
- LORE: Lagrangian-Optimized Robust Embeddings for Visual Encoders
- Learning Robust Vision-Language Models from Natural Latent Spaces
- Lie Detector: Unified Backdoor Detection via Cross-Examination Framework
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
- On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
- Robust Graph Condensation via Classification Complexity Mitigation
- Robust Satisficing Gaussian Process Bandits Under Adversarial Attacks
- The Unseen Threat: Residual Knowledge in Machine Unlearning under Perturbed Samples