security vulnerabilities
- Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- From Counterfactuals to Trees: Competitive Analysis of Model Extraction Attacks
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents