adversarial attacks
Strategically crafted inputs aimed at deceiving an AI model, highlighting vulnerabilities and testing the robustness of machine learning systems.
- ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio–Language Models
- AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents
- Adversary Aware Optimization for Robust Defense
- Bits Leaked per Query: Information-Theoretic Bounds for Adversarial Attacks on LLMs
- Bridging Symmetry and Robustness: On the Role of Equivariance in Enhancing Adversarial Robustness
- DNA-DetectLLM: Unveiling AI-Generated Text via a DNA-Inspired Mutation-Repair Paradigm
- DepthVanish: Optimizing Adversarial Interval Structures for Stereo-Depth-Invisible Patches
- Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
- Diffusion-Guided Graph Data Augmentation
- Distributional Adversarial Attacks and Training in Deep Hedging
- Dual-Flow: Transferable Multi-Target, Instance-Agnostic Attacks via $\textit{In-the-wild}$ Cascading Flow Optimization
- Dynamic Siamese Expansion Framework for Improving Robustness in Online Continual Learning
- Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial Attacks
- Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial Attacks
- ErrorTrace: A Black-Box Traceability Mechanism Based on Model Family Error Space
- Fortifying Time Series: DTW-Certified Robust Anomaly Detection
- FrameShield: Adversarially Robust Video Anomaly Detection
- From Noise to Narrative: Tracing the Origins of Hallucinations in Transformers
- Harnessing the Universal Geometry of Embeddings
- Influence Functions for Edge Edits in Non-Convex Graph Neural Networks
- Mitigating Sexual Content Generation via Embedding Distortion in Text-conditioned Diffusion Models
- MixAT: Combining Continuous and Discrete Adversarial Training for LLMs
- Non-Adaptive Adversarial Face Generation
- On the Robustness of Verbal Confidence of LLMs in Adversarial Attacks
- On the Stability of Graph Convolutional Neural Networks: A Probabilistic Perspective
- Reinforcement Learning with Backtracking Feedback
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
- Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
- Securing the Language of Life: Inheritable Watermarks from DNA Language Models to Proteins
- Sharp Gaussian approximations for Decentralized Federated Learning
- The Cost of Compression: Tight Quadratic Black-Box Attacks on Sketches for $\ell_2$ Norm Estimation
- Transstratal Adversarial Attack: Compromising Multi-Layered Defenses in Text-to-Image Models
- Understanding and Improving Adversarial Robustness of Neural Probabilistic Circuits