NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
jailbreaking
4 papers
Attention! Your Vision Language Model Could Be Maliciously Manipulated
C-SafeGen: Certified Safe LLM Generation with Claim-Based Streaming Guardrails
Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming
Language Models Can Predict Their Own Behavior