safety guarantees
- A Provable Approach for End-to-End Safe Reinforcement Learning
- C-SafeGen: Certified Safe LLM Generation with Claim-Based Streaming Guardrails
- Explainably Safe Reinforcement Learning
- Scaling Data-Driven Probabilistic Robustness Analysis for Semantic Segmentation Neural Networks
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models