safety mechanisms
- Analogy-based Multi-Turn Jailbreak against Large Language Models
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- LLMs Encode Harmfulness and Refusal Separately
- Red-Teaming Text-to-Image Systems by Rule-based Preference Modeling
- Safety Depth in Large Language Models: A Markov Chain Perspective