model utility
- FALCON: Fine-grained Activation Manipulation by Contrastive Orthogonal Unalignment for Large Language Model
- LLM Unlearning via Neural Activation Redirection
- Reinforcement Learning with Backtracking Feedback
- Simplicity Prevails: Rethinking Negative Preference Optimization for LLM Unlearning
- Understanding and Rectifying Safety Perception Distortion in VLMs