David Bau
- Erasing Conceptual Knowledge from Language Models
- LLMs Encode Harmfulness and Refusal Separately
- Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research
- One-Step is Enough: Sparse Autoencoders for Text-to-Image Diffusion Models
- When Are Concepts Erased From Diffusion Models?