model outputs
- Distributional Training Data Attribution: What do Influence Functions Sample?
- ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
- Machine Unlearning Doesn't Do What You Think: Lessons for Generative AI Policy and Research
- The Unseen Threat: Residual Knowledge in Machine Unlearning under Perturbed Samples
- Understanding and Mitigating Numerical Sources of Nondeterminism in LLM Inference