model distillation
- Antidistillation Sampling
- Generative Data Augmentation via Diffusion Distillation, Adversarial Alignment, and Importance Reweighting
- Preference Distillation via Value based Reinforcement Learning
- ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs
- VarFlow: Proper Scoring-Rule Diffusion Distillation via Energy Matching