post-training
Post-training refers to techniques applied after the initial training of a machine learning model, such as fine-tuning or quantization, aimed at improving model performance, reducing model size, or increasing inference efficiency.
- Behavior Injection: Preparing Language Models for Reinforcement Learning
- Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
- ExPO: Unlocking Hard Reasoning with Self-Explanation-Guided Reinforcement Learning
- Finding and Reactivating Post-Trained LLMs' Hidden Safety Mechanisms
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
- Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance
- GVPO: Group Variance Policy Optimization for Large Language Model Post-Training
- Incentivizing LLMs to Self-Verify Their Answers
- MMaDA: Multimodal Large Diffusion Language Models
- Parallel Scaling Law for Language Models
- RePIC: Reinforced Post-Training for Personalizing Multi-Modal Language Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- Steering Information Utility in Key-Value Memory for Language Model Post-Training
- Training a Scientific Reasoning Model for Chemistry
- Trajectory Balance with Asynchrony: Decoupling Exploration and Learning for Fast, Scalable LLM Post-Training
- UFT: Unifying Supervised and Reinforcement Fine-Tuning
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding
- Why Do Some Language Models Fake Alignment While Others Don't?
- Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator