Wen Sun
- $Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
- Accelerating RL for LLM Reasoning with Optimal Advantage Regression
- Avoiding exp(R) scaling in RLHF through Preference-based Exploration
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- Value-Guided Search for Efficient Chain-of-Thought Reasoning