Nan Jiang
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
- A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement Learning
- Improving LLM General Preference Alignment via Optimistic Online Mirror Descent
- Model Selection for Off-policy Evaluation: New Algorithms and Experimental Protocol
- Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL
- Thinking vs. Doing: Improving Agent Reasoning by Scaling Test-Time Interaction