NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Zhaolin Gao
4 papers
Cornell University Meta
$Q\sharp$: Provably Optimal Distributional RL for LLM Post-Training
Accelerating RL for LLM Reasoning with Optimal Advantage Regression
Pre-trained Large Language Models Learn to Predict Hidden Markov Models In-context
Value-Guided Search for Efficient Chain-of-Thought Reasoning