NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Mohan Zhang
4 papers
Beijing University of Aeronautics and Astronautics
One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
Progress Reward Model for Reinforcement Learning via Large Language Models
RF-Agent: Automated Reward Function Design via Language Agent Tree Search
Reasoning Is Not a Race: When Stopping Early Beats Going Deeper