NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Wenwei Zhang
3 papers
Nanyang Technological University
Pre-Trained Policy Discriminators are General Reward Models
Rethinking Verification for LLM Code Generation: From Generation to Testing
Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning