NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
Ying Wen
3 papers
Shanghai Jiao Tong University
ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
STAR: Efficient Preference-based Reinforcement Learning via Dual Regularization
ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning