NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
supervised finetuning
4 papers
Behavior Injection: Preparing Language Models for Reinforcement Learning
Self-Adapting Language Models
The Best Instruction-Tuning Data are Those That Fit
d1: Scaling Reasoning in Diffusion Large Language Models via Reinforcement Learning