gsm8k
A benchmark dataset specifically designed for evaluating models on 8th grade mathematics reasoning tasks, requiring both numerical and logical reasoning capabilities.
- AutoJudge: Judge Decoding Without Manual Annotation
- CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
- Efficient Data Selection at Scale via Influence Distillation
- PANGEA: Projection-Based Augmentation with Non-Relevant General Data for Enhanced Domain Adaptation in LLMs
- Residual Stream Analysis of Overfitting And Structural Disruptions
- Tapered Off-Policy REINFORCE - Stable and efficient reinforcement learning for large language models
- Thinkless: LLM Learns When to Think