CPPO: Accelerating the Training of Group Relative Policy Optimization-Based Reasoning Models
completion pruning policy optimizationdynamic completion allocationgpu utilizationgradient calculationgroup relative policy optimizationgsm8kmathmodel accuracypolicy trainingreasoning modelsrelative advantagesampling completionsspeeduptraining coststraining efficiency
This paper introduces Completion Pruning Policy Optimization (CPPO) to accelerate the training of reasoning models based on Group Relative Policy Optimization (GRPO). GRPO, while effective, incurs high training costs due to the need to sample multiple completions for each question. Our experiment and theoretical analysis reveal that the number of completions impacts model accuracy yet increases training time multiplicatively, and not all completions contribute equally to policy training