PurpCode: Reasoning for Safer Code Generation

Jiawei Liu (University of Illinois Urbana-Champaign) · Zhe Wang (Xidian University) · Nirav Diwan (University of Illinois at Urbana-Champaign) · Haoyu Zhai (University of Illinois at Urbana-Champaign) · Xiaona Zhou (University of Illinois at Urbana-Champaign) · Kiet Nguyen (Korea Advanced Institute of Science & Technology) · Tianjiao Yu (University of Illinois at Urbana-Champaign) · Muntasir Wahed (University of Illinois at Urbana-Champaign) · Yinlin Deng (University of Illinois Urbana-Champaign) · Hadjer Benkraouda (University of Illinois at Urbana-Champaign) · Yuxiang Wei (UIUC / Meta) · LINGMING ZHANG (University of Illinois Urbana-Champaign) · Ismini Lourentzou (University of Illinois Urbana-Champaign) · Gang Wang (Beijing Institute of Technology)
alignment methodcode reasoning modelscybersafety datahigh-coverage promptsmalicious cyberactivitiesmulti-objective reward mechanismsoverrefusal ratespurpcodepurpcode-32breasoning-based coding modelred-teamingreinforcement learningrule learningsecure code generationsecurity knowledgeunsafe cyberactivities

We introduce PurpCode, the first post-training recipe for training safe code reasoning models towards generating secure code and defending against malicious cyberactivities. PurpCode trains a reasoning model in two stages: (i) Rule Learning, which explicitly teaches the model to reference cybersafety rules to generate vulnerability-free code and to avoid facilitating malicious cyberactivities; and (ii) Reinforcement Learning, which optimizes model safety and preserves model utility through diverse, multi-objective reward mechanisms. To empower the training pipelines with comprehensive cybersafety data, we conduct internal red-teaming to synthesize comprehensive and high-coverage prompts based on real-world tasks for inducing unsafe cyberactivities in the model. Based on PurpCode, we develop a reasoning-based coding model, namely PurpCode-32B, which demonstrates state-of-the-art cybersafety, outperforming various frontier models. Moreover, our alignment method decreases the model overrefusal rates in both general and cybersafety-specific scenarios, while preserving model utility in both code generation and common security knowledge.