Hao Peng
- AGENTIF: Benchmarking Large Language Models Instruction Following Ability in Agentic Scenarios
- CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment
- Reinforcement Learning Finetunes Small Subnetworks in Large Language Models
- Structural Information-based Hierarchical Diffusion for Offline Reinforcement Learning
- The Best Instruction-Tuning Data are Those That Fit
- The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning