helpfulness
- Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
- Inference-Time Reward Hacking in Large Language Models
- Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
- Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons