Xiangyang Li
- MTRec: Learning to Align with User Preferences via Mental Reward Models
- MURKA: Multi-Reward Reinforcement Learning with Knowledge Alignment for Optimization Tasks
- MoonCast: High-Quality Zero-Shot Podcast Generation
- Process vs. Outcome Reward: Which is Better for Agentic RAG Reinforcement Learning
- Purest Quantum State Identification