Ye Wang
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- Iterative Foundation Model Fine-Tuning on Multiple Rewards
- Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
- Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization