Hanwang Zhang
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- Vinci: Deep Thinking in Text-to-Image Generation using Unified Model with Reinforcement Learning