visual generation
- End-to-End Vision Tokenizer Tuning
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- OmniGen-AR: AutoRegressive Any-to-Image Generation
- Selftok-Zero: Reinforcement Learning for Visual Generation via Discrete and Autoregressive Visual Tokens
- VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers
- Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations