text-to-image generation
A task in AI where models create visual representations from textual descriptions, highlighting the interplay between natural language processing and computer vision.
- Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models
- Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
- CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step
- Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models
- Conditional Panoramic Image Generation via Masked Autoregressive Modeling
- Consistent Story Generation: Unlocking the Potential of Zigzag Sampling
- DiCo: Revitalizing ConvNets for Scalable and Efficient Diffusion Modeling
- Diffusion Tree Sampling: Scalable inference‑time alignment of diffusion models
- Domain-RAG: Retrieval-Guided Compositional Image Generation for Cross-Domain Few-Shot Object Detection
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Emergence and Evolution of Interpretable Concepts in Diffusion Models
- Entropy Rectifying Guidance for Diffusion and Flow Models
- EraseFlow: Learning Concept Erasure Policies via GFlowNet-Driven Alignment
- Feedback Guidance of Diffusion Models
- Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation
- GoT: Unleashing Reasoning Capability of MLLM for Visual Generation and Editing
- Image Editing As Programs with Diffusion Models
- ImgEdit: A Unified Image Editing Dataset and Benchmark
- InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
- InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual Generation
- Janus-Pro-R1: Advancing Collaborative Visual Comprehension and Generation via Reinforcement Learning
- Knowledge Distillation Detection for Open-weights Models
- LEDiT: Your Length-Extrapolatable Diffusion Transformer without Positional Encoding
- LayerCraft: Enhancing Text-to-Image Generation with CoT Reasoning and Layered Object Integration
- MMaDA: Multimodal Large Diffusion Language Models
- ORIGEN: Zero-Shot 3D Orientation Grounding in Text-to-Image Generation
- OmniGen-AR: AutoRegressive Any-to-Image Generation
- Policy Optimized Text-to-Image Pipeline Design
- Reinforcement Learning Meets Masked Generative Models: Mask-GRPO for Text-to-Image Generation
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image Generation
- Scaling Diffusion Transformers Efficiently via $\mu$P
- Scaling can lead to compositional generalization
- Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic Control
- SparseDiT: Token Sparsification for Efficient Diffusion Transformer
- Speculative Jacobi-Denoising Decoding for Accelerating Autoregressive Text-to-image Generation
- T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT
- Test-Time Scaling of Diffusion Models via Noise Trajectory Search
- Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization
- Transition Matching: Scalable and Flexible Generative Modeling
- UltraHR-100K: Enhancing UHR Image Synthesis with A Large-Scale High-Quality Dataset
- XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation