diffusion transformers
A type of neural network architecture that integrates principles from diffusion processes with transformer models, allowing for enhanced learning of complex data distributions over time. They are particularly useful in generative tasks where latent variable modeling is involved.
- $\text{S}^2$Q-VDiT: Accurate Quantized Video Diffusion Transformer with Salient Data and Sparse Token Distillation
- CLEAR: Conv-Like Linearization Revs Pre-Trained Diffusion Transformers Up
- Diffusion Transformers as Open-World Spatiotemporal Foundation Models
- Diffusion on Demand: Selective Caching and Modulation for Efficient Generation
- Emergent Temporal Correspondences from Video Diffusion Transformers
- Enhancing Text-to-Image Diffusion Transformer via Split-Text Conditioning
- Exploring Diffusion Transformer Designs via Grafting
- Exploring Diffusion Transformer Designs via Grafting
- Foresight: Adaptive Layer Reuse for Accelerated and High-Quality Text-to-Video Generation
- LEDiT: Your Length-Extrapolatable Diffusion Transformer without Positional Encoding
- PipeFusion: Patch-level Pipeline Parallelism for Diffusion Transformers Inference
- REPA Works Until It Doesn’t: Early-Stopped, Holistic Alignment Supercharges Diffusion Training
- Re-ttention: Ultra Sparse Visual Generation via Attention Statistical Reshape
- RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers
- Sampling 3D Molecular Conformers with Diffusion Transformers
- Scaling Diffusion Transformers Efficiently via $\mu$P
- Sparse VideoGen2: Accelerate Video Generation with Sparse Attention via Semantic-Aware Permutation
- SparseDiT: Token Sparsification for Efficient Diffusion Transformer
- Unleashing Diffusion Transformers for Visual Correspondence by Modulating Massive Activations
- VETA-DiT: Variance-Equalized and Temporally Adaptive Quantization for Efficient 4-bit Diffusion Transformers
- XVerse: Consistent Multi-Subject Control of Identity and Semantic Attributes via DiT Modulation