diffusion models
Generative models that learn complex distributions by modeling the diffusion process of data, useful for creating high-quality synthetic data.
- 70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)
- A Closer Look at Model Collapse: From a Generalization-to-Memorization Perspective
- A Data-Driven Prism: Multi-View Source Separation with Diffusion Model Priors
- ADG: Ambient Diffusion-Guided Dataset Recovery for Corruption-Robust Offline Reinforcement Learning
- ALTER: All-in-One Layer Pruning and Temporal Expert Routing for Efficient Diffusion Generation
- ASDSV: Multimodal Generation Made Efficient with Approximate Speculative Diffusion and Speculative Verification
- Absorb and Converge: Provable Convergence Guarantee for Absorbing Discrete Diffusion Models
- Accelerating Parallel Diffusion Model Serving with Residual Compression
- AccuQuant: Simulating Multiple Denoising Steps for Quantizing Diffusion Models
- Active Target Discovery under Uninformative Priors: The Power of Permanent and Transient Memory
- Adaptive 3D Reconstruction via Diffusion Priors and Forward Curvature-Matching Likelihood Updates
- Adaptive Discretization for Consistency Models
- Adaptive Inference-Time Scaling via Cyclic Diffusion Search
- Adversarial Diffusion for Robust Reinforcement Learning
- Align Your Flow: Scaling Continuous-Time Flow Map Distillation
- AlignedGen: Aligning Style Across Generated Images
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- AutoEdit: Automatic Hyperparameter Tuning for Image Editing
- Autoregressive Motion Generation with Gaussian Mixture-Guided Latent Sampling
- BADiff: Bandwidth Adaptive Diffusion Model
- Beyond Scores: Proximal Diffusion Models
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- BitMark: Watermarking Bitwise Autoregressive Image Generative Models
- BlurDM: A Blur Diffusion Model for Image Deblurring
- Breaking AR’s Sampling Bottleneck: Provable Acceleration via Diffusion Language Models
- Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection
- CCS: Controllable and Constrained Sampling with Diffusion Models via Initial Noise Perturbation
- CORAL: Disentangling Latent Representations in Long-Tailed Diffusion
- CURE: Concept Unlearning via Orthogonal Representation Editing in Diffusion Models
- CamEdit: Continuous Camera Parameter Control for Photorealistic Image Editing
- Can Diffusion Models Disentangle? A Theoretical Perspective
- Communication-Efficient Diffusion Denoising Parallelization via Reuse-then-Predict Mechanism
- Composition and Alignment of Diffusion Models using Constrained Learning
- Compositional Discrete Latent Code for High Fidelity, Productive Diffusion Models
- Compressed and Smooth Latent Space for Text Diffusion Modeling
- Conditional Diffusion Anomaly Modeling on Graphs
- Conditional Panoramic Image Generation via Masked Autoregressive Modeling
- Consistent Sampling and Simulation: Molecular Dynamics with Energy-Based Diffusion Models
- Constrained Diffusers for Safe Planning and Control
- Continuous Diffusion Model for Language Modeling
- Coupled Data and Measurement Space Dynamics for Enhanced Diffusion Posterior Sampling
- DCI: Dual-Conditional Inversion for Boosting Diffusion-Based Image Editing
- DEXTER: Diffusion-Guided EXplanations with TExtual Reasoning for Vision Models
- DGSolver: Diffusion Generalist Solver with Universal Posterior Sampling for Image Restoration
- DISCO: DISCrete nOise for Conditional Control in Text-to-Image Diffusion Models
- DOVE: Efficient One-Step Diffusion Model for Real-World Video Super-Resolution
- DPAIL: Training Diffusion Policy for Adversarial Imitation Learning without Policy Optimization
- DeblurDiff: Real-Word Image Deblurring with Generative Diffusion Models
- Decomposing stimulus-specific sensory neural information via diffusion models
- Denoising Trajectory Biases for Zero-Shot AI-Generated Image Detection
- Derivative-Free Guidance in Continuous and Discrete Diffusion Models with Soft Value-based Decoding
- DiffBreak: Is Diffusion-Based Purification Robust?
- Diffusion Federated Dataset
- Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
- Diffusion Models and the Manifold Hypothesis: Log-Domain Smoothing is Geometry Adaptive
- Diffusion-Classifier Synergy: Reward-Aligned Learning via Mutual Boosting Loop for FSCIL
- Dimension-free Score Matching and Time Bootstrapping for Diffusion Models
- Distributional Training Data Attribution: What do Influence Functions Sample?
- Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback
- EVODiff: Entropy-aware Variance Optimized Diffusion Inference
- Efficient Rectified Flow for Image Fusion
- Elucidated Rolling Diffusion Models for Probabilistic Forecasting of Complex Dynamics
- Emergence and Evolution of Interpretable Concepts in Diffusion Models
- Enhancing Diffusion-based Unrestricted Adversarial Attacks via Adversary Preferences Alignment
- Entropy Rectifying Guidance for Diffusion and Flow Models
- Fading to Grow: Growing Preference Ratios via Preference Fading Discrete Diffusion for Recommendation
- Fast Monte Carlo Tree Diffusion: 100× Speedup via Parallel and Sparse Planning
- Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
- FlashMo: Geometric Interpolants and Frequency-Aware Sparsity for Scalable Efficient Motion Generation
- FreeControl: Efficient, Training-Free Structural Control via One-Step Attention Extraction
- From Softmax to Score: Transformers Can Effectively Implement In-Context Denoising Steps
- GLID$^2$E: A Gradient-Free Lightweight Fine-tune Approach for Discrete Biological Sequence Design
- Generation as Search Operator for Test-Time Scaling of Diffusion-based Combinatorial Optimization
- Generative Data Augmentation via Diffusion Distillation, Adversarial Alignment, and Importance Reweighting
- Generative Trajectory Stitching through Diffusion Composition
- Greed is Good: A Unifying Perspective on Guided Generation
- GuideFlow3D: Optimization-Guided Rectified Flow For Appearance Transfer
- HiFlow: Training-free High-Resolution Image Generation with Flow-Aligned Guidance
- Hierarchical Koopman Diffusion: Fast Generation with Interpretable Diffusion Trajectory
- Image Editing As Programs with Diffusion Models
- Improving Progressive Generation with Decomposable Flow Matching
- Inference-Time Scaling for Flow Models via Stochastic Generation and Rollover Budget Forcing
- Injecting Frame-Event Complementary Fusion into Diffusion for Optical Flow in Challenging Scenes
- InstanceAssemble: Layout-Aware Image Generation via Instance Assembling Attention
- InvFusion: Bridging Supervised and Zero-shot Diffusion for Inverse Problems
- Is Artificial Intelligence Generated Image Detection a Solved Problem?
- Is Your Diffusion Model Actually Denoising?
- Kernel Density Steering: Inference-Time Scaling via Mode Seeking for Image Restoration
- LABridge: Text–Image Latent Alignment Framework via Mean-Conditioned OU Process
- Latent Refinement via Flow Matching for Training-free Linear Inverse Problem Solving
- Learning Diffusion Models with Flexible Representation Guidance
- Learning Individual Behavior in Agent-Based Models with Graph Diffusion Networks
- Linear Differential Vision Transformer: Learning Visual Contrasts via Pairwise Differentials
- Linearly Constrained Diffusion Implicit Models
- Listwise Preference Diffusion Optimization for User Behavior Trajectories Prediction
- Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation
- MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
- Measure gradients, not activations! Enhancing neuronal activity in deep reinforcement learning
- Mind-the-Glitch: Visual Correspondence for Detecting Inconsistencies in Subject-Driven Generation
- Mitigating Occlusions in Virtual Try-On via A Simple-Yet-Effective Mask-Free Framework
- Mitigating Sexual Content Generation via Embedding Distortion in Text-conditioned Diffusion Models
- MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation
- Multitask Learning with Stochastic Interpolants
- NPN: Non-Linear Projections of the Null-Space for Imaging Inverse Problems
- Nabla-R2D3: Effective and Efficient 3D Diffusion Alignment with 2D Rewards
- Neural Entropy
- Neural Hamiltonian Diffusions for Modeling Structured Geometric Dynamics
- Neural-Driven Image Editing
- NeuroRenderedFake: A Challenging Benchmark to Detect Fake Images Generated by Advanced Neural Rendering Methods
- Noise Hypernetworks: Amortizing Test-Time Compute in Diffusion Models
- Noise Matters: Optimizing Matching Noise for Diffusion Classifiers
- Normalized Attention Guidance: Universal Negative Guidance for Diffusion Models
- Normalizing Flows are Capable Models for Continuous Control
- ObCLIP: Oblivious CLoud-Device Hybrid Image Generation with Privacy Preservation
- OmniConsistency: Learning Style-Agnostic Consistency from Paired Stylization Data
- On Efficiency-Effectiveness Trade-off of Diffusion-based Recommenders
- On Inductive Biases That Enable Generalization in Diffusion Transformers
- On scalable and efficient training of diffusion samplers
- On the Edge of Memorization in Diffusion Models
- Personalized Image Editing in Text-to-Image Diffusion Models via Collaborative Direct Preference Optimization
- Personalized Visual Content Generation in Conversational Systems
- Perturb a Model, Not an Image: Towards Robust Privacy Protection via Anti-Personalized Diffusion Models
- Physics-Driven Spatiotemporal Modeling for AI-Generated Video Detection
- Pin the Tail on the Model: Blindfolded Repair of User-Flagged Failures in Text-to-Image Services
- PoGDiff: Product-of-Gaussians Diffusion Models for Imbalanced Text-to-Image Generation
- Posterior Sampling by Combining Diffusion Models with Annealed Langevin Dynamics
- Principled Long-Tailed Generative Modeling via Diffusion Models
- Prior-Guided Diffusion Planning for Offline Reinforcement Learning
- Promptable 3-D Object Localization with Latent Diffusion Models
- RODS: Robust Optimization Inspired Diffusion Sampling for Detecting and Reducing Hallucination in Generative Models
- Radial Attention: $\mathcal O(n \log n)$ Sparse Attention for Long Video Generation
- Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos
- Remasking Discrete Diffusion Models with Inference-Time Scaling
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You Think
- Repurposing AlphaFold3-like Protein Folding Models for Antibody Sequence and Structure Co-design
- RespoDiff: Dual-Module Bottleneck Transformation for Responsible & Faithful T2I Generation
- Revisiting Multi-Agent World Modeling from a Diffusion-Inspired Perspective
- Reward-Instruct: A Reward-Centric Approach to Fast Photo-Realistic Image Generation
- Role Bias in Diffusion Models: Diagnosing and Mitigating through Intermediate Decomposition
- RrED: Black-box Unsupervised Domain Adaptation via Rectifying-reasoning Errors of Diffusion
- SPARKE: Scalable Prompt-Aware Diversity and Novelty Guidance in Diffusion Models via RKE Score
- SPRO: Improving Image Generation via Self-Play
- Safe and Stable Control via Lyapunov-Guided Diffusion Models
- Scaling Offline RL via Efficient and Expressive Shortcut Models
- Score-informed Neural Operator for Enhancing Ordering-based Causal Discovery
- Seeds of Structure: Patch PCA Reveals Universal Compositional Cues in Diffusion Models
- Seg2Any: Open-set Segmentation-Mask-to-Image Generation with Precise Shape and Semantic Control
- Shallow Diffuse: Robust and Invisible Watermarking through Low-Dim Subspaces in Diffusion Models
- Shortcutting Pre-trained Flow Matching Diffusion Models is Almost Free Lunch
- Simple Distillation for One-Step Diffusion Models
- Single-Step Operator Learning for Conditioned Time-Series Diffusion Models
- Spectral Analysis of Diffusion Models with Application to Schedule Design
- Spiral: Semantic-Aware Progressive LiDAR Scene Generation and Understanding
- StableGuard: Towards Unified Copyright Protection and Tamper Localization in Latent Diffusion Models
- State Size Independent Statistical Error Bound for Discrete Diffusion Models
- Steering Generative Models with Experimental Data for Protein Fitness Optimization
- Streaming Audio Generation from Discrete Tokens via Streaming Flow Matching
- StruDiCO: Structured Denoising Diffusion with Gradient-free Inference-stage Boosting for Memory and Time Efficient Combinatorial Optimization
- T2SMark: Balancing Robustness and Diversity in Noise-as-Watermark for Diffusion Models
- T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
- TADA: Improved Diffusion Sampling with Training-free Augmented DynAmics
- Text to Sketch Generation with Multi-Styles
- TimeWak: Temporal Chained-Hashing Watermark for Time Series Data
- Token Perturbation Guidance for Diffusion Models
- Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge
- Towards Reliable Identification of Diffusion-based Image Manipulations
- Towards Resilient Safety-driven Unlearning for Diffusion Models against Downstream Fine-tuning
- Tracing the Roots: Leveraging Temporal Dynamics in Diffusion Trajectories for Origin Attribution
- Training-Free Guidance Beyond Differentiability: Scalable Path Steering with Tree Search in Diffusion and Flow Models
- Training-Free Safe Denoisers for Safe Use of Diffusion Models
- Training-Free Safe Text Embedding Guidance for Text-to-Image Diffusion Models
- Transition Matching: Scalable and Flexible Generative Modeling
- Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising
- UGoDIT: Unsupervised Group Deep Image Prior Via Transferable Weights
- Uncertainty-Aware Multi-Objective Reinforcement Learning-Guided Diffusion Models for 3D De Novo Molecular Design
- Understanding Representation Dynamics of Diffusion Models via Low-Dimensional Modeling
- Uni-Instruct: One-step Diffusion Model through Unified Diffusion Divergence Instruction
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- Universal Few-shot Spatial Control for Diffusion Models
- Unleashing the Power of One-Step Diffusion based Image Super-Resolution via a Large-Scale Diffusion Discriminator
- Unlocking Dataset Distillation with Diffusion Models
- Unlocking hidden biomolecular conformational landscapes in diffusion models at inference time
- Unveiling Concept Attribution in Diffusion Models
- VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models
- VTON-VLLM: Aligning Virtual Try-On Models with Human Preferences
- Value Diffusion Reinforcement Learning
- VarFlow: Proper Scoring-Rule Diffusion Distillation via Energy Matching
- VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models
- ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models
- When Are Concepts Erased From Diffusion Models?
- Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models
- Why Diffusion Models Don’t Memorize: The Role of Implicit Dynamical Regularization in Training
- Why Diffusion Models Don’t Memorize: The Role of Implicit Dynamical Regularization in Training
- X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability