Salesforce Researchers Introduce XGen-Image-1: A Text-To-Image Latent Diffusion Model
text-to-imagediffusion-modelslatent-diffusionimage-generationgenerative-ai
Abstraction: Salesforce latent diffusion text-to-image model reusing pretrained components cheaply
Key points:
- XGen-Image-1 trained on LAION-2B dataset (aesthetic score 4.5+) using TPU v4s at a budget of ~$75K
- Performance matches Stable Diffusion 1.5/2.1 on CLIP Score and FID metrics; exceeds SD on FID
- Key innovation: combining a pretrained VAE with pixel upsamplers enables training at 32x32 resolution while generating 1024x1024 images
- Automated rejection sampling using PickScore evaluation during inference improves output quality
- Latent diffusion approach operates in compressed spatial domain rather than direct pixel space
- Reusing pretrained components (autoencoder, upsamplers) dramatically reduces training cost without sacrificing quality
Connections: Salesforce · Stable Diffusion · Diffusion Models · Text To Image · Generative AI