FairImagen: Post-Processing for Bias Mitigation in Text-to-Image Models

Zihao Fu (The Chinese University of Hong Kong) · Ryan Brown (University of Oxford) · Shun Shao (University of Cambridge) · Kai Rawal (University of Oxford) · Eoin Delaney (University of Oxford) · Chris Russell (Amazon Web Services)
clip-based input embeddingscross-demographic projectiondebiasing frameworkempirical noise injectionfair principal component analysisfairimagenfairness improvementgroup-specific informationimage quality trade-offintersectional settingsmodel-agnostic solutionprompt embeddingssemantic contentsimultaneous debiasingsocietal biasestext-to-image diffusion models

Text-to-image diffusion models, such as Stable Diffusion, have demonstrated remarkable capabilities in generating high-quality and diverse images from natural language prompts. However, recent studies reveal that these models often replicate and amplify societal biases, particularly along demographic attributes like gender and race. In this paper, we introduce FairImagen (https://github.com/fuzihaofzh/FairImagen), a post-hoc debiasing framework that operates on prompt embeddings to mitigate such biases without retraining or modifying the underlying diffusion model. Our method integrates Fair Principal Component Analysis to project CLIP-based input embeddings into a subspace that minimizes group-specific information while preserving semantic content. We further enhance debiasing effectiveness through empirical noise injection and propose a unified cross-demographic projection method that enables simultaneous debiasing across multiple demographic attributes. Extensive experiments across gender, race, and intersectional settings demonstrate that FairImagen significantly improves fairness with a moderate trade-off in image quality and prompt fidelity. Our framework outperforms existing post-hoc methods and offers a simple, scalable, and model-agnostic solution for equitable text-to-image generation.