REPA Works Until It Doesn’t: Early-Stopped, Holistic Alignment Supercharges Diffusion Training

Kai Wang (China Unicom) · Yang You (HPC-AI Technology LLC) · Ziqiao Wang (Tongji University) · Wangbo Zhao (National University of Singapore) · Yuhao Zhou (Sichuan University) · Zekai Li (UC San Diego) · Zhiyuan Liang (National University of Singapore) · Mingjia Shi (University of Virginia) · Xuanlei Zhao (National University of Singapore) · Pengfei Zhou (Agibot) · Kaipeng Zhang (Shanghai AI Laboratory) · Zhangyang "Atlas" Wang (University of Texas at Austin)
attention mapscapacity mismatchdenoisingdiffusion transformersefficient diffusion trainingfeature projectionsgenerative capacitygenerative teacherhidden featuresholistic alignment lossjoint data distributionone-shot terminationoptimization stepsrepresentation alignmentsemantic anchorstext-to-image

Diffusion Transformers (DiTs) deliver state-of-the-art image quality, yet their training remains notoriously slow. A recent remedy