generative capacity
- Aligning What Matters: Masked Latent Adaptation for Text-to-Audio-Video Generation
- IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
- REPA Works Until It Doesn’t: Early-Stopped, Holistic Alignment Supercharges Diffusion Training
- Value Diffusion Reinforcement Learning