visual priors
- Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
- Jasmine: Harnessing Diffusion Prior for Self-supervised Depth Estimation
- SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios
- Video Perception Models for 3D Scene Synthesis