Seungryong Kim
- Active Test-time Vision-Language Navigation
- Emergent Temporal Correspondences from Video Diffusion Transformers
- Enhancing 3D Reconstruction for Dynamic Scenes
- First Attentions Last: Better Exploiting First Attentions for Efficient Parallel Training
- Seg4Diff: Unveiling Open-Vocabulary Semantic Segmentation in Text-to-Image Diffusion Transformers
- Where and How to Perturb: On the Design of Perturbation Guidance in Diffusion and Flow Models