Jiayi Ji
- GSAlign: Geometric and Semantic Alignment Network for Aerial-Ground Person Re-Identification
- JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
- MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension