Xin Li
- Diff-ICMH: Harmonizing Machine and Human Vision in Image Compression with Generative Prior
- EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?
- FOCUS: Unified Vision-Language Modeling for Interactive Editing Driven by Referential Segmentation
- FSI-Edit: Frequency and Stochasticity Injection for Flexible Diffusion-Based Image Editing
- From Kolmogorov to Cauchy: Shallow XNet Surpasses KANs
- The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio