Yunhang Shen
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
- VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model
- Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs