Chaoyou Fu
- MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios
- MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models
- VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction
- VITA-Audio: Fast Interleaved Audio-Text Token Generation for Efficient Large Speech-Language Model
- Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension
- Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs