Xuming Hu
- ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference
- Don't Just Chase “Highlighted Tokens” in MLLMs: Revisiting Visual Holistic Context Retention
- LoTA-QAF: Lossless Ternary Adaptation for Quantization-Aware Fine-Tuning
- RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video