Conghui He
- BLINK-Twice: You see, but do you observe? A Reasoning Benchmark on Visual Perception
- Efficient Multi-modal Large Language Models via Progressive Consistency Distillation
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- Multi-step Visual Reasoning with Visual Tokens Scaling and Verification
- Scaling Code-Assisted Chain-of-Thoughts and Instructions for Model Reasoning
- Spot the Fake: Large Multimodal Model-Based Synthetic Image Detection with Artifact Explanation