multimodal benchmark
- ConnectomeBench: Can LLMs proofread the connectome?
- DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?
- MMCSBench: A Fine-Grained Benchmark for Large Vision-Language Models in Camouflage Scenes
- SeePhys: Does Seeing Help Thinking? – Benchmarking Vision-Based Physics Reasoning