perception
- CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
- Caption This, Reason That: VLMs Caught in the Middle
- Impromptu VLA: Open Weights and Open Data for Driving Vision-Language-Action Models
- MMCSBench: A Fine-Grained Benchmark for Large Vision-Language Models in Camouflage Scenes
- WorldMem: Long-term Consistent World Simulation with Memory