visual language models
- Benchmarking Retrieval-Augmented Multimomal Generation for Document Question Answering
- GRE Suite: Geo-localization Inference via Fine-Tuned Vision-Language Models and Enhanced Reasoning Chains
- Gaze-VLM: Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding
- Towards Visualization-of-Thought Jailbreak Attack against Large Visual Language Models
- VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree