vision language models
AI models that combine computer vision and natural language processing to understand and generate content from visual data in conjunction with textual information. They are critical for applications like image captioning and visual question answering.
- Best-of-N Jailbreaking
- CoFFT: Chain of Foresight-Focus Thought for Visual Language Models
- DenseDPO: Fine-Grained Temporal Preference Optimization for Video Diffusion Models
- FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
- Inference-Time Text-to-Video Alignment with Diffusion Latent Beam Search
- MuSLR: Multimodal Symbolic Logical Reasoning
- Object-centric binding in Contrastive Language-Image Pretraining
- PIPE: Physics-Informed Position Encoding for Alignment of Satellite Images and Time Series in Typhoon Forecasting
- Praxis-VLM: Vision-Grounded Decision Making via Text-Driven Reinforcement Learning
- SD-VLM: Spatial Measuring and Understanding with Depth-Encoded Vision-Language Models
- SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
- SharpZO: Hybrid Sharpness-Aware Vision Language Model Prompt Tuning via Forward-Only Passes
- Systematic Reward Gap Optimization for Mitigating VLM Hallucinations
- Too Late to Recall: Explaining the Two-Hop Problem in Multimodal Knowledge Retrieval
- VLMs have Tunnel Vision: Evaluating Nonlocal Visual Reasoning in Leading VLMs
- VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding