vision-language models
AI systems that integrate visual and linguistic data to perform tasks that require an understanding of both modalities, such as image captioning or visual question answering.
- $\Delta \mathrm{Energy}$: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization
- 3D-RAD: A Comprehensive 3D Radiology Med-VQA Dataset with Multi-Temporal Analysis and Diverse Diagnostic Tasks
- 4KAgent: Agentic Any Image to 4K Super-Resolution
- A Multimodal Benchmark for Framing of Oil & Gas Advertising and Potential Greenwashing Detection
- AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
- AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining
- AdvEDM: Fine-grained Adversarial Attack against VLM-based Embodied Agents
- Advancing Compositional Awareness in CLIP with Efficient Fine-Tuning
- AgMMU: A Comprehensive Agricultural Multimodal Understanding Benchmark
- AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
- Approximate Domain Unlearning for Vision-Language Models
- Attention! Your Vision Language Model Could Be Maliciously Manipulated
- Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- Benchmarking Egocentric Multimodal Goal Inference for Assistive Wearable Agents
- Bisecle: Binding and Separation in Continual Learning for Video Language Understanding
- BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models
- CF-VLM:CounterFactual Vision-Language Fine-tuning
- CLIPTTA: Robust Contrastive Vision-Language Test-Time Adaptation
- COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation
- CReFT-CAD: Boosting Orthographic Projection Reasoning for CAD via Reinforcement Fine-Tuning
- CURV: Coherent Uncertainty-Aware Reasoning in Vision-Language Models for X-Ray Report Generation
- Caption This, Reason That: VLMs Caught in the Middle
- ColorBench: Can VLMs See and Understand the Colorful World? A Comprehensive Benchmark for Color Perception, Reasoning, and Robustness
- CovMatch: Cross-Covariance Guided Multimodal Dataset Distillation with Trainable Text Encoder
- DOTA: Distributional Test-time Adaptation of Vision-Language Models
- Diffusion Model as a Noise-Aware Latent Reward Model for Step-Level Preference Optimization
- DisasterM3: A Remote Sensing Vision-Language Dataset for Disaster Damage Assessment and Response
- Discovering Compositional Hallucinations in LVLMs
- Disentanglement Beyond Static vs. Dynamic: A Benchmark and Evaluation Framework for Multi-Factor Sequential Representations
- Do LVLMs Truly Understand Video Anomalies? Revealing Hallucination via Co-Occurrence Patterns
- Domain Adaptive Hashing Retrieval via VLM Assisted Pseudo-Labeling and Dual Space Adaptation
- DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?
- Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning
- DyMU: Dynamic Merging and Virtual Unmerging for Efficient Variable-Length VLMs
- EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition
- Enhancing CLIP Robustness via Cross-Modality Alignment
- Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
- Explaining Similarity in Vision-Language Encoders with Weighted Banzhaf Interactions
- Exploiting the Asymmetric Uncertainty Structure of Pre-trained VLMs on the Unit Hypersphere
- Fast-Slow Thinking GRPO for Large Vision-Language Model Reasoning
- Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
- FedMGP: Personalized Federated Learning with Multi-Group Text-Visual Prompts
- Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- FlySearch: Exploring how vision-language models explore
- From Human Attention to Diagnosis: Semantic Patch-Level Integration of Vision-Language Models in Medical Imaging
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- GenIR: Generative Visual Feedback for Mental Image Retrieval
- GenSpace: Benchmarking Spatially-Aware Image Generation
- Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling
- Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency
- GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
- Glance2Gaze: Efficient Vision-Language Models from Glance Fusion to Gaze Compression
- GoalLadder: Incremental Goal Discovery with Vision-Language Models
- HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
- Hawaii: Hierarchical Visual Knowledge Transfer for Efficient Vision-Language Models
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models
- HoloLLM: Multisensory Foundation Model for Language-Grounded Human Sensing and Reasoning
- IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
- IRRISIGHT: A Large-Scale Multimodal Dataset and Scalable Pipeline to Address Irrigation and Water Management in Agriculture
- Image Token Matters: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing
- ImageSentinel: Protecting Visual Datasets from Unauthorized Retrieval-Augmented Image Generation
- Inner Speech as Behavior Guides: Steerable Imitation of Diverse Behaviors for Human-AI coordination
- JailBound: Jailbreaking Internal Safety Boundaries of Vision-Language Models
- LISAt: Language-Instructed Segmentation Assistant for Satellite Imagery
- LMFusion: Adapting Pretrained Language Models for Multimodal Generation
- LOMIA: Label-Only Membership Inference Attacks against Pre-trained Large Vision-Language Models
- LaViDa: A Large Diffusion Model for Vision-Language Understanding
- LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization
- MAPLE: Multi-scale Attribute-enhanced Prompt Learning for Few-shot Whole Slide Image Classification
- MIP against Agent: Malicious Image Patches Hijacking Multimodal OS Agents
- MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations
- MM-OPERA: Benchmarking Open-ended Association Reasoning for Large Vision-Language Models
- MMPB: It’s Time for Multi-Modal Personalization
- MR. Video: MapReduce as an Effective Principle for Long Video Understanding
- Machine Unlearning via Task Simplex Arithmetic
- Mars-Bench: A Benchmark for Evaluating Foundation Models for Mars Science Tasks
- MemEIC: A Step Toward Continual and Compositional Knowledge Editing
- MiCo: Multi-image Contrast for Reinforcement Visual Reasoning
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- Miss-ReID: Delivering Robust Multi-Modality Object Re-Identification Despite Missing Modalities
- MolVision: Molecular Property Prediction with Vision Language Models
- MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection
- Multi-Modal Interactive Agent Layer for Few-Shot Universal Cross-Domain Retrieval and Beyond
- Multi-scale Temporal Prediction via Incremental Generation and Multi-agent Collaboration
- NOVA: A Benchmark for Rare Anomaly Localization and Clinical Reasoning in Brain MRI
- NOVA: A Benchmark for Rare Anomaly Localization and Clinical Reasoning in Brain MRI
- NoisyRollout: Reinforcing Visual Reasoning with Data Augmentation
- NormFit: A Lightweight Solution for Few-Shot Federated Learning with Non-IID Data
- OPMapper: Enhancing Open-Vocabulary Semantic Segmentation with Multi-Guidance Information
- OmniSVG: A Unified Scalable Vector Graphics Generation Model
- On Epistemic Uncertainty of Visual Tokens for Object Hallucinations in Large Vision-Language Models
- One Head to Rule Them All: Amplifying LVLM Safety through a Single Critical Attention Head
- One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding
- OpenCUA: Open Foundations for Computer-Use Agents
- PAC Bench: Do Foundation Models Understand Prerequisites for Executing Manipulation Policies?
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation Models
- PUO-Bench: A Panel Understanding and Operation Benchmark with A Privacy-Preserving Framework
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding
- PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
- PhysX-3D: Physical-Grounded 3D Asset Generation
- Pixel Reasoner: Incentivizing Pixel Space Reasoning via Curiosity-Driven Reinforcement Learning
- Poison as Cure: Visual Noise for Mitigating Object Hallucinations in LVMs
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- QuARI: Query Adaptive Retrieval Improvement
- Quality-Driven Curation of Remote Sensing Vision-Language Data via Learned Scoring Models
- Quantifying Cross-Modality Memorization in Vision-Language Models
- ROVER: Recursive Reasoning Over Videos with Vision-Language Models for Embodied Tasks
- RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events
- ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding
- Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models
- Recognition through Reasoning: Reinforcing Image Geo-localization with Large Vision-Language Models
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Rendering-Aware Reinforcement Learning for Vector Graphics Generation
- Representation-Level Counterfactual Calibration for Debiased Zero-Shot Recognition
- Revisiting Logit Distributions for Reliable Out-of-Distribution Detection
- Robo2VLM: Improving Visual Question Answering using Large-Scale Robot Manipulation Data
- RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation
- Roboflow100-VL: A Multi-Domain Object Detection Benchmark for Vision-Language Models
- RobotSmith: Generative Robotic Tool Design for Acquisition of Complex Manipulation Skills
- Robust SuperAlignment: Weak-to-Strong Robustness Generalization for Vision-Language Models
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph Embedding
- SPRO: Improving Image Generation via Self-Play
- STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving
- Same Task, Different Circuits: Disentangling Modality-Specific Mechanisms in VLMs
- Scaffolding Dexterous Manipulation with Vision-Language Models
- Scaling RL to Long Videos
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models
- SketchMind: A Multi-Agent Cognitive Framework for Assessing Student-Drawn Scientific Sketches
- Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models
- Statistics Caching Test-Time Adaptation for Vision-Language Models
- Stitch and Tell: A Structured Data Augmentation Method for Spatial Understanding
- TRAP: Targeted Redirecting of Agentic Preferences
- TRoVe: Discovering Error-Inducing Static Feature Biases in Temporal Vision-Language Models
- TaiwanVQA: Benchmarking and Enhancing Cultural Understanding in Vision-Language Models
- Temporal Chain of Thought: Long-Video Understanding by Thinking in Frames
- Test-Time Adaptation of Vision-Language Models for Open-Vocabulary Semantic Segmentation
- Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models
- Text to Sketch Generation with Multi-Styles
- The Illusion of Progress? A Critical Look at Test-Time Adaptation for Vision-Language Models
- The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models
- Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
- Towards General Continuous Memory for Vision-Language Models
- Towards Self-Refinement of Vision-Language Models with Triangular Consistency
- Training-Free Test-Time Adaptation via Shape and Style Guidance for Vision-Language Models
- Uncertainty-quantified Rollout Policy Adaptation for Unlabelled Cross-domain Video Temporal Grounding
- Understanding and Rectifying Safety Perception Distortion in VLMs
- UniLumos: Fast and Unified Image and Video Relighting with Physics-Plausible Feedback
- Unified Reinforcement and Imitation Learning for Vision-Language Models
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR
- VIKI‑R: Coordinating Embodied Multi-Agent Cooperation via Reinforcement Learning
- VITRIX-CLIPIN: Enhancing Fine-Grained Visual Understanding in CLIP via Instruction-Editing Data and Long Captions
- VL-SAE: Interpreting and Enhancing Vision-Language Alignment with a Unified Concept Set
- VLM in a flash: I/O-Efficient Sparsification of Vision-Language Model via Neuron Chunking
- VLMs can Aggregate Scattered Training Patches
- VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models
- ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
- ViSpec: Accelerating Vision-Language Models with Vision-Aware Speculative Decoding
- VideoGameQA-Bench: Evaluating Vision-Language Models for Video Game Quality Assurance
- Vision Transformers Don't Need Trained Registers
- VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning
- Vision‑Language‑Vision Auto‑Encoder: Scalable Knowledge Distillation from Diffusion Models
- Visual Diversity and Region-aware Prompt Learning for Zero-shot HOI Detection
- Vocabulary-Guided Gait Recognition
- World-aware Planning Narratives Enhance Large Vision-Language Model Planner
- mmWalk: Towards Multi-modal Multi-view Walking Assistance