visual question answering
A task that involves answering questions about images using both visual content and textual information. It combines techniques from computer vision and natural language processing to create systems that can reason about visual scenes.
- AOR: Anatomical Ontology-Guided Reasoning for Medical Large Multimodal Model in Chest X-Ray Interpretation
- CXReasonBench: A Benchmark for Evaluating Structured Diagnostic Reasoning in Chest X-rays
- CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
- CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
- FOCUS: Internal MLLM Representations for Efficient Fine-Grained Visual Question Answering
- Fire360: A Benchmark for Robust Perception and Episodic Memory in Degraded 360° Firefighting Video
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
- Language‑Bias‑Resilient Visual Question Answering via Adaptive Multi‑Margin Collaborative Debiasing
- Multi-step Visual Reasoning with Visual Tokens Scaling and Verification
- Once Upon an Input: Reasoning via Per-Instance Program Synthesis
- PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
- QSVD: Efficient Low-rank Approximation for Unified Query-Key-Value Weight Compression in Low-Precision Vision-Language Models
- Robo2VLM: Improving Visual Question Answering using Large-Scale Robot Manipulation Data
- SceneForge: Enhancing 3D-text alignment with Structured Scene Compositions
- Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
- Towards Better Dental AI: A Multimodal Benchmark and Instruction Dataset for Panoramic X-ray Analysis
- WearVQA: A Visual Question Answering Benchmark for Wearables in Egocentric Authentic Real-world scenarios