vision-language tasks
Tasks that require the integration of visual and linguistic information, such as visual question answering or image captioning. These tasks assess the capability of models to understand and generate language based on visual context.
- Gatekeeper: Improving Model Cascades Through Confidence Tuning
- Hallucination at a Glance: Controlled Visual Edits and Fine-Grained Multimodal Learning
- UFO: A Unified Approach to Fine-grained Visual Perception via Open-ended Language Interface
- VCM: Vision Concept Modeling with Adaptive Vision Token Compression via Instruction Fine-Tuning
- Why 1 + 1 < 1 in Visual Token Pruning: Beyond Naive Integration via Multi-Objective Balanced Covering