multimodal tasks
Tasks that involve processing and integrating data from multiple modalities (text, imagery, sound) to achieve a coherent outcome. They highlight the necessity for AI systems to operate across diverse data types.
- Energy-based generator matching: A neural sampler for general state space
- Enhancing Vision-Language Model Reliability with Uncertainty-Guided Dropout Decoding
- Flex-Judge: Text-Only Reasoning Unleashes Zero-Shot Multimodal Evaluators
- Latent Space Factorization in LoRA
- REOBench: Benchmarking Robustness of Earth Observation Foundation Models
- RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
- SMMILE: An expert-driven benchmark for multimodal medical in-context learning
- Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning
- Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning
- Sherlock: Self-Correcting Reasoning in Vision-Language Models
- TaiwanVQA: Benchmarking and Enhancing Cultural Understanding in Vision-Language Models
- UniViT: Unifying Image and Video Understanding in One Vision Encoder
- Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model
- Visual Thoughts: A Unified Perspective of Understanding Multimodal Chain-of-Thought
- un$^2$CLIP: Improving CLIP's Visual Detail Capturing Ability via Inverting unCLIP