multimodal reasoning
The ability of an AI system to integrate and reason across multiple types or modalities of data, such as text, images, and audio, to enhance understanding and decision-making in complex scenarios.
- Accelerating Multimodal Large Language Models via Dynamic Visual-Token Exit and the Empirical Findings
- Bifrost-1: Bridging Multimodal LLMs and Diffusion Models with Patch-level CLIP Latents
- DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge
- Fast-in-Slow: A Dual-System VLA Model Unifying Fast Manipulation within Slow Reasoning
- Language‑Bias‑Resilient Visual Question Answering via Adaptive Multi‑Margin Collaborative Debiasing
- MIRAGE: A Benchmark for Multimodal Information-Seeking and Reasoning in Agricultural Expert-Guided Conversations
- MMMG: A Massive, Multidisciplinary, Multi-Tier Generation Benchmark for Text-to-Image Reasoning
- Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Representation-Level Counterfactual Calibration for Debiased Zero-Shot Recognition
- Scientists' First Exam: Probing Cognitive Abilities of MLLM via Perception, Understanding, and Reasoning
- SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
- Towards General Continuous Memory for Vision-Language Models
- Unlocking Multimodal Mathematical Reasoning via Process Reward Model
- Unveiling Chain of Step Reasoning for Vision-Language Models with Fine-grained Rewards
- VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning
- Video Perception Models for 3D Scene Synthesis