spatial reasoning
The cognitive capability of relating and manipulating spatial properties, such as the arrangement of objects and their spatial relationships, crucial for tasks that involve understanding environments, maps, or layouts.
- BeliefMapNav: 3D Voxel-Based Belief Map for Zero-Shot Object Navigation
- Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
- ChatVLA-2: Vision-Language-Action Model with Open-World Reasoning
- Direct Numerical Layout Generation for 3D Indoor Scene Synthesis via Spatial Reasoning
- Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation
- Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
- Envisioning Beyond the Pixels: Benchmarking Reasoning-Informed Visual Editing
- Factorio Learning Environment
- Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs
- From Flatland to Space: Teaching Vision-Language Models to Perceive and Reason in 3D
- From Objects to Anywhere: A Holistic Benchmark for Multi-level Visual Grounding in 3D Scenes
- Hierarchical Semantic-Augmented Navigation: Optimal Transport and Graph-Driven Reasoning for Vision-Language Navigation
- Knot So Simple: A Minimalistic Environment for Spatial Reasoning
- LTD-Bench: Evaluating Large Language Models by Letting Them Draw
- Learning from Videos for 3D World: Enhancing MLLMs with 3D Vision Geometry Priors
- MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
- MetaFind: Scene-Aware 3D Asset Retrieval for Coherent Metaverse Scene Generation
- MindJourney: Test-Time Scaling with World Models for Spatial Reasoning
- MineAnyBuild: Benchmarking Spatial Planning for Open-world AI Agents
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- PeRL: Permutation-Enhanced Reinforcement Learning for Interleaved Vision-Language Reasoning
- PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly
- Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing
- Robo2VLM: Improving Visual Question Answering using Large-Scale Robot Manipulation Data
- Robot-R1: Reinforcement Learning for Enhanced Embodied Reasoning in Robotics
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models
- SoFar: Language-Grounded Orientation Bridges Spatial Reasoning and Object Manipulation
- SolidGeo: Measuring Multimodal Spatial Math Reasoning in Solid Geometry
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- Spatially-aware Weights Tokenization for NeRF-Language Models
- Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs
- Surprise3D: A Dataset for Spatial Understanding and Reasoning in Complex 3D Scenes
- Talk2Event: Grounded Understanding of Dynamic Scenes from Event Cameras
- Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
- VLM-R³: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought
- Video Perception Models for 3D Scene Synthesis
- VideoCAD: A Dataset and Model for Learning Long‑Horizon 3D CAD UI Interactions from Video
- Visual Structures Help Visual Reasoning: Addressing the Binding Problem in LVLMs
- World-aware Planning Narratives Enhance Large Vision-Language Model Planner
- iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning