depth information
- 4D-VLA: Spatiotemporal Vision-Language-Action Pretraining with Cross-Scene Calibration
- BevSplat: Resolving Height Ambiguity via Feature-Based Gaussian Primitives for Weakly-Supervised Cross-View Localization
- SSR: Enhancing Depth Perception in Vision-Language Models via Rationale-Guided Spatial Reasoning