robustness to noise
- AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding
- SHGR: A Generalized Maximal Correlation Coefficient
- Structure-Aware Fusion with Progressive Injection for Multimodal Molecular Representation Learning
- Unified 2D-3D Discrete Priors for Noise-Robust and Calibration-Free Multiview 3D Human Pose Estimation