cross-modal reasoning
- Benchmarking Retrieval-Augmented Multimomal Generation for Document Question Answering
- C3Po: Cross-View Cross-Modality Correspondence by Pointmap Prediction
- TRAP: Targeted Redirecting of Agentic Preferences
- Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation