cross-modal fusion
- $\texttt{AVROBUSTBENCH}$: Benchmarking the Robustness of Audio-Visual Recognition Models at Test-Time
- OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking
- RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis
- UniMRSeg: Unified Modality-Relax Segmentation via Hierarchical Self-Supervised Compensation