multimodal datasets
Multimodal datasets encompass data from multiple sources or modalities, such as text, images, and audio. They are crucial for training models capable of understanding and integrating various forms of information, resulting in improved performance across diverse tasks.
- A Multimodal BiMamba Network with Test-Time Adaptation for Emotion Recognition Based on Physiological Signals
- AnomalyCoT: A Multi-Scenario Chain-of-Thought Dataset for Multimodal Large Language Models
- Counterfactual Evolution of Multimodal Datasets via Visual Programming
- CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning
- Data-Juicer 2.0: Cloud-Scale Adaptive Data Processing for and with Foundation Models
- Efficient Multimodal Dataset Distillation via Generative Models
- MRSAudio: A Large-Scale Multimodal Recorded Spatial Audio Dataset with Refined Annotations
- Robust Cross-modal Alignment Learning for Cross-Scene Spatial Reasoning and Grounding
- Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
- scGeneScope: A Treatment-Matched Single Cell Imaging and Transcriptomics Dataset and Benchmark for Treatment Response Modeling