multi-modal models
Multi-modal models are designed to process and integrate information from multiple sources or modalities—such as text, images, audio, etc.—to improve understanding and performance on tasks that involve more than one type of data.
- Breaking the Compression Ceiling: Data-Free Pipeline for Ultra-Efficient Delta Compression
- CATransformers: Carbon Aware Transformers Through Joint Model-Hardware Optimization
- Conformal Prediction for Ensembles: Improving Efficiency via Score-Based Aggregation
- DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
- MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives
- RBench-V: A Primary Assessment for Visual Reasoning Models with Multimodal Outputs
- SpatialReasoner: Towards Explicit and Generalizable 3D Spatial Reasoning
- vHector and HeisenVec: Scalable Vector Graphics Generation Through Large Language Models