low-resource languages
Languages that have limited available training data and resources for AI applications, presenting challenges for natural language processing models.
- DCAD-2000: A Multilingual Dataset across 2000+ Languages with Data Cleaning as Anomaly Detection
- From Bytes to Ideas: Language Modeling with Autoregressive U-Nets
- GRAPE: Optimize Data Mixture for Group Robust Multi-target Adaptive Pretraining
- Linguini: A benchmark for language-agnostic linguistic reasoning
- PolyMath: Evaluating Mathematical Reasoning in Multilingual Contexts
- Toward a Vision-Language Foundation Model for Medical Data: Multimodal Dataset and Benchmarks for Vietnamese PET/CT Report Generation
- WolBanking77: Wolof Banking Speech Intent Classification Dataset