data quality
Data quality refers to the accuracy, completeness, and relevance of data used for training AI models, directly impacting their performance and effectiveness in real-world applications.
- Adaptive Neighborhood-Constrained Q Learning for Offline Reinforcement Learning
- CLIMB: Class-imbalanced Learning Benchmark on Tabular Data
- CoralVQA: A Large-Scale Visual Question Answering Dataset for Coral Reef Image Understanding
- DCAD-2000: A Multilingual Dataset across 2000+ Languages with Data Cleaning as Anomaly Detection
- DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
- Diversity-Aware Policy Optimization for Large Language Model Reasoning
- Fairshare Data Pricing via Data Valuation for Large Language Models
- Fixing It in Post: A Comparative Study of LLM Post-Training Data Quality and Model Performance
- GRIP: A Graph-Based Reasoning Instruction Producer
- MuRating: A High Quality Data Selecting Approach to Multilingual Large Language Model Pretraining
- P-Law: Predicting Quantitative Scaling Law with Entropy Guidance in Large Recommendation Models
- PANGEA: Projection-Based Augmentation with Non-Relevant General Data for Enhanced Domain Adaptation in LLMs
- SIGMA: Refining Large Language Model Reasoning via Sibling-Guided Monte Carlo Augmentation
- Señorita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists