training data selection
Training data selection is the process of choosing a subset of data that is representative and informative for training machine learning models. Proper selection can greatly affect model accuracy and generalization performance.
- A Plug-and-Play Query Synthesis Active Learning Framework for Neural PDE Solvers
- Angles Don’t Lie: Unlocking Training‑Efficient RL Through the Model’s Own Signals
- DATE-LM: Benchmarking Data Attribution Evaluation for Large Language Models
- Efficient Data Selection at Scale via Influence Distillation
- Graph Data Selection for Domain Adaptation: A Model-Free Approach
- UFO-RL: Uncertainty-Focused Optimization for Efficient Reinforcement Learning Data Selection