Xin Liu
- DAPO: An Open-Source LLM Reinforcement Learning System at Scale
- DUO: No Compromise to Accuracy Degradation
- Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization
- Learn and Ensemble Bridge Adapters for Multi-domain Task Incremental Learning
- RADAR: Benchmarking Language Models on Imperfect Tabular Data
- SensorLM: Learning the Language of Wearable Sensors
- SpecEM: Training-Free LLM Ensembling via Iterative Drafting, Verification, and Online Feedback
- Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations