Yue Zhang
- Learning to Rank for In-Context Example Retrieval
- Learning to Reason under Off-Policy Guidance
- SWE-SQL: Illuminating LLM Pathways to Solve User SQL Issues in Real-World Applications
- SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines
- ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning