Siyu Yuan
- ARIA: Training Language Agents with Intention-driven Reward Aggregation
- Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
- KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
- ORIGAMISPACE: Benchmarking Multimodal LLMs in Multi-Step Spatial Reasoning with Mathematical Constraints
- The Lighthouse of Language: Enhancing LLM Agents via Critique-Guided Improvement