Yibo Wang
- Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
- Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
- Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
- R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
- SPACE: Noise Contrastive Estimation Stabilizes Self-Play Fine-Tuning for Large Language Models
- Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs