Wenhao Wu
- Mixture-of-Experts Meets In-Context Reinforcement Learning
- Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
- R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
- Text-to-Decision Agent: Offline Meta-Reinforcement Learning from Natural Language Supervision