Dongbin Zhao
- Equilibrium Policy Generalization: A Reinforcement Learning Framework for Cross-Graph Zero-Shot Generalization in Pursuit-Evasion Games
- Learning When to Think: Shaping Adaptive Reasoning in R1-Style Models via Multi-Stage RL
- Learning and Planning Multi-Agent Tasks via an MoE-based World Model
- Videos are Sample-Efficient Supervisions: Behavior Cloning from Videos via Latent Representations