Weinan Zhang
- AgentNet: Decentralized Evolutionary Coordination for LLM-based Multi-Agent Systems
- Flexible Realignment of Language Models
- GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning
- Information-Theoretic Reward Decomposition for Generalizable RLHF
- KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills
- MobileUse: A Hierarchical Reflection-Driven GUI Agent for Autonomous Mobile Operation
- ReMA: Learning to Meta-Think for LLMs with Multi-agent Reinforcement Learning
- Stop DDoS Attacking the Research Community with AI-Generated Survey Papers
- ThinkBench: Dynamic Out-of-Distribution Evaluation for Robust LLM Reasoning
- Uni-RL: Unifying Online and Offline RL via Implicit Value Regularization