Li Shen
- Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- AlphaDecay: Module-wise Weight Decay for Heavy-Tailed Balancing in LLMs
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- CHPO: Constrained Hybrid-action Policy Optimization for Reinforcement Learning
- Continual Model Merging without Data: Dual Projections for Balancing Stability and Plasticity
- Effective Policy Learning for Multi-Agent Online Coordination Beyond Submodular Objectives
- Efficient Federated Learning against Byzantine Attacks and Data Heterogeneity via Aggregating Normalized Gradients
- Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
- Merging on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
- Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
- MixPrompt: Efficient Mixed Prompting for Multimodal Semantic Segmentation
- Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
- On the Empirical Power of Goodness-of-Fit Tests in Watermark Detection
- Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
- R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
- RoMa: A Robust Model Watermarking Scheme for Protecting IP in Diffusion Models
- Robust Policy Expansion for Offline-to-Online RL under Diverse Data Corruption
- RobustMerge: Parameter-Efficient Model Merging for MLLMs with Direction Robustness
- Self-Verification Provably Prevents Model Collapse in Recursive Synthetic Training
- Stochastic Regret Guarantees for Online Zeroth- and First-Order Bilevel Optimization
- Tackling Continual Offline RL through Selective Weights Activation on Aligned Spaces
- Unveiling the Power of Multiple Gossip Steps: A Stability-Based Generalization Analysis in Decentralized Training
- Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought
- Value-Guided Decision Transformer: A Unified Reinforcement Learning Framework for Online and Offline Settings