Dacheng Tao
- Ada-R1: Hybrid-CoT via Bi-Level Adaptive Reasoning Optimization
- AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding
- Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
- AiDE-Q: Synthetic Labeled Datasets Can Enhance Learning Models for Quantum Property Estimation
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- Consistent Paths Lead to Truth: Self-Rewarding Reinforcement Learning for LLM Reasoning
- D$^2$GS: Dense Depth Regularization for LiDAR-free Urban Scene Reconstruction
- Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
- Effective Policy Learning for Multi-Agent Online Coordination Beyond Submodular Objectives
- Merging on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging
- Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search
- On Geometry-Enhanced Parameter-Efficient Fine-Tuning for 3D Scene Segmentation
- Panacea: Mitigating Harmful Fine-tuning for Large Language Models via Post-fine-tuning Perturbation
- R1-ShareVL: Incentivizing Reasoning Capabilities of Multimodal Large Language Models via Share-GRPO
- SEGA: Shaping Semantic Geometry for Robust Hashing under Noisy Supervision
- SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding
- SeRL: Self-play Reinforcement Learning for Large Language Models with Limited Data
- Self-Verification Provably Prevents Model Collapse in Recursive Synthetic Training
- T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks
- Tackling Continual Offline RL through Selective Weights Activation on Aligned Spaces
- UltraVideo: High-Quality UHD Video Dataset with Comprehensive Captions
- VORTA: Efficient Video Diffusion via Routing Sparse Attention
- Value-Guided Decision Transformer: A Unified Reinforcement Learning Framework for Online and Offline Settings