Lichao Sun
- Analytic Energy-Guided Policy Optimization for Offline Reinforcement Learning
- BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization
- Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
- First SFT, Second RL, Third UPT: Continual Improving Multi-Modal LLM Reasoning via Unsupervised Post-Training
- Tackling Continual Offline RL through Selective Weights Activation on Aligned Spaces
- Towards Building Model/Prompt-Transferable Attackers against Large Vision-Language Models