Sharon Li
- Can DPO Learn Diverse Human Values? A Theoretical Scaling Law
- Clean First, Align Later: Benchmarking Preference Data Cleaning for Reliable LLM Alignment
- Debate or Vote: Which Yields Better Decisions in Multi-Agent Large Language Models?
- GLSim: Detecting Object Hallucinations in LVLMs via Global-Local Similarity
- GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization
- Harnessing Feature Resonance under Arbitrary Target Alignment for Out-of-Distribution Node Detection
- Limited Preference Data? Learning Better Reward Model with Latent Space Synthesis
- MetaMind: Modeling Human Social Thoughts with Metacognitive Multi-Agent Systems
- Towards Interpretability Without Sacrifice: Faithful Dense Layer Decomposition with Mixture of Decoders
- Visual Instruction Bottleneck Tuning
- Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator