Sirui Han
- Generative RLHF-V: Learning Principles from Multi-modal Human Preference
- IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering
- InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
- Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
- Semantic-guided Diverse Decoding for Large Language Model