Jiaming Ji
- Generative RLHF-V: Learning Principles from Multi-modal Human Preference
- InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback
- PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models
- Safe RLHF-V: Safe Reinforcement Learning from Multi-modal Human Feedback
- SafeVLA: Towards Safety Alignment of Vision-Language-Action Model via Constrained Learning