candidate responses
- Generative RLHF-V: Learning Principles from Multi-modal Human Preference
- Language Ranker: A Lightweight Ranking framework for LLM Decoding
- Pairwise Calibrated Rewards for Pluralistic Alignment
- Reasoning Planning for Language Models
- Wider or Deeper? Scaling LLM Inference-Time Compute with Adaptive Branching Tree Search