NeurIPS 2025 Explorer
Concepts
Authors
Glossary
johnsanterre.github.io
correctness
3 papers
Credal Prediction based on Relative Likelihood
Inference-Time Reward Hacking in Large Language Models
Risk Management for Mitigating Benchmark Failure Modes: BenchRisk