failure modes
Failure modes are specific ways in which an AI model can fail or underperform. Understanding these modes is critical for evaluating model robustness and reliability, as it helps researchers identify potential pitfalls or biases in the system's decision-making process.
- DAVE: Diagnostic benchmark for Audio Visual Evaluation
- FP64 is All You Need: Rethinking Failure Modes in Physics-Informed Neural Networks
- Failure Prediction at Runtime for Generative Robot Policies
- FailureSensorIQ: A Multi-Choice QA Dataset for Understanding Sensor Relationships and Failure Modes
- FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges
- FlashMD: long-stride, universal prediction of molecular dynamics
- From Noise to Narrative: Tracing the Origins of Hallucinations in Transformers
- Grammars of Formal Uncertainty: When to Trust LLMs in Automated Reasoning Tasks
- HARDMath2: A Benchmark for Applied Mathematics Built by Students as Part of a Graduate Class
- Informed Correctors for Discrete Diffusion Models
- PolyJuice Makes It Real: Black-Box, Universal Red Teaming for Synthetic Image Detectors
- Rethinking Evaluation of Infrared Small Target Detection
- Risk Management for Mitigating Benchmark Failure Modes: BenchRisk
- Safety Depth in Large Language Models: A Markov Chain Perspective
- True Zero-Shot Inference of Dynamical Systems Preserving Long-Term Statistics
- miniF2F-Lean Revisited: Reviewing Limitations and Charting a Path Forward