end-to-end evaluation
- AstroVisBench: A Code Benchmark for Scientific Computing and Visualization in Astronomy
- ClinicalLab: Aligning Agents for Multi-Departmental Clinical Diagnostics in the Real World
- MLR-Bench: Evaluating AI Agents on Open-Ended Machine Learning Research
- WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks