PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models

Yi Hu (Peking University) · Muhan Zhang (Peking University) · Zheyu Shen (Peking University) · Shi Qiu (Peking University) · Tianyu Zhang (Autodesk) · Jiaming Ji (Peking University) · Qi Liu (Bytedance Inc.) · Shaoyang Guo (Peking University) · Zhuo-Yang Song (Peking University) · Yunbo Sun (Peking University) · Zeyu Cai (Peking University) · Jiashen Wei (Peking University) · Tianyu Luo (Peking University) · Yixuan Yin (Peking University) · Zhang Haoxu (Peking University) · Chenyang Wang (Peking University) · Chencheng Tang (Peking University) · Haoling Chang (Peking University) · Ziheng Zhou (Peking University) · Jingtian Zhang (Peking University) · Zhangyi Liu (Peking University) · Minghao Li (Peking University) · Yuku Zhang (Peking University) · Boxuan Jing (Peking University) · Xianqi Yin (Peking University) · Yutong Ren (Peking University) · Zizhuo Fu (Peking university) · Weike Wang (Peking University) · Xudong Tian (Peking University) · Anqi Lv (Peking University) · Laifu Man (Peking University) · Jianxiang Li (Peking University) · Feiyu Tao (Peking University) · Qihua Sun (Peking University) · Zhou Liang (Peking University) · Yushu Mu (Peking University) · Zhongxuan Li (Peking University) · Jing-Jun Zhang (Peking University) · Shutao Zhang (Peking University) · Xiaotian Li (北京大学) · Xingqi Xia (Peking University) · Jiawei Lin (Peking University) · Jiahang Chen (Peking University) · Qiuhao Xiong (Peking University) · Binran Wang (Peking University) · Fengyuan Wang (Peking University) · Niziyang (Peking University) · Bohan Zhang (Peking University) · Fan Cui (Peking University) · shaochangkun (Peking University) · Qing-Hong Cao (Peking University) · Ming-xing Luo (Beijing Computational Science Research Center) · Hua Xing Zhu (Peking University)
benchmark resultsdata contaminationevaluation precisionexpression edit distanceflawed evaluation itemsmathematical expression assessmentmulti-condition reasoningmulti-step reasoningoriginal physics problemsphybenchreasoning capabilitiesreasoning robustnesssample efficiencysystematic curation

Current benchmarks for evaluating the reasoning capabilities of Large Language Models (LLMs) face significant limitations: task oversimplification, data contamination, and flawed evaluation items. These deficiencies necessitate more rigorous assessment methods. To address these limitations, we introduce PHYBench, a benchmark of 500 original physics problems ranging from high school to Physics Olympiad difficulty. PHYBench addresses data contamination through original content and employs a systematic curation pipeline to eliminate flawed items. Evaluations show that PHYBench activates more tokens and provides stronger differentiation between reasoning models compared to other baselines like AIME 2024, OlympiadBench and GPQA. Even the best-performing model, Gemini 2.5 Pro, achieves only 36.9\% accuracy compared to human experts' 61.9\%. To further enhance evaluation precision, we introduce the Expression Edit Distance (EED) Score for mathematical expression assessment, which improves sample efficiency by 204\% over binary scoring. Moreover, PHYBench effectively elicits multi-step and multi-condition reasoning, providing a platform for examining models' reasoning robustness, preferences, and deficiencies. The benchmark results and dataset are publicly available at https://www.phybench.cn/.