VADB: A Large-Scale Video Aesthetic Database with Professional and Multi-Dimensional Annotations

Heng Huang (University of Maryland College Park) · Jun Zhou (Ant Financial) · Xin Jin (Eastern Institute of Technology, Ningbo) · Qianqian Qiao (Nanjing University) · DanDan Zheng (Alibaba Group) · Yihang Bo (Beijing Film Academy) · Bao Peng (Beijing Film Academy) · Longteng Jiang (Beijing Electronic Science and Technology Institute) · HuayeWang (Beijing Electronic Science and TechnologyInstitute) · Jingdong Chen (Ant Group)
aesthetic dimensionscomputer visiondownstream tasksdual-modal pre-traininghuman cognitionmultimedia computingmultimodal fusionrobust modelsscoring tasksstandardized datasetstemporal dynamicstwo-stage training strategyvadbvideo aesthetic assessmentvideo quality assessment

Video aesthetic assessment, a vital area in multimedia computing, integrates computer vision with human cognition. Its progress is limited by the lack of standardized datasets and robust models, as the temporal dynamics of video and multimodal fusion challenges hinder direct application of image-based methods. This study introduces VADB, the largest video aesthetic database with 10,490 diverse videos annotated by 37 professionals across multiple aesthetic dimensions, including overall and attribute-specific aesthetic scores, rich language comments and objective tags. We propose VADB-Net, a dual-modal pre-training framework with a two-stage training strategy, which outperforms existing video quality assessment models in scoring tasks and supports downstream video aesthetic assessment tasks. The dataset and source code are available at https://github.com/BestiVictory/VADB.