Automated Quality Evaluation of Large-Scale Benchmark Datasets for Vision-Language Tasks

Ruibin Zhao1,2, Zhiwei Xie1, Yipeng Zhuang1

  • 1Department of Mathematics and Information Technology, The Education University of Hong Kong, Hong Kong SAR, P. R. China.

Summary

This study introduces an automated method to evaluate vision-language benchmark datasets. Findings reveal significant quality variations in ground-truth descriptions, with some being unreliable for AI model training.

Related Concept Videos