针对视觉语言任务的大规模基准数据集的自动化质量评估
Ruibin Zhao1,2, Zhiwei Xie1, Yipeng Zhuang1
1Department of Mathematics and Information Technology, The Education University of Hong Kong, Hong Kong SAR, P. R. China.
International journal of neural systems
|February 6, 2024
概括
本研究引入了一种自动化方法来评估视觉语言基准数据集. 调查结果显示,基本真相描述的质量差异很大,其中一些对人工智能模型培训来说不可靠.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 机器学习 机器学习
背景情况:
- 大规模的基准数据集对于推进AI模型开发和性能评估至关重要.
- 现有的视觉语言数据集,如Flickr30k,COCO和NoCaps,将图像与文本描述结合起来.
研究的目的:
- 提出一种自动化方法来评估视觉语言任务的大规模基准数据集的质量.
- 识别这些数据集中基本真相描述可靠性的潜在问题.
主要方法:
- 开发一种新的跨模式匹配模型,自动对视觉图像进行文本描述的评分.
- 应用开发的模型来评估现有的视觉语言数据集,通过评分每个图像-描述对.
主要成果:
- 自动评分方法与手动评价有很好的一致性.
- 在基准数据集中发现了基本真相描述质量的显著差异.
- 发现相当一部分描述不适合作为可靠的基准真相参考.
结论:
- 拟议的自动化方法有效评估视觉语言数据集质量.
- 严格需要对公开可用的基准数据集进行仔细审查和利用.
- 提高数据集质量对于人工智能系统在视觉语言研究中的可靠进展至关重要.


