相关实验视频
Updated: Jan 18, 2026

13:19
Deep Neural Networks for Image-Based Dietary Assessment
Published on: March 13, 2021
9.9K
AraTraditions10k将文化联系起来,提供了一个全面的数据集,用于增强跨语言的图像注释检索和标记
Emran Al-Buraihy1, Zengkang Gan2, Dan Wang3
1Faculty of Information Technology, Beijing University of Technology, Beijing, 100124, China.
Scientific reports
|June 4, 2025
概括
一个新的数据集,AraTraditions10k,通过提供10,000个文化丰富的图像与阿拉伯语和英语注释来增强跨语言多媒体分析. 机器学习模型显示,图像标记和句子推任务的显著改进.
科学领域:
- 计算机科学 计算机科学
- 人工智能的人工智能
- 自然语言处理自然语言处理.
背景情况:
- 数字多媒体内容的扩散需要先进的跨语言理解系统.
- 现有的研究主要集中在单语言任务上,这在跨语言多媒体分析中造成了差距,特别是对于非英语语言.
研究的目的:
- 介绍AraTraditions10k,一个用于跨语言图像注释,检索和标记的新型数据集,专注于阿拉伯语和英语.
- 开发和评估用于增强跨语言多媒体任务的先进机器学习模型.
主要方法:
- 策划了1万张描绘阿拉伯文化图像的数据集,其中有五个现代标准阿拉伯语 (MSA) 字幕和专业的英语翻译.
- 开发和增强机器学习模型,包括多层感知器 (MLP) 用于标签推和Word2VisualVec (W2VV) 用于句子推,具有注意力机制和对比损失功能.
主要成果:
- 标签推系统实现了93%的top-1准确性.
- 英语的句子推系统获得了很高的分数:BLEU-4 (78.2),METEOR (68.3),ROUGE-L (75.8),CIDEr (136.7) 和SPICE (52.0).
结论:
- AraTraditions10k解决了语言和文化差距,为多语言数据集设定了新的基准.
- 开发的模型显示出显著的性能改进,推进跨语言多媒体分析和文化敏感技术开发.

