使用CUB数据集对印地语文到图像生成的语义映射
Nakkala Srinivas Mudiraj1, Satwinder Singh2
1Dept. of Computer Science & Technology, Central University of Punjab, Bathinda, India.
Scientific reports
|October 21, 2025
概括
本研究介绍了印度语文到图像生成的生成对抗网络 (GAN) 模型. 该模型成功地从印度语描述中创建现实的图像,弥合了区域语言AI能力的差距.
科学领域:
- 人工智能的人工智能
- 计算机视觉 计算机视觉
- 自然语言处理自然语言处理.
背景情况:
- 生成式学习模型通过从现有数据集中学习模式来创建新数据.
- 文本到图像 (T2I) 生成模型从文本描述中创建图像.
- 对于区域语言的T2I模型存在重大差距,限制了视觉内容的创建.
研究的目的:
- 通过使用生成对抗网络 (GAN) 提出印度语文到图像生成的语义映射.
- 开发和评估一个基于印度语语言数据训练的区域T2I模型.
- 解决当前T2I模型在处理区域语言输入方面的局限性.
主要方法:
- 使用生成对抗网络 (GANs) 进行语义映射.
- 为模型培训准备和预处理印度语数据集.
- 使用加州理工大学鸟类200 (CUB) 数据集作为实验的主要数据来源.
主要成果:
- 拟议的GAN模型在从印度语文中生成图像方面表现出强的性能.
- 获得了4.65的Inception得分和37.17的FID得分.
- 在印度文本和图像之间建立了一个新的语义对齐,R精度得分为75.12.
结论:
- 开发的模型显著提高了印度语的T2I生成能力.
- 该研究成功地弥合了区域语言T2I的差距,使区域文本能够实现现实的视觉创作.
- 这项工作代表了印度语文图像生成的语义对齐的开创性步骤.


