一种基于的方法与一个新的基准数据集,用于中国文本情感结构分析
Shufeng Xiong1, Xiaobo Fan1, Vishwash Batra2
1College of Information and Management Science, Henan Agricultural University, Zhengzhou 450046, China.
Entropy (Basel, Switzerland)
|May 27, 2023
概括
这项研究介绍了来自微博的新中国文本情感结构 (CTAS) 数据集,增强了AI.
科学领域:
- 人工智能的人工智能
- 自然语言处理自然语言处理.
- 计算语言学 计算语言学
背景情况:
- 对语言的情感理解对人工智能至关重要.
- 对于中国文字情感结构 (CTAS) 分析,需要大规模的注释数据集.
- 现有的CTAS数据集很少,这限制了研究进展.
研究的目的:
- 介绍一个新的基准数据集,用于中国文本情感结构 (CTAS).
- 通过全面的情感结构标签,促进更高层次的文档分析.
- 推进人工智能驱动的情感语言理解方面的研究.
主要方法:
- 开发了一个基于微博的数据集,利用一个流行的中国社交媒体平台.
- 整合了目前可用的最全面的情感结构标签.
- 提出了与神经网络特征集成的最大率马尔科夫模型.
主要成果:
- 新的CTAS数据集是基于中国领先的社交媒体平台微博.
- 该数据集具有迄今为止最广泛的情感结构标签.
- 提出的最大率马尔科夫模型表现出比基线模型更好的性能.
结论:
- 推出的基于微博的CTAS数据集解决了情感AI资源的稀缺问题.
- 综合标签和先进模型为该领域做出了重大贡献.
- 这项工作促进了对中国社交媒体文本情感理解的进一步研究.


