一个专题的VAEGAN-IHMM方法用于自动故事细分
Jia Yu1,2, Huiling Peng1, Guoqiang Wang1
1School of Computer and Information Engineering, Luoyang Institute of Science and Technology, China.
Mathematical biosciences and engineering : MBE
|August 23, 2024
概括
这项研究介绍了一种新的局部变异自编码生成对立网络 (VAEGAN) 与无限隐藏马尔科夫模型 (IHMM) 结合,以改进故事细分. 该方法增强了主题表示,并自动确定主题的数量,优于传统方法.
科学领域:
- 自然语言处理自然语言处理.
- 机器学习 机器学习
- 人工智能的人工智能
背景情况:
- 有效的故事细分依赖于功能表示中的丰富主题信息.
- 故事细分的传统隐藏马尔科夫模型 (HMM) 需要手动设置主题数量,这通常是未知的.
- 变量自编码器生成对抗网络 (VAEGAN) 通过结合VAE和GAN来实现复杂和多样化的数据表示,提供先进的特征学习.
研究的目的:
- 使用改进的特征表示来开发先进的故事细分方法.
- 为了解决手动设置HMM中故事细分状态数量的局限性.
- 增强主题域表示学习,以实现更准确的文档分割.
主要方法:
- 利用一个主题分类器来监督VAEGAN对主题域表示的培训.
- 实现了一个无限隐藏的马尔科夫模型 (IHMM) 与一个HDP先用于自动状态数推理.
- 采用了Blocked Gibbs采样器来标记主题类的状态,并确定主题变化的故事界限.
主要成果:
- 与传统的HMM相比,拟议的主题VAEGAN-IHMM方法显著改善了故事细分性能.
- 在TDT2语料库上获得了最新的结果,用于故事细分任务.
- 证明了将VAEGAN用于特征学习和IHMM用于主题建模的有效性.
结论:
- VAEGAN-IHMM框架为故事细分提供了一个强大的,自动化的解决方案.
- 这种方法提高了识别文档内主题转移的准确性和效率.
- 这些发现表明了推动自然语言处理任务的有希望的方向,这些任务需要主题意识的文档分析.


